← กลับไปยังบทความทั้งหมด

รางวัลฮัตเตอร์ การแข่งขันบีบอัดข้อมูลเพื่อพัฒนาปัญญาประดิษฐ์

สรุปใจความสำคัญ

  • ก่อตั้งโดย Marcus Hutter เพื่อกระตุ้นการวิจัย AI ผ่านการบีบอัดข้อมูล
  • ใช้ชุดข้อมูล enwik9 ขนาด 1 GB ซึ่งเป็นส่วนหนึ่งของวิกิพีเดียภาษาอังกฤษ
  • มอบเงินรางวัล 5,000 ยูโร ต่อการลดขนาดไฟล์ลงได้ทุกๆ 1%
  • กำหนดให้ผู้ชนะต้องเปิดเผยซอร์สโค้ดภายใต้สัญญาอนุญาตซอฟต์แวร์เสรีตั้งแต่ปี 2017

รางวัลฮัตเตอร์ (Hutter Prize) คือรางวัลเงินสดที่ก่อตั้งโดย มาร์คัส ฮัตเตอร์ (Marcus Hutter) โดยมีวัตถุประสงค์เพื่อส่งเสริมการวิจัยในด้านปัญญาประดิษฐ์ (Artificial Intelligence หรือ AI) ผ่านการแข่งขันบีบอัดข้อมูลในไฟล์ข้อความภาษาอังกฤษขนาดใหญ่ ซึ่งตั้งอยู่บนสมมติฐานที่ว่าความสามารถในการบีบอัดข้อมูลที่มีประสิทธิภาพสูงสุดมีความสัมพันธ์โดยตรงกับความสามารถในการทำนายและทำความเข้าใจข้อมูล ซึ่งเป็นหัวใจสำคัญของปัญญาประดิษฐ์

เป้าหมายและแนวคิดทางทฤษฎี

ผู้จัดงานเชื่อว่าปัญหาการบีบอัดข้อความและการสร้างปัญญาประดิษฐ์เป็นปัญหาที่เทียบเท่ากัน โดยมีพื้นฐานมาจากแนวคิดทางคณิตศาสตร์และทฤษฎีข้อมูล ดังนี้:

  • ความสัมพันธ์ระหว่างการบีบอัดและ AI: การบีบอัดข้อมูลธรรมชาติ (Natural Language) ให้มีขนาดเล็กที่สุดจำเป็นต้องใช้ความรู้เกี่ยวกับโลกความเป็นจริงจำนวนมาก เพื่อให้โปรแกรมสามารถทำนายได้ว่าตัวอักษรหรือคำใดมีโอกาสเกิดขึ้นถัดไปในลำดับข้อความ ซึ่งกระบวนการทำนายนี้เป็นกระบวนการเดียวกับที่ AI ใช้ในการประมวลผลภาษา
  • ความซับซ้อนของโคลโมโกรอฟ (Kolmogorov Complexity): มาร์คัส ฮัตเตอร์ ได้พิสูจน์ว่าพฤติกรรมที่เหมาะสมที่สุดของตัวแทนที่แสวงหาเป้าหมายในสภาพแวดล้อมที่คำนวณได้ คือการคาดเดาว่าสภาพแวดล้อมนั้นถูกควบคุมโดยโปรแกรมที่สั้นที่สุดที่สอดคล้องกับข้อมูลที่มีอยู่ อย่างไรก็ตาม ความซับซ้อนของโคลโมโกรอฟนั้นไม่สามารถคำนวณได้ในทางปฏิบัติ (Non-computable)
  • ข้อจำกัดทางเทคนิค: ในกรณีที่จำกัด (AIXItl) ซึ่งจำกัดเวลา (t) และพื้นที่ (l) จะสามารถคำนวณคำตอบได้ แต่ยังคงเป็นเรื่องที่ยากเกินกว่าจะจัดการได้ในทางปฏิบัติ (Intractable)

ด้วยเหตุนี้ ความก้าวหน้าในการบีบอัดข้อมูลจึงถูกมองว่าเป็นความก้าวหน้าในการพัฒนา AI ซึ่งเทียบเท่ากับการพยายามทำให้ AI ผ่านการทดสอบทัวริง (Turing Test)

กฎกติกาและการดำเนินงาน

การแข่งขันนี้เปิดกว้างสำหรับทุกคน โดยมีรายละเอียดและเงื่อนไขดังนี้:

ชุดข้อมูลที่ใช้

เดิมทีการแข่งขันเริ่มต้นในปี 2006 โดยใช้ไฟล์ enwik8 ซึ่งมีขนาด 100 เมกะไบต์ ต่อมาในวันที่ 21 กุมภาพันธ์ 2020 ได้มีการขยายขนาดชุดข้อมูลเป็น 10 เท่า โดยเปลี่ยนมาใช้ไฟล์ enwik9 ซึ่งมีขนาด 1 กิกะไบต์ (ประกอบด้วย 109 ไบต์แรกของวิกิพีเดียภาษาอังกฤษเวอร์ชันเฉพาะ) ซึ่งเป็นส่วนหนึ่งของเกณฑ์มาตรฐานการบีบอัดข้อความขนาดใหญ่ (Large Text Compression Benchmark - LTCB)

เงื่อนไขการรับรางวัล

รางวัลจะถูกมอบให้สำหรับการปรับปรุงประสิทธิภาพการบีบอัดข้อมูลให้เล็กลง โดยมีเกณฑ์ดังนี้:

  • เงินรางวัล 5,000 ยูโร สำหรับการลดขนาดไฟล์ลงได้ทุกๆ 1% จากสถิติเดิม
  • งบประมาณรวมของเงินรางวัลสูงสุดอยู่ที่ 500,000 ยูโร
  • ผู้เข้าแข่งขันต้องส่งโปรแกรมบีบอัดและโปรแกรมคลายบีบอัด (Decompressor) ที่สามารถคืนค่าไฟล์ enwik9 ได้อย่างถูกต้องสมบูรณ์
  • ขนาดรวมของไฟล์บีบอัดและโปรแกรมคลายบีบอัด (ในรูปแบบ Win32 หรือ Linux executable) ต้องมีขนาดไม่เกิน 99% ของรายการที่ชนะรางวัลครั้งก่อนหน้า

ข้อกำหนดด้านความโปร่งใส

เพื่อให้สามารถตรวจสอบได้อย่างเป็นอิสระ ผลงานที่ส่งเข้าประกวดต้องได้รับการเผยแพร่ และมีระยะเวลารอคอย 30 วันสำหรับการแสดงความคิดเห็นสาธารณะ นอกจากนี้ ตั้งแต่ปี 2017 เป็นต้นมา กฎระเบียบได้กำหนดให้ต้องเปิดเผยซอร์สโค้ดภายใต้สัญญาอนุญาตซอฟต์แวร์เสรี (Free Software License) เพื่อป้องกันไม่ให้แนวคิดทางเทคนิคที่สำคัญสูญหายไปโดยไม่มีการเผยแพร่

คำถามที่พบบ่อย

รางวัลฮัตเตอร์แตกต่างจากการบีบอัดข้อมูลทั่วไปอย่างไร?

รางวัลฮัตเตอร์ไม่ได้มุ่งเน้นเพียงแค่การลดขนาดไฟล์ แต่มีเป้าหมายเพื่อพัฒนาอัลกอริทึมที่สามารถ 'ทำนาย' ข้อมูลได้แม่นยำขึ้น ซึ่งเป็นพื้นฐานสำคัญของการพัฒนาปัญญาประดิษฐ์ (AI)

ทำไมต้องใช้ข้อมูลจากวิกิพีเดีย?

เพราะวิกิพีเดียเป็นแหล่งข้อมูลภาษาธรรมชาติที่มีความหลากหลายและครอบคลุมความรู้ทั่วไปของโลก ซึ่งเป็นบททดสอบที่ท้าทายสำหรับ AI ในการทำความเข้าใจโครงสร้างภาษาและความรู้รอบตัว

โมเดลอย่าง ChatGPT สามารถนำมาใช้ชนะรางวัลนี้ได้หรือไม่?

แม้ว่าโมเดลภาษาขนาดใหญ่ (LLM) จะมีความสามารถในการทำนายคำสูง แต่โมเดลเหล่านี้มักใช้ทรัพยากรในการคำนวณและพื้นที่จัดเก็บข้อมูลมหาศาล ซึ่งอาจเกินกว่าข้อกำหนดด้านทรัพยากรที่การแข่งขันกำหนดไว้