รางวัลฮัตเตอร์ การแข่งขันบีบอัดข้อมูลเพื่อพัฒนาปัญญาประดิษฐ์
สรุปใจความสำคัญ
- ก่อตั้งโดย Marcus Hutter เพื่อกระตุ้นการวิจัย AI ผ่านการบีบอัดข้อมูล
- ใช้ชุดข้อมูล enwik9 ขนาด 1 GB ซึ่งเป็นส่วนหนึ่งของวิกิพีเดียภาษาอังกฤษ
- มอบเงินรางวัล 5,000 ยูโร ต่อการลดขนาดไฟล์ลงได้ทุกๆ 1%
- กำหนดให้ผู้ชนะต้องเปิดเผยซอร์สโค้ดภายใต้สัญญาอนุญาตซอฟต์แวร์เสรีตั้งแต่ปี 2017
รางวัลฮัตเตอร์ (Hutter Prize) คือรางวัลเงินสดที่ก่อตั้งโดย มาร์คัส ฮัตเตอร์ (Marcus Hutter) โดยมีวัตถุประสงค์เพื่อส่งเสริมการวิจัยในด้านปัญญาประดิษฐ์ (Artificial Intelligence หรือ AI) ผ่านการแข่งขันบีบอัดข้อมูลในไฟล์ข้อความภาษาอังกฤษขนาดใหญ่ ซึ่งตั้งอยู่บนสมมติฐานที่ว่าความสามารถในการบีบอัดข้อมูลที่มีประสิทธิภาพสูงสุดมีความสัมพันธ์โดยตรงกับความสามารถในการทำนายและทำความเข้าใจข้อมูล ซึ่งเป็นหัวใจสำคัญของปัญญาประดิษฐ์
เป้าหมายและแนวคิดทางทฤษฎี
ผู้จัดงานเชื่อว่าปัญหาการบีบอัดข้อความและการสร้างปัญญาประดิษฐ์เป็นปัญหาที่เทียบเท่ากัน โดยมีพื้นฐานมาจากแนวคิดทางคณิตศาสตร์และทฤษฎีข้อมูล ดังนี้:
- ความสัมพันธ์ระหว่างการบีบอัดและ AI: การบีบอัดข้อมูลธรรมชาติ (Natural Language) ให้มีขนาดเล็กที่สุดจำเป็นต้องใช้ความรู้เกี่ยวกับโลกความเป็นจริงจำนวนมาก เพื่อให้โปรแกรมสามารถทำนายได้ว่าตัวอักษรหรือคำใดมีโอกาสเกิดขึ้นถัดไปในลำดับข้อความ ซึ่งกระบวนการทำนายนี้เป็นกระบวนการเดียวกับที่ AI ใช้ในการประมวลผลภาษา
- ความซับซ้อนของโคลโมโกรอฟ (Kolmogorov Complexity): มาร์คัส ฮัตเตอร์ ได้พิสูจน์ว่าพฤติกรรมที่เหมาะสมที่สุดของตัวแทนที่แสวงหาเป้าหมายในสภาพแวดล้อมที่คำนวณได้ คือการคาดเดาว่าสภาพแวดล้อมนั้นถูกควบคุมโดยโปรแกรมที่สั้นที่สุดที่สอดคล้องกับข้อมูลที่มีอยู่ อย่างไรก็ตาม ความซับซ้อนของโคลโมโกรอฟนั้นไม่สามารถคำนวณได้ในทางปฏิบัติ (Non-computable)
- ข้อจำกัดทางเทคนิค: ในกรณีที่จำกัด (AIXItl) ซึ่งจำกัดเวลา (t) และพื้นที่ (l) จะสามารถคำนวณคำตอบได้ แต่ยังคงเป็นเรื่องที่ยากเกินกว่าจะจัดการได้ในทางปฏิบัติ (Intractable)
ด้วยเหตุนี้ ความก้าวหน้าในการบีบอัดข้อมูลจึงถูกมองว่าเป็นความก้าวหน้าในการพัฒนา AI ซึ่งเทียบเท่ากับการพยายามทำให้ AI ผ่านการทดสอบทัวริง (Turing Test)
กฎกติกาและการดำเนินงาน
การแข่งขันนี้เปิดกว้างสำหรับทุกคน โดยมีรายละเอียดและเงื่อนไขดังนี้:
ชุดข้อมูลที่ใช้
เดิมทีการแข่งขันเริ่มต้นในปี 2006 โดยใช้ไฟล์ enwik8 ซึ่งมีขนาด 100 เมกะไบต์ ต่อมาในวันที่ 21 กุมภาพันธ์ 2020 ได้มีการขยายขนาดชุดข้อมูลเป็น 10 เท่า โดยเปลี่ยนมาใช้ไฟล์ enwik9 ซึ่งมีขนาด 1 กิกะไบต์ (ประกอบด้วย 109 ไบต์แรกของวิกิพีเดียภาษาอังกฤษเวอร์ชันเฉพาะ) ซึ่งเป็นส่วนหนึ่งของเกณฑ์มาตรฐานการบีบอัดข้อความขนาดใหญ่ (Large Text Compression Benchmark - LTCB)
เงื่อนไขการรับรางวัล
รางวัลจะถูกมอบให้สำหรับการปรับปรุงประสิทธิภาพการบีบอัดข้อมูลให้เล็กลง โดยมีเกณฑ์ดังนี้:
- เงินรางวัล 5,000 ยูโร สำหรับการลดขนาดไฟล์ลงได้ทุกๆ 1% จากสถิติเดิม
- งบประมาณรวมของเงินรางวัลสูงสุดอยู่ที่ 500,000 ยูโร
- ผู้เข้าแข่งขันต้องส่งโปรแกรมบีบอัดและโปรแกรมคลายบีบอัด (Decompressor) ที่สามารถคืนค่าไฟล์ enwik9 ได้อย่างถูกต้องสมบูรณ์
- ขนาดรวมของไฟล์บีบอัดและโปรแกรมคลายบีบอัด (ในรูปแบบ Win32 หรือ Linux executable) ต้องมีขนาดไม่เกิน 99% ของรายการที่ชนะรางวัลครั้งก่อนหน้า
ข้อกำหนดด้านความโปร่งใส
เพื่อให้สามารถตรวจสอบได้อย่างเป็นอิสระ ผลงานที่ส่งเข้าประกวดต้องได้รับการเผยแพร่ และมีระยะเวลารอคอย 30 วันสำหรับการแสดงความคิดเห็นสาธารณะ นอกจากนี้ ตั้งแต่ปี 2017 เป็นต้นมา กฎระเบียบได้กำหนดให้ต้องเปิดเผยซอร์สโค้ดภายใต้สัญญาอนุญาตซอฟต์แวร์เสรี (Free Software License) เพื่อป้องกันไม่ให้แนวคิดทางเทคนิคที่สำคัญสูญหายไปโดยไม่มีการเผยแพร่
คำถามที่พบบ่อย
รางวัลฮัตเตอร์แตกต่างจากการบีบอัดข้อมูลทั่วไปอย่างไร?
รางวัลฮัตเตอร์ไม่ได้มุ่งเน้นเพียงแค่การลดขนาดไฟล์ แต่มีเป้าหมายเพื่อพัฒนาอัลกอริทึมที่สามารถ 'ทำนาย' ข้อมูลได้แม่นยำขึ้น ซึ่งเป็นพื้นฐานสำคัญของการพัฒนาปัญญาประดิษฐ์ (AI)
ทำไมต้องใช้ข้อมูลจากวิกิพีเดีย?
เพราะวิกิพีเดียเป็นแหล่งข้อมูลภาษาธรรมชาติที่มีความหลากหลายและครอบคลุมความรู้ทั่วไปของโลก ซึ่งเป็นบททดสอบที่ท้าทายสำหรับ AI ในการทำความเข้าใจโครงสร้างภาษาและความรู้รอบตัว
โมเดลอย่าง ChatGPT สามารถนำมาใช้ชนะรางวัลนี้ได้หรือไม่?
แม้ว่าโมเดลภาษาขนาดใหญ่ (LLM) จะมีความสามารถในการทำนายคำสูง แต่โมเดลเหล่านี้มักใช้ทรัพยากรในการคำนวณและพื้นที่จัดเก็บข้อมูลมหาศาล ซึ่งอาจเกินกว่าข้อกำหนดด้านทรัพยากรที่การแข่งขันกำหนดไว้

