ข่าว AI และเทคโนโลยี

ปฏิวัติวงการ AI! นักวิจัยเปิดตัว LCLMs บีบอัดบริบท LLM ได้ 16 เท่า โดยไม่เสียความแม่นยำ

ทีมนักวิจัยจากสถาบันชั้นนำร่วมกันพัฒนา Latent Context Language Models (LCLMs) นวัตกรรมบีบอัดข้อมูลบริบทขาเข้าของ LLM ได้สูงสุดถึง 16 เท่า ช่วยให้การประมวลผลเร็วขึ้น 8.8 เท่าและประหยัดพลังงานมากขึ้นโดยไม่สูญเสียความแม่นยำในการใช้งานจริง

ปฏิวัติวงการ AI! นักวิจัยเปิดตัว LCLMs บีบอัดบริบท LLM ได้ 16 เท่า โดยไม่เสียความแม่นยำ

ฟังบทความ

ปัจจุบัน 'Context window' หรือขนาดของข้อมูลที่โมเดลภาษาขนาดใหญ่ (LLM) ประมวลผลได้พร้อมกัน กำลังกลายเป็นคอขวดสำคัญในการคำนวณ ยิ่งปัญญาประดิษฐ์ทำงานนานขึ้น ข้อมูลและเอกสารที่ต้องใช้ก็ยิ่งสะสมมากขึ้น ส่งผลให้ระบบต้องใช้หน่วยความจำและพลังประมวลผลมหาศาล ซึ่งวิธีการแก้ไขที่มีอยู่เดิมมักทำให้ความแม่นยำของโมเดลลดลง หรือไม่สามารถเพิ่มความเร็วในการใช้งานจริงได้

ล่าสุด ทีมนักวิจัยจากสถาบันชั้นนำ อาทิ NYU, Columbia, Princeton, Harvard และ Lawrence Livermore National Laboratory ได้เปิดตัวโมเดลตระกูล 'Latent Context Language Models' หรือ LCLMs ซึ่งเป็นโมเดลบีบอัดข้อมูลบริบทขาเข้าก่อนจะส่งไปถึงขั้นตอนถอดรหัส (Decoder) โดยได้ปล่อยโมเดลนี้เป็นโอเพนซอร์สบนแพลตฟอร์ม HuggingFace แล้ว

ความพิเศษของ LCLMs คือการบีบอัดโทเค็นตั้งแต่ขั้นตอนแรกก่อนการทำ Decoder Prefill ต่างจากวิธี KV cache compression แบบเดิมที่ต้องโหลดข้อมูลเต็มรูปแบบก่อนแล้วค่อยตัดออก ส่งผลให้ LCLMs สามารถทำงานได้เร็วขึ้นถึง 8.8 เท่าในการทดสอบ RULER long-context benchmark ที่ระดับการบีบอัด 16 เท่า

การพัฒนาในครั้งนี้ทำให้นักพัฒนาสามารถรันโมเดลภาษาที่รองรับบริบทยาวๆ ได้ในราคาที่ถูกลงและรวดเร็วยิ่งขึ้น โดยผลการทดสอบชี้ว่า ที่ระดับการบีบอัดบริบท 4 เท่า โมเดลยังคงรักษาความแม่นยำไว้ได้สูงถึง 91% ซึ่งเหมาะสมอย่างยิ่งต่อการนำไปใช้งานในระบบโปรดักชันจริงอย่างไร้รอยต่อ