ปัจจุบัน 'Context window' หรือขนาดของข้อมูลที่โมเดลภาษาขนาดใหญ่ (LLM) ประมวลผลได้พร้อมกัน กำลังกลายเป็นคอขวดสำคัญในการคำนวณ ยิ่งปัญญาประดิษฐ์ทำงานนานขึ้น ข้อมูลและเอกสารที่ต้องใช้ก็ยิ่งสะสมมากขึ้น ส่งผลให้ระบบต้องใช้หน่วยความจำและพลังประมวลผลมหาศาล ซึ่งวิธีการแก้ไขที่มีอยู่เดิมมักทำให้ความแม่นยำของโมเดลลดลง หรือไม่สามารถเพิ่มความเร็วในการใช้งานจริงได้
ล่าสุด ทีมนักวิจัยจากสถาบันชั้นนำ อาทิ NYU, Columbia, Princeton, Harvard และ Lawrence Livermore National Laboratory ได้เปิดตัวโมเดลตระกูล 'Latent Context Language Models' หรือ LCLMs ซึ่งเป็นโมเดลบีบอัดข้อมูลบริบทขาเข้าก่อนจะส่งไปถึงขั้นตอนถอดรหัส (Decoder) โดยได้ปล่อยโมเดลนี้เป็นโอเพนซอร์สบนแพลตฟอร์ม HuggingFace แล้ว
ความพิเศษของ LCLMs คือการบีบอัดโทเค็นตั้งแต่ขั้นตอนแรกก่อนการทำ Decoder Prefill ต่างจากวิธี KV cache compression แบบเดิมที่ต้องโหลดข้อมูลเต็มรูปแบบก่อนแล้วค่อยตัดออก ส่งผลให้ LCLMs สามารถทำงานได้เร็วขึ้นถึง 8.8 เท่าในการทดสอบ RULER long-context benchmark ที่ระดับการบีบอัด 16 เท่า
การพัฒนาในครั้งนี้ทำให้นักพัฒนาสามารถรันโมเดลภาษาที่รองรับบริบทยาวๆ ได้ในราคาที่ถูกลงและรวดเร็วยิ่งขึ้น โดยผลการทดสอบชี้ว่า ที่ระดับการบีบอัดบริบท 4 เท่า โมเดลยังคงรักษาความแม่นยำไว้ได้สูงถึง 91% ซึ่งเหมาะสมอย่างยิ่งต่อการนำไปใช้งานในระบบโปรดักชันจริงอย่างไร้รอยต่อ





