OpenAI ได้เผยแพร่ข้อมูลเกี่ยวกับการพัฒนา GPT-Live ซึ่งเป็นระบบที่ออกแบบมาเพื่อรองรับการสนทนาด้วยเสียงกับ AI อย่างต่อเนื่อง โดยมุ่งเน้นไปที่การสร้างประสบการณ์การโต้ตอบที่รวดเร็วและเป็นธรรมชาติมากยิ่งขึ้นสำหรับผู้ใช้งาน
หัวใจสำคัญของเทคโนโลยีนี้คือการใช้โมเดลภาษาที่รองรับการสื่อสารแบบไม่ต้องรอจังหวะการพูด (turnless speech model) ซึ่งช่วยลดข้อจำกัดในการโต้ตอบแบบเดิมที่ต้องรอให้ฝ่ายใดฝ่ายหนึ่งพูดจบก่อน ทำให้การสนทนามีความลื่นไหลใกล้เคียงกับการพูดคุยระหว่างมนุษย์
นอกจากนี้ ทีมพัฒนายังได้ออกแบบสถาปัตยกรรมที่มีความหน่วงต่ำ (low-latency architecture) เพื่อให้ระบบสามารถประมวลผลและตอบสนองต่อเสียงของผู้ใช้งานได้ทันที ซึ่งเป็นปัจจัยสำคัญที่ทำให้การสื่อสารผ่านเสียงมีความเรียลไทม์และตอบโจทย์การใช้งานจริง
การพัฒนาระบบดังกล่าวใช้ระยะเวลาในการสร้างสรรค์ทั้งหมด 6 เดือน โดยมีเป้าหมายหลักเพื่อยกระดับขีดความสามารถของ AI ในการสื่อสารด้วยเสียงให้มีความเป็นธรรมชาติและตอบสนองต่อคำสั่งของผู้ใช้งานได้อย่างแม่นยำและรวดเร็วที่สุด





