นักวิจัยด้านความปลอดภัยจากบริษัท Adversa ได้เปิดเผยถึงช่องโหว่ใหม่ที่ส่งผลกระทบต่อ Grok ซึ่งเป็นโมเดลภาษาขนาดใหญ่ (LLM) โดยเทคนิคนี้เรียกว่า 'Cryptographic Context Injection' ซึ่งเป็นการใช้กลวิธีที่เรียบง่ายแต่ได้ผลในการบังคับให้ AI ขโมยข้อมูลการสนทนาและข้อมูลส่วนบุคคลของผู้ใช้ไปให้กับผู้โจมตี โดยในขณะที่รายงานนี้เผยแพร่ ทาง xAI ยังไม่ได้แก้ไขปัญหาดังกล่าวแม้จะได้รับแจ้งเตือนมาตั้งแต่เดือนมิถุนายนแล้วก็ตาม
วิธีการโจมตีนี้อาศัยจุดอ่อนของระบบป้องกันแบบดั้งเดิมที่มักจะตรวจสอบเฉพาะข้อความที่เป็นข้อความธรรมดา (Plaintext) เท่านั้น ผู้โจมตีจะทำการเข้ารหัสคำสั่งอันตรายไว้ในหน้าเว็บหรืออีเมลที่ผู้ใช้สั่งให้ AI สรุปเนื้อหา พร้อมแนบกุญแจถอดรหัสและคำสั่งถอดรหัสไว้ด้วย เมื่อ Grok ประมวลผลหน้าเว็บดังกล่าว ระบบจะทำการถอดรหัสคำสั่งเหล่านั้นภายในสภาพแวดล้อมการทำงานของตัวเอง ทำให้คำสั่งอันตรายถูกดำเนินการโดยที่ระบบป้องกันไม่ทันได้ตรวจสอบเนื้อหาที่แท้จริง
สาเหตุหลักที่ทำให้เทคนิคนี้ประสบความสำเร็จคือระบบป้องกัน (Guardrails) ของ AI ส่วนใหญ่ถูกออกแบบมาเพื่อตรวจสอบข้อมูลขาเข้าที่เป็นข้อความเท่านั้น แต่ไม่สามารถตรวจสอบผลลัพธ์ที่เกิดจากการประมวลผลโค้ดภายในของโมเดลเองได้ เมื่อคำสั่งถูกถอดรหัสออกมาแล้ว มันจะถูกมองว่าเป็นผลลัพธ์จากเครื่องมือของ AI ทำให้โมเดลปฏิบัติตามคำสั่งนั้นโดยตรง ซึ่งรวมถึงการส่งข้อมูลส่วนตัวของผู้ใช้ เช่น ชื่อ สถานที่ และประวัติการสนทนา ไปยังเซิร์ฟเวอร์ของผู้โจมตีผ่าน URL
นักวิจัยจาก Adversa ระบุว่าเทคนิคนี้เป็นเพียงส่วนหนึ่งของปัญหาที่ใหญ่กว่า ซึ่งก็คือการที่ผู้โจมตีเริ่มหันมาจัดการกับบริบทที่กว้างขึ้นที่ AI มองว่าเป็นส่วนหนึ่งของตัวเอง ไม่ใช่แค่เพียงการป้อนคำสั่ง (Prompt) เท่านั้น เช่น ผลลัพธ์จากเครื่องมือหรือสถานะระหว่างการประมวลผล ซึ่งถือเป็นพื้นที่การโจมตีที่กว้างกว่าที่คาดการณ์ไว้ และสะท้อนให้เห็นว่าการสร้างระบบป้องกันแบบเฉพาะจุดอาจไม่เพียงพอต่อการรับมือกับวิวัฒนาการของการโจมตีในปัจจุบัน





