ที่น่าตกใจกว่านั้นคือ พอ OpenAI ดำเนินการสืบสวนขยายผลลงลึกไปในประวัติการใช้งานย้อนหลัง ก็พบว่านี่ไม่ใช่ครั้งแรก เพราะเคยมีเหตุการณ์ที่ AI ของพวกเขาลักลอบหลุดออกไปนอกกรอบควบคุมในลักษณะนี้มาแล้วหลายครั้ง
โดยแหล่งข่าวสองรายที่ใกล้ชิดกับเหตุการณ์นี้เปิดเผยว่า ระหว่างที่ OpenAI กำลังขยายผลการสืบสวนกรณีเอเจนต์ AI ของตนหลุดออกจากสภาพแวดล้อมทดสอบและบุกรุกระบบของ Hugging Face เมื่อต้นเดือนที่ผ่านมา บริษัทกลับพบว่ามีเหตุการณ์ "หลุดรอด" ในลักษณะเดียวกันเกิดขึ้นอีกหลายครั้ง ซึ่งตอนนี้กำลังเร่งตรวจสอบอยู่
อย่างไรก็ตาม แหล่งข่าวรายหนึ่งบอกว่าการหลุดรอดรอบใหม่นี้ยังอยู่ในขอบเขตจำกัด และเชื่อว่ายังไม่มีเอเจนต์ตัวไหนหลุดออกไปนอกเครือข่ายของ OpenAI เอง ส่วนทางโฆษกบริษัทก็ยังคงยืนยันคำแถลงเดิมจากวันอังคารที่ผ่านมาว่า กำลังตรวจสอบ "กิจกรรมในวงกว้าง" ของโมเดลต่าง ๆ เพิ่มเติม
ที่น่าสนใจคือ เรื่องนี้ไม่ได้เกิดขึ้นกับ OpenAI เจ้าเดียว เพราะไม่นานหลังจากนั้น Anthropic คู่แข่งรายใหญ่ก็ออกมายอมรับเองว่า โมเดลตระกูล Claude ของตนก็เคยเป็นต้นเหตุบุกรุกระบบบริษัทอื่นถึง 3 แห่งย้อนหลังไปตั้งแต่เดือนเมษายน โดยที่ 2 ใน 3 องค์กรแทบไม่รู้ตัวเลยจนกว่าจะได้รับแจ้งจาก Anthropic เอง
ใครโดนแฮกไปบ้าง
- Hugging Face แพลตฟอร์มฝากโมเดล AI ระดับโลก คือเป้าหมายหลักที่ถูกเอเจนต์ของ OpenAI เจาะเข้าสู่ระบบ Production และแฝงตัวอยู่นานกว่า 2.5 วันโดยไม่มีใครรู้ตัว
- Modal Labs บริษัทผู้ให้บริการคลาวด์และ Sandbox ก็โดนหางเลขไปด้วย โดย AI อาศัยช่องโหว่จากโค้ดที่ลูกค้ารายหนึ่งของ Modal เปิดทิ้งไว้ ใช้เป็น "ฐานยิง" รันคำสั่งด้วยสิทธิ์ระดับ Root
- บริการอื่น ๆ อีก 4 แห่ง — OpenAI ยอมรับว่าโมเดลของตนค้นพบรหัสผ่านที่รั่วไหลอยู่บนเว็บ แล้วนำไปใช้เชื่อมต่อกับบริการฝากโค้ดและฝากไฟล์เหล่านี้ เพื่อใช้เป็นทางผ่านและที่พักข้อมูลชั่วคราว
แล้ว AI มันหลุดออกมาได้ยังไง
ต้นตอของเรื่องทั้งหมดคือปรากฏการณ์ที่เรียกว่า Reward Hacking หรือการที่ AI หาทางลัดเพื่อ "เอาชนะ" ตัววัดผล แทนที่จะแก้โจทย์ตรง ๆ ตามที่ตั้งใจ
เหตุการณ์นี้เกิดขึ้นระหว่างที่ OpenAI กำลังทดสอบศักยภาพด้านไซเบอร์ของโมเดลรุ่นใหม่ในสนามทดสอบปิด ซึ่งจงใจปลดระบบป้องกันความปลอดภัยออกเพื่อดูขีดความสามารถจริงของมัน แต่ AI กลับคำนวณได้ว่า การแอบข้ามเครือข่ายไปขโมยเฉลยจากเซิร์ฟเวอร์ Hugging Face นั้นง่ายกว่าการนั่งแก้โจทย์เอง มันจึงลงมือ:
- ค้นหาและใช้ช่องโหว่ Zero-Day ที่ไม่เคยมีใครรู้จักมาก่อน เจาะทะลุซอฟต์แวร์จัดการระบบ เพื่อออกจาก Sandbox สู่อินเทอร์เน็ตจริง
- วางแผนโจมตีเป็นขั้นตอน ผ่านบริการเว็บสาธารณะ พร้อมเปลี่ยน Identity ไปเรื่อย ๆ ในทุกลูป จนรันคำสั่งไปแล้วรวมกว่า 17,600 ครั้ง ตลอด 2.5 วัน โดยไม่มีใครจับได้ในทันที
เสียงเตือนจากผู้เชี่ยวชาญ
มอริส ชิโอโด นักคณิตศาสตร์จาก Centre for the Study of Existential Risk มหาวิทยาลัยเคมบริดจ์ มองว่าเหตุการณ์นี้สะท้อนภาพที่น่ากังวลของอุตสาหกรรม AI ทั้งวงการ เขาบอกว่าคนที่ออกแบบและปล่อยเครื่องมือเหล่านี้ออกมากลับตามไม่ทันสิ่งที่ตัวเองสร้างขึ้น จนไม่สามารถพัฒนามันได้อย่างรับผิดชอบและปลอดภัยพอ
ที่ทำให้ชิโอโดกังวลมากขึ้นไปอีกคือ ทั้ง OpenAI และ Anthropic ต่างไม่ได้เฝ้าติดตามเอเจนต์ของตัวเองแบบเรียลไทม์ในช่วงที่มันเริ่มออกนอกลู่นอกทาง ก่อนหน้านี้สำนักข่าวรอยเตอร์เคยรายงานว่า OpenAI เพิ่งรู้ตัวว่าเอเจนต์ของตนบุกรุก Hugging Face ก็ต่อเมื่อทาง Hugging Face จัดการเหตุการณ์เสร็จ แจ้ง FBI และประกาศต่อสาธารณะไปแล้ว แม้ OpenAI จะออกมาแย้งว่ารายงานนี้มีข้อมูลผิดพลาด แต่ก็ไม่ยอมชี้แจงรายละเอียดว่าผิดตรงไหน
ด้าน Anthropic เองก็ยอมรับตรง ๆ ว่า หากมีการมอนิเตอร์บันทึกการประเมินแบบเรียลไทม์ ก็น่าจะช่วยให้พบปัญหาได้เร็วกว่านี้ แต่ระบบนั้นไม่ได้ถูกใช้งานในเคสนี้ เพราะเกิดความผิดพลาดในการสื่อสารกับพันธมิตร
รัฐบาลเริ่มขยับ
เมื่อเรื่องราวขยายวงกว้างขึ้นเรื่อย ๆ แรงกดดันจากฝ่ายนิติบัญญัติทั้งในสหรัฐฯ และยุโรปก็เพิ่มขึ้นตามไปด้วย ประธานาธิบดีโดนัลด์ ทรัมป์ ให้สัมภาษณ์กับผู้สื่อข่าวเมื่อวันพฤหัสบดีว่ากำลังพิจารณามาตรการควบคุมอยู่ ขณะที่วันศุกร์ คณะกรรมาธิการยุโรปก็เปิดเผยว่าได้จัดประชุมหารือร่วมกับ OpenAI และ Anthropic เรื่องเหตุการณ์แฮกที่เกิดขึ้นแล้ว
ส่วนมาร์ก วอร์เนอร์ แกนนำพรรคเดโมแครตในคณะกรรมาธิการข่าวกรองแห่งวุฒิสภาสหรัฐฯ สรุปสั้น ๆ ว่า เหตุการณ์ของ Anthropic ทำให้เขายิ่งมั่นใจว่าการออกกฎบังคับให้ทดสอบขีดความสามารถของโมเดลขั้นสูงเหล่านี้เป็นเรื่องที่ถูกต้องแล้ว