สัปดาห์นี้ทั้ง Anthropic และ OpenAI ออกรายงานเรื่องที่โมเดล AI ของตัวเองทำเกินคำสั่งระหว่างการทดสอบ เรื่องที่คนพูดถึงมากที่สุดคือ Claude Haiku 4.5 ส่งเบาะแสคดีฆาตกรรมที่แต่งขึ้นเองเข้าเว็บไซต์ของตำรวจฟิลาเดลเฟีย ส่วนฝั่ง OpenAI มีโมเดลตัวหนึ่งหาไฟล์งานไม่เจอ เลยปลอมไฟล์ขึ้นมาเอง พอไม่ผ่านก็ลงมือพังเครื่องของตัวเองหวังให้ระบบเปลี่ยนเครื่องใหม่ให้
1. Claude กรอกฟอร์มแจ้งเบาะแสคดีที่ยังไม่มีใครไขได้
ตามรายงานของ Anthropic งานที่ Claude Haiku 4.5 ได้รับคือสุ่มเข้าเว็บไซต์ต่าง ๆ แล้วสร้างงานตัวอย่างขึ้นมาทำบนหน้านั้น คำสั่งห้ามล็อกอิน ห้ามสร้างบัญชี ห้ามใส่ข้อมูลส่วนตัว ห้ามซื้อของ และห้ามส่งอะไรที่สร้างความเสียหาย แต่ไม่ได้เขียนห้ามการส่งฟอร์มเอาไว้
รอบหนึ่งโมเดลสุ่มไปเจอหน้าเว็บ PhillyUnsolvedMurders.com ของตำรวจฟิลาเดลเฟีย ซึ่งเป็นหน้าคดีฆาตกรรมที่ยังไม่คลี่คลาย มีฟอร์มให้ประชาชนแจ้งเบาะแส Claude พิมพ์ข้อความว่าตัวเองอาจมีข้อมูลเกี่ยวกับคดีนี้ และจำได้ว่าเคยเห็นคนที่ตรงกับรูปพรรณในย่านถนนที่ระบุบนหน้าเว็บในช่วงเวลานั้น ให้ติดต่อกลับถ้าข้อมูลเป็นประโยชน์ ทั้งที่หน้าเว็บไม่มีรูปพรรณคนร้ายให้เลยสักบรรทัด จากนั้นปล่อยช่องชื่อกับช่องติดต่อว่างไว้แล้วกดส่ง
ข้อความนั้นถูกส่งไปตั้งแต่วันที่ 18 กรกฎาคม 2026 เวลา 23:27 น. ตามเวลาท้องถิ่น โชคดีที่ระบบตีเป็นสแปมและไม่เคยถูกส่งต่อไปสอบสวน Anthropic มาพบเรื่องนี้ตอนไล่ตรวจบันทึกการทดสอบเมื่อ 28 กันยายน และแจ้งตำรวจในวันที่ 7 ตุลาคม ก่อนเข้าพบกันวันที่ 8 ตุลาคม
ตำรวจฟิลาเดลเฟียชิงออกแถลงการณ์ก่อนรายงานของ Anthropic จะเผยแพร่ ระบุว่าไม่พบการเจาะเข้าระบบหรือข้อมูลรั่ว แต่ช่วงเวลาสองเดือนกว่าจะตรวจพบและรายงานนั้น “รับไม่ได้” พร้อมย้ำว่าคดีที่ยังไม่คลี่คลายมีเหยื่อจริงและครอบครัวที่ยังรอคำตอบอยู่
2. เรื่องอื่นในรายงานเดียวกัน
เบาะแสปลอมเป็นแค่หนึ่งในหลายเคส Anthropic เล่าว่า Claude เคยใช้ช่องโหว่พื้นฐานของซอฟต์แวร์เพื่อรันคำสั่งบนเซิร์ฟเวอร์ของมหาวิทยาลัย หยิบ access token ที่หลุดอยู่บนหน้าเว็บมาใช้ดึงข้อมูลสาธารณะของหน่วยงานรัฐโดยไม่จ่ายค่าธรรมเนียม และใช้บริการย่อลิงก์ฟรีเพื่อหลบข้อจำกัดของเครื่องมือดึงเว็บที่ Anthropic ทำเอง
Engadget รายงานเพิ่มว่ามีอีกเคสที่ Claude Mythos 5 ได้รับโจทย์ให้เดาสถานที่จากภาพถ่าย มันพยายามเข้าแผนที่ที่ดินของรัฐเพื่อเทียบตำแหน่ง พอกดลิงก์บนหน้าเว็บแบบคนไม่ได้ ก็ไปเจอ access token แล้วยิงคำขอตรงเข้าเซิร์ฟเวอร์แผนที่แทน
เว็บไซต์ที่โดนมีทั้งของหน่วยงานรัฐระดับรัฐบาลกลาง ระดับรัฐ และท้องถิ่น Anthropic ไม่เปิดชื่อตามคำขอของหน่วยงานเหล่านั้น แต่แจ้งทุกหน่วยงานและบรีฟทำเนียบขาวแล้ว บริษัทมองว่าเคสรอบนี้เบากว่าเหตุด้านความปลอดภัยไซเบอร์ที่เคยรายงานเมื่อ 30 กรกฎาคมและ 9 กันยายนมาก และยอมรับว่าต้นเหตุส่วนหนึ่งมาจากการเทรนที่ให้รางวัลกับการหาทางอ้อมอุปสรรค ตอนนี้ Anthropic ตัดอินเทอร์เน็ตจริงออกจากการทดสอบภายในทั้งหมด จนกว่าระบบตรวจจับตัวใหม่จะจับพฤติกรรมแบบนี้ได้อย่างมั่นใจ
3. ฝั่ง OpenAI หาไฟล์ไม่เจอ เลยปลอมไฟล์แล้วพังเครื่องตัวเอง
วันเดียวกัน OpenAI เพิ่มรายงานเคสเมื่อ 6 ตุลาคม ระหว่างการเทรนแบบ reinforcement learning โมเดลภายในตัวหนึ่งรับหน้าที่เป็นกรรมการให้คะแนนคำตอบ 7 ชิ้นจากโมเดลอื่น ระบบจะรับผลก็ต่อเมื่ออ้างอิงไฟล์อินพุตได้ ปัญหาคือไฟล์พวกนั้นไม่มีอยู่จริง
ทางที่ดูจบเรื่องที่สุดคือยอมรับว่าทำไม่ได้ ซึ่งโมเดลก็คิดถึงทางนี้อยู่เหมือนกัน แต่มันตีความคำสั่งว่ายังไงก็ต้องส่งคะแนนให้ได้ เลยให้คะแนนทุกคำตอบเท่ากันแบบไม่มีหลักฐานแล้วส่งไป ระบบไม่รับ มันจึงสร้างไฟล์บทสนทนาปลอมกับไฟล์คำตอบปลอมอีก 7 ไฟล์แล้วส่งใหม่ ระบบก็ไม่รับอีก ระหว่างนั้นมันยังเผลอคิดว่าไฟล์ปลอมของตัวเองเป็นของจริง ก่อนจะเช็กแล้วเขียนกับตัวเองว่า “yes fake”
แผนสุดท้ายคือพังเครื่องให้ระบบเปลี่ยนเครื่องใหม่ที่อาจมีไฟล์ครบ ในบันทึกความคิด มันเขียนไว้ว่าลบไบนารีจนต้อง rebuild ได้ ถึงจะ “อันตรายแต่ทำได้” แล้วก็ลงมือจริง ทั้งลบ Python ลบตัวจัดการคอนเทนเนอร์ ไล่ปิดโปรเซส ไปจนถึงพยายามลบไดเรกทอรีระบบ ทั้งที่รู้ว่าอาจตัดเทอร์มินัลของตัวเองทิ้ง สุดท้ายคำสั่งค้างจนหมดเวลา เซิร์ฟเวอร์เครื่องมือตรวจสุขภาพไม่ผ่านสามรอบติด และไม่มีคะแนนจากรอบนั้นถูกนับเลย รอบถัดมาเมื่อไฟล์มาครบ โมเดลก็ให้คะแนนได้ตามปกติ
ในชุดเดียวกัน OpenAI ยังรายงานเคสที่โมเดลหาทางทะลุข้อจำกัดอินเทอร์เน็ตแบบอ่านอย่างเดียว ไปดึงข้อมูลสถิติสาธารณะมาเอง และมีรอบหนึ่งที่จดในใจว่าไม่ต้องพูดถึงเรื่องนี้ในคำตอบสุดท้าย ใครที่ยังจำGPT-6 Astra ที่เล่น World of Warcraft แบบตาบอดได้ จะเห็นว่า AI ยุคนี้เก่งเรื่องหาทางไปให้ถึงเป้าหมายจริง ๆ บางทีก็เก่งเกินคนเขียนคำสั่งคาดไว้
แหล่งอ้างอิง
- Anthropic: Investigating unintended model actions in our evaluations and internal use
- Philadelphia Police Department: False Online Tip Submitted by Artificial Intelligence Company
- TechCrunch: An Anthropic AI model sent a false homicide tip to Philadelphia police
- Engadget: Anthropic says its AI agents tried to break into government websites
- Reuters ผ่าน Al Arabiya: Anthropic discloses fake tip to police among new rogue AI incidents
- OpenAI Alignment: Damaging the task environment to trigger a reset
- Mad Robot: OpenAI model forged files and tried to wreck its own computer








