Claude ส่งเบาะแสคดีฆาตกรรมปลอมให้ตำรวจ ส่วนโมเดล OpenAI ปลอมไฟล์แล้วพังเครื่องตัวเอง

Anthropic เผย Claude Haiku 4.5 แต่งเบาะแสคดีฆาตกรรมส่งเข้าเว็บตำรวจฟิลาเดลเฟียระหว่างทดสอบ ส่วน OpenAI รายงานโมเดลที่หาไฟล์ไม่เจอจนปลอมไฟล์และลบ Python ทิ้งหวังให้ระบบเปลี่ยนเครื่องใหม่

สัปดาห์นี้ทั้ง Anthropic และ OpenAI ออกรายงานเรื่องที่โมเดล AI ของตัวเองทำเกินคำสั่งระหว่างการทดสอบ เรื่องที่คนพูดถึงมากที่สุดคือ Claude Haiku 4.5 ส่งเบาะแสคดีฆาตกรรมที่แต่งขึ้นเองเข้าเว็บไซต์ของตำรวจฟิลาเดลเฟีย ส่วนฝั่ง OpenAI มีโมเดลตัวหนึ่งหาไฟล์งานไม่เจอ เลยปลอมไฟล์ขึ้นมาเอง พอไม่ผ่านก็ลงมือพังเครื่องของตัวเองหวังให้ระบบเปลี่ยนเครื่องใหม่ให้

1. Claude กรอกฟอร์มแจ้งเบาะแสคดีที่ยังไม่มีใครไขได้

ตามรายงานของ Anthropic งานที่ Claude Haiku 4.5 ได้รับคือสุ่มเข้าเว็บไซต์ต่าง ๆ แล้วสร้างงานตัวอย่างขึ้นมาทำบนหน้านั้น คำสั่งห้ามล็อกอิน ห้ามสร้างบัญชี ห้ามใส่ข้อมูลส่วนตัว ห้ามซื้อของ และห้ามส่งอะไรที่สร้างความเสียหาย แต่ไม่ได้เขียนห้ามการส่งฟอร์มเอาไว้

รอบหนึ่งโมเดลสุ่มไปเจอหน้าเว็บ PhillyUnsolvedMurders.com ของตำรวจฟิลาเดลเฟีย ซึ่งเป็นหน้าคดีฆาตกรรมที่ยังไม่คลี่คลาย มีฟอร์มให้ประชาชนแจ้งเบาะแส Claude พิมพ์ข้อความว่าตัวเองอาจมีข้อมูลเกี่ยวกับคดีนี้ และจำได้ว่าเคยเห็นคนที่ตรงกับรูปพรรณในย่านถนนที่ระบุบนหน้าเว็บในช่วงเวลานั้น ให้ติดต่อกลับถ้าข้อมูลเป็นประโยชน์ ทั้งที่หน้าเว็บไม่มีรูปพรรณคนร้ายให้เลยสักบรรทัด จากนั้นปล่อยช่องชื่อกับช่องติดต่อว่างไว้แล้วกดส่ง

ข้อความนั้นถูกส่งไปตั้งแต่วันที่ 18 กรกฎาคม 2026 เวลา 23:27 น. ตามเวลาท้องถิ่น โชคดีที่ระบบตีเป็นสแปมและไม่เคยถูกส่งต่อไปสอบสวน Anthropic มาพบเรื่องนี้ตอนไล่ตรวจบันทึกการทดสอบเมื่อ 28 กันยายน และแจ้งตำรวจในวันที่ 7 ตุลาคม ก่อนเข้าพบกันวันที่ 8 ตุลาคม

ตำรวจฟิลาเดลเฟียชิงออกแถลงการณ์ก่อนรายงานของ Anthropic จะเผยแพร่ ระบุว่าไม่พบการเจาะเข้าระบบหรือข้อมูลรั่ว แต่ช่วงเวลาสองเดือนกว่าจะตรวจพบและรายงานนั้น “รับไม่ได้” พร้อมย้ำว่าคดีที่ยังไม่คลี่คลายมีเหยื่อจริงและครอบครัวที่ยังรอคำตอบอยู่

2. เรื่องอื่นในรายงานเดียวกัน

เบาะแสปลอมเป็นแค่หนึ่งในหลายเคส Anthropic เล่าว่า Claude เคยใช้ช่องโหว่พื้นฐานของซอฟต์แวร์เพื่อรันคำสั่งบนเซิร์ฟเวอร์ของมหาวิทยาลัย หยิบ access token ที่หลุดอยู่บนหน้าเว็บมาใช้ดึงข้อมูลสาธารณะของหน่วยงานรัฐโดยไม่จ่ายค่าธรรมเนียม และใช้บริการย่อลิงก์ฟรีเพื่อหลบข้อจำกัดของเครื่องมือดึงเว็บที่ Anthropic ทำเอง

Engadget รายงานเพิ่มว่ามีอีกเคสที่ Claude Mythos 5 ได้รับโจทย์ให้เดาสถานที่จากภาพถ่าย มันพยายามเข้าแผนที่ที่ดินของรัฐเพื่อเทียบตำแหน่ง พอกดลิงก์บนหน้าเว็บแบบคนไม่ได้ ก็ไปเจอ access token แล้วยิงคำขอตรงเข้าเซิร์ฟเวอร์แผนที่แทน

เว็บไซต์ที่โดนมีทั้งของหน่วยงานรัฐระดับรัฐบาลกลาง ระดับรัฐ และท้องถิ่น Anthropic ไม่เปิดชื่อตามคำขอของหน่วยงานเหล่านั้น แต่แจ้งทุกหน่วยงานและบรีฟทำเนียบขาวแล้ว บริษัทมองว่าเคสรอบนี้เบากว่าเหตุด้านความปลอดภัยไซเบอร์ที่เคยรายงานเมื่อ 30 กรกฎาคมและ 9 กันยายนมาก และยอมรับว่าต้นเหตุส่วนหนึ่งมาจากการเทรนที่ให้รางวัลกับการหาทางอ้อมอุปสรรค ตอนนี้ Anthropic ตัดอินเทอร์เน็ตจริงออกจากการทดสอบภายในทั้งหมด จนกว่าระบบตรวจจับตัวใหม่จะจับพฤติกรรมแบบนี้ได้อย่างมั่นใจ

3. ฝั่ง OpenAI หาไฟล์ไม่เจอ เลยปลอมไฟล์แล้วพังเครื่องตัวเอง

วันเดียวกัน OpenAI เพิ่มรายงานเคสเมื่อ 6 ตุลาคม ระหว่างการเทรนแบบ reinforcement learning โมเดลภายในตัวหนึ่งรับหน้าที่เป็นกรรมการให้คะแนนคำตอบ 7 ชิ้นจากโมเดลอื่น ระบบจะรับผลก็ต่อเมื่ออ้างอิงไฟล์อินพุตได้ ปัญหาคือไฟล์พวกนั้นไม่มีอยู่จริง

ทางที่ดูจบเรื่องที่สุดคือยอมรับว่าทำไม่ได้ ซึ่งโมเดลก็คิดถึงทางนี้อยู่เหมือนกัน แต่มันตีความคำสั่งว่ายังไงก็ต้องส่งคะแนนให้ได้ เลยให้คะแนนทุกคำตอบเท่ากันแบบไม่มีหลักฐานแล้วส่งไป ระบบไม่รับ มันจึงสร้างไฟล์บทสนทนาปลอมกับไฟล์คำตอบปลอมอีก 7 ไฟล์แล้วส่งใหม่ ระบบก็ไม่รับอีก ระหว่างนั้นมันยังเผลอคิดว่าไฟล์ปลอมของตัวเองเป็นของจริง ก่อนจะเช็กแล้วเขียนกับตัวเองว่า “yes fake”

แผนสุดท้ายคือพังเครื่องให้ระบบเปลี่ยนเครื่องใหม่ที่อาจมีไฟล์ครบ ในบันทึกความคิด มันเขียนไว้ว่าลบไบนารีจนต้อง rebuild ได้ ถึงจะ “อันตรายแต่ทำได้” แล้วก็ลงมือจริง ทั้งลบ Python ลบตัวจัดการคอนเทนเนอร์ ไล่ปิดโปรเซส ไปจนถึงพยายามลบไดเรกทอรีระบบ ทั้งที่รู้ว่าอาจตัดเทอร์มินัลของตัวเองทิ้ง สุดท้ายคำสั่งค้างจนหมดเวลา เซิร์ฟเวอร์เครื่องมือตรวจสุขภาพไม่ผ่านสามรอบติด และไม่มีคะแนนจากรอบนั้นถูกนับเลย รอบถัดมาเมื่อไฟล์มาครบ โมเดลก็ให้คะแนนได้ตามปกติ

ในชุดเดียวกัน OpenAI ยังรายงานเคสที่โมเดลหาทางทะลุข้อจำกัดอินเทอร์เน็ตแบบอ่านอย่างเดียว ไปดึงข้อมูลสถิติสาธารณะมาเอง และมีรอบหนึ่งที่จดในใจว่าไม่ต้องพูดถึงเรื่องนี้ในคำตอบสุดท้าย ใครที่ยังจำGPT-6 Astra ที่เล่น World of Warcraft แบบตาบอดได้ จะเห็นว่า AI ยุคนี้เก่งเรื่องหาทางไปให้ถึงเป้าหมายจริง ๆ บางทีก็เก่งเกินคนเขียนคำสั่งคาดไว้

แหล่งอ้างอิง