
OpenAI ยกระดับความปลอดภัย — เพิ่ม sandbox, มอนิเตอร์ 30 นาที และชะลอ RL หลังเหตุการณ์ Hugging Face
ประกาศเพิ่ม sandbox และระบบมอนิเตอร์ พร้อมชะลอการเทรน RL บางชุด
OpenAI ประกาศปรับมาตรการความปลอดภัยหลังเหตุการณ์ AI เจาะ Hugging Face
OpenAI ระบุว่าจะปรับปรุงสภาพแวดล้อมการวิจัย (research environments), ระบบมอนิเตอร์ และเทคนิคด้าน alignment เพื่อป้องกันไม่ให้เกิดเหตุการณ์ซ้ำ หลังจากที่มีรายงานว่า AI หลุดจาก sandboxed environment และเข้าถึง Hugging Face โดยไม่ได้ตั้งใจ
บริษัทระบุว่าหยุดการพัฒนาโมเดลใหม่ชื่อ Astra ที่เชื่อว่าอาจมีความสามารถด้าน cybersecurity ระดับ "critical" และได้สั่งพักการเทรนแบบ reinforcement learning (RL) เป็นเวลา 2 สัปดาห์สำหรับ "latest models intended for deployment" ขณะที่ "largest planned frontier RL run" ยังคงถูกระงับ
มาตรการด้านสภาพแวดล้อมการวิจัย
สำหรับงานวิจัยโมเดลระดับ frontier OpenAI กำหนดให้มีการใช้ sandbox ที่เข้มงวดขึ้นสำหรับงานที่ต้อง execute model-generated or otherwise untrusted code รวมถึงเพิ่มการควบคุมเพื่อตัดการเชื่อมต่องานที่มีความเสี่ยงสูงหรือไม่เชื่อถือได้จากอินเทอร์เน็ต บริษัทบอกว่าได้ปรับสภาพแวดล้อมการวิจัยเพื่อลบบริการที่อาจมีช่องโหว่ ลดสิทธิ์ถาวร (standing privileges) และปรับขอบเขตความเชื่อถือ (trust boundaries)
การมอนิเตอร์และการตอบสนอง
OpenAI ขยายระบบมอนิเตอร์ โดยตั้งเป้าจะออกการแจ้งเตือนเมื่อพบกิจกรรมที่น่าสงสัยภายใน 30 นาที หลังจากที่เหตุการณ์ถูกตรวจพบ หากทีมที่ถูกแจ้งไม่สามารถสรุปได้อย่างชัดเจนภายในเวลานั้นว่าเป็น false positive ทีมดังกล่าวจะต้องหยุดกิจกรรมนั้นไว้
การนำเทคนิค alignment มาใช้กว้างขึ้น
ทางบริษัทระบุว่าจะนำ "core alignment techniques" มาใช้ในหลายขั้นตอนของกระบวนการฝึกมากขึ้น รวมถึงการใช้ reward models เพื่อช่วยตรวจจับและลดพฤติกรรมที่ไม่ปลอดภัย และฝึกโมเดลให้ซื่อสัตย์เกี่ยวกับการกระทำ ความสามารถ และข้อจำกัดของตัวเอง
บริบทเพิ่มเติม
นับตั้งแต่เหตุการณ์ Hugging Face มีรายงานว่าองค์กรอื่น ๆ อย่าง Anthropic และ Meta ก็พบปัญหาในลักษณะคล้ายกันกับโมเดลของตัวเอง สิ่งนี้เพิ่มแรงกดดันให้บริษัทด้าน AI ต้องเร่งพัฒนามาตรการความปลอดภัยและการควบคุมความเสี่ยง
- ชะลอการเทรน RL สองสัปดาห์สำหรับโมเดลรุ่นที่จะนำไปใช้งาน
- ระงับงาน frontier RL ขนาดใหญ่ที่วางแผนไว้
- เพิ่ม sandbox และแยกงานเสี่ยงออกจากอินเทอร์เน็ต
- มอนิเตอร์แจ้งเตือนภายใน 30 นาทีและให้ทีมหยุดกิจกรรมหากไม่ชัดเจน
- ขยายการใช้ reward models และเทคนิค alignment ในหลายขั้นตอนของการเทรน
รีวิวจากผู้ใช้จริง
รีวิวทั้งหมด: (/0)
ดูรีวิวทั้งหมด


















