
เอกสารศาลเปิดเผย: OpenAI และ Microsoft รู้ว่าจะเกิด 'doom loop' ที่ทำลายเว็บและสื่อ
เอกสารที่เพิ่งเปิดเผยระบุบริษัทตระหนักว่าการขูดข้อมูลฝึก AI จะทำลายทราฟฟิกเว็บและอุตสาหกรรมสื่อ
เอกสารศาลเผยความกังวลภายในเกี่ยวกับผลกระทบของ AI ต่อเว็บ
เอกสารศาลที่เพิ่งถูกเปิดเผยในคดีของ The New York Times ระบุว่า OpenAI และ Microsoft ตระหนักว่าการเก็บข้อมูลจากอินเทอร์เน็ตเพื่อฝึกโมเดล AI อาจก่อให้เกิด "doom loop" ที่จะทำลายทั้งประสิทธิภาพของโมเดลและระบบนิเวศของเนื้อหาออนไลน์ บริษัทต่างๆ ยังถูกอ้างว่ามองการขูดข้อมูลเป็น "the largest theft of labor in human history" และว่าแนวทางป้องกันของพวกเขาทำให้แนวคิดเรื่อง "fair use" ดูไร้ความหมาย
คำเตือนจากภายในและความเห็นของบริษัท
ข้อความที่โดดเด่นมาจาก Brent Hecht ผู้เป็น Director of Applied Science ของ Microsoft ซึ่งเรียกการเก็บข้อมูลของ ChatGPT และ Copilot ว่าเป็นการขโมยแรงงานครั้งใหญ่ ขณะที่ Microsoft พยายามแยกมุมมองของพนักงานออกจากท่าทีของบริษัทโดยโฆษกระบุว่าเป็นมุมมองส่วนบุคคล
“Our AI content strategy has started a ‘doom loop’ that will hurt the performance of our models and the entire web at the same time.”
เอกสารภายในยังอ้างถึงคำพูดของ Satya Nadella ที่ยอมรับว่าช่องทางแบบ chatbot ได้เข้ามาแทนที่การค้นหาและลดความจำเป็นที่จะคลิกไปยังแหล่งข้อมูลต้นทาง
ผลกระทบเชิงธุรกิจและการละเมิดลิขสิทธิ์
ทั้งสองบริษัทดูเหมือนจะรับรู้ถึงผลกระทบเชิงเศรษฐกิจต่อสำนักพิมพ์: มีการยอมรับว่า LLMs เป็นผลิตภัณฑ์ที่ในบางกรณีทำลายห่วงโซ่อุปทานของตัวเอง และ OpenAI เองก็พบว่า GPT-4 มีปัญหาเรื่อง memorization จนตอบหรือคัดลอกเนื้อหาแบบ verbatim ได้จริง
เอกสารยกตัวอย่างกรณีที่ ChatGPT สร้างข้อความตรงจากบทความของ The New York Times, Mercury News, The Denver Post, LifeHacker และ Eurogamer ซึ่งสะท้อนว่าการฝึกด้วยข้อมูลขนาดใหญ่ไม่ได้ป้องกันการคัดลอกเนื้อหาอย่างเพียงพอ
ข้อถกเถียงเรื่อง paywalled content และรายได้จากการอ้างอิง
แม้ Satya Nadella จะถูกนำมาอ้างว่า "anything that is paywalled should be licensed" ตัวแทนของ OpenAI กลับยอมรับว่าไม่มีความพยายามชัดเจนในการตรวจจับหรือกรองเนื้อหา paywalled ออกจากข้อมูลฝึก
ผู้เชี่ยวชาญด้านสื่อของ OpenAI และ Microsoft ระบุว่าการสรุปโดย AI เช่น Google’s AI Overviews ดึง referral traffic ลงอย่างมากสำหรับหลายเว็บไซต์ โดยคาดว่าการอ้างอิงจากการค้นหาอาจลดลงราว 60% ซึ่งส่งผลโดยตรงต่อรายได้และคนทำงานในอุตสาหกรรมสื่อ
สรุปและความหมายต่ออนาคต
เอกสารที่ถูกเปิดเผยชี้ให้เห็นว่า บริษัทด้าน AI รู้ว่าการดำเนินการของตัวเองอาจทำลายระบบนิเวศของเนื้อหาออนไลน์ แต่ยังเดินหน้าต่อด้วยเป้าหมายเชิงพาณิชย์ ข้อความภายในสะท้อนความตึงเครียดระหว่างการพัฒนาผลิตภัณฑ์ AI, สิทธิของผู้สร้างเนื้อหา และการค้ำจุนเศรษฐกิจของสื่อดั้งเดิม
- เอกสารอ้างว่ากลยุทธ์การเก็บข้อมูลเริ่มก่อ "doom loop"
- มีการยอมรับว่า GPT-4 มีแนวโน้มจะ memorize ข้อมูลและอาจคัดลอกเนื้อหาแบบยาว
- OpenAI และ Microsoft รับรู้ว่าการสรุปโดย AI ลด referral traffic ของสำนักพิมพ์
- เรื่อง paywalled content ยังไม่มีการจัดการชัดเจนจาก OpenAI
รีวิวจากผู้ใช้จริง
รีวิวทั้งหมด: (/0)
ดูรีวิวทั้งหมด


















