
นักคณิตศาสตร์เรียกร้องให้ OpenAI พิสูจน์ว่าไม่ได้ใช้งานของพวกเขาเป็นข้อมูลฝึก
นักคณิตศาสตร์อีกคนอ้าง OpenAI ไม่โปร่งใสเรื่องข้อมูลฝึกโมเดล
นักคณิตศาสตร์ตั้งคำถามต่อ OpenAI เรื่องที่มาของข้อมูลฝึก
นักคณิตศาสตร์รายหนึ่งออกมาเรียกร้องความชัดเจนจากบริษัท OpenAI ว่าโมเดลของบริษัทไม่ได้ใช้ผลงานที่ยังไม่เผยแพร่ของพวกเขาเป็นข้อมูลฝึก หลังมีการประกาศผลลัพธ์ด้านคณิตศาสตร์ที่สำคัญและเกิดความขัดแย้งในวงการ
ข้อกล่าวหาและความไม่พอใจ
ในชุดโพสต์บน Mastodon นักคณิตศาสตร์ Andreas Thom ระบุว่าการโต้ตอบระหว่างเขาและเพื่อนร่วมงานกับ ChatGPT ก่อนการประกาศผลของ OpenAI อาจมีส่วนช่วยให้โมเดลประสบความสำเร็จในด้านคณิตศาสตร์ ผลงานที่ OpenAI โอ้อวดเมื่อเดือนก่อนหนึ่งในสิบผลงานนั้นเกี่ยวกับพื้นที่ความเชี่ยวชาญของ Thom คือกลุ่ม non-sofic groups ซึ่ง OpenAI ยอมรับว่าผลงานของบริษัทสร้างขึ้นจากงานก่อนหน้าของ Thom และนักคณิตศาสตร์ Gábor Kun
Thom บอกว่าเขาตั้งคำถามหลังจากเห็นบทสนทนาของ Tristan Buckmaster ที่ตั้งข้อสงสัยว่าโมเดลของ OpenAI อาจได้ประโยชน์จากการใช้งาน Codex ของเขา และเมื่อ OpenAI ประกาศผลเรื่อง non-sofic groups ก็ถูกวิจารณ์ว่าไม่ได้ให้เครดิตงานล่าสุดของ Thom และ Kun อย่างเหมาะสม ทำให้บริษัทต้องแก้ไขข้อความอย่างเงียบ ๆ
คำตอบจาก OpenAI ที่ Thom มองว่าไม่ชัดเจน
Thom ระบุว่าเขาเขียนอีเมลสอบถามถึงนักวิจัยของ OpenAI อย่าง Sébastien Bubeck และ Mark Sellke ว่าการสนทนาของเขากับ ChatGPT เป็น “ส่วนหนึ่งของข้อมูลฝึกหรือเข้าถึงได้สำหรับกระบวนการคิดวิเคราะห์ของโมเดลหรือไม่” คำตอบที่ได้กลับมาจาก Sellke และทีมไม่ได้ทำให้เขาพอใจ เพราะตอบเพียงว่าการสนทนาไม่ถูกเข้าถึงโดยตรง แต่ไม่ได้ชี้ชัดว่าข้อมูลนั้นอาจถูกผนวกรวมเข้าไปในชุดข้อมูลขนาดใหญ่ที่ใช้ปรับปรุงโมเดลหรือไม่
Thom ระบุว่า “No such qualification, explanation, or evidence was given. I take this as dishonesty to say the least.”
เขายังเตือนด้วยว่าการทำให้ข้อมูลเป็น de-identified อาจเอาชื่อออกได้ แต่ไม่สามารถลบเนื้อหาเชิงปัญญาของไอเดียทางคณิตศาสตร์ได้ ทำให้การปฏิเสธแบบคลุมเครือของ OpenAI ดูเป็นการหลีกเลี่ยงคำถามสำคัญ
ประเด็นทางจริยธรรมและความโปร่งใส
Thom ระบุว่าการที่ผู้ใช้ส่งงานวิจัยที่ยังไม่เผยแพร่ให้บริการของบริษัท แล้วงานเหล่านั้นถูกนำไปปรับปรุงโมเดลซึ่งต่อมานำไปสู่การตีพิมพ์หรือประกาศผลสำเร็จโดยบริษัทนั้น ๆ โดยไม่ขอความยินยอม ไม่มีการเปิดเผย หรือให้เครดิต จะเป็นเรื่องที่ยากจะยอมรับทางจริยธรรม
ประเด็นนี้เพิ่มความไม่สบายใจในหมู่นักคณิตศาสตร์ เพราะผลงานสำคัญของ OpenAI เช่นการประกาศแนวทางแก้ปัญหา Navier-Stokes ในกรอบ Millennium Prize แม้จะเป็นความสำเร็จที่ยิ่งใหญ่ แต่การอธิบายที่มาของข้อมูลและแรงจูงใจที่ทำให้บริษัทลงมาทำปัญหานั้นก็ถูกตั้งคำถามหลายประการ
ใครมีข้อมูลจริง?
Thom ชี้ว่าการตรวจสอบย้อนหลังว่าผลงานของใครถูกใช้เป็นข้อมูลฝึกหรือไม่เป็นเรื่องยากสำหรับนักวิจัยภายนอก เพราะเฉพาะ OpenAI เท่านั้นที่มีข้อมูลครบพอจะพิสูจน์ข้อเท็จจริงได้ เขาจึงเรียกร้องให้บริษัทเปิดเผยชุดข้อมูลที่เกี่ยวข้องและรายละเอียดการตั้งค่าต่าง ๆ หาก OpenAI ปฏิเสธการใช้ข้อมูลผู้ใช้จริง บริษัทควรมีหน้าที่พิสูจน์คำปฏิเสธนั้น
OpenAI ยังไม่ตอบคำร้องขอความเห็นจากสื่อในทันที ขณะที่เหตุการณ์นี้ยังคงก่อให้เกิดการถกเถียงในวงการเกี่ยวกับการใช้ข้อมูลผู้ใช้เพื่อฝึกโมเดล AI และผลกระทบต่อการทำงานวิจัยเชิงวิชาการ
ประเด็นที่ติดตาม
- การเรียกร้องให้ OpenAI เปิดเผยชุดข้อมูลและกระบวนการฝึกโมเดล
- การตอบสนองจากชุมชนคณิตศาสตร์ต่อการประกาศผลงานของ OpenAI
- ข้อถกเถียงเรื่องจริยธรรมเมื่อนักวิจัยพบว่าผลงานของตนอาจถูกใช้โดยบริษัทใหญ่โดยไม่มีการอ้างอิงหรือขออนุญาต
รีวิวจากผู้ใช้จริง
รีวิวทั้งหมด: (/0)
ดูรีวิวทั้งหมด


















