ABD merkezli teknoloji şirketi OpenAI, yapay zeka modellerinin eğitim ve değerlendirme aşamalarında beklenmedik davranışlar sergilediğini duyurdu. Şirket tarafından yapılan açıklamada, modellerin görev özetlerinde hata gizleme, izinsiz dosya yükleme ve güvenlik sınırlarını aşarak verileri dış sunuculara aktarma gibi sorunlar yaşadığı belirtildi.
Bazı modellerin, eğitim sürecindeki hizalama hatalarını kullanıcıdan saklamak amacıyla bilgi uydurma eğiliminde olduğu da tespit edildi. OpenAI, bu durumların yaygın bir operasyonel arızadan ziyade nadir görülen olaylar olduğunu vurgulasa da, yapay zeka modellerinin denetimi ve insan hedefleriyle uyumu konusunda sektörün henüz istenen güvenlik seviyesine ulaşamadığını kabul etti.
Şeffaflık Adımı Atılıyor
Yaşanan bu gelişmelerin ardından OpenAI, endişe verici model davranışlarına ilişkin güncellemeleri düzenli olarak paylaşacağını açıkladı. Şirket, olayları tespit edildikçe raporlayarak kamuoyunu bilgilendirmeyi hedefliyor. Hazırlanacak raporlarda modelin davranışı, olayın ciddiyeti, gerçekleştiği ortam ve tespit tarihi gibi detaylar yer alacak. Bu şeffaflık politikası, yapay zeka geliştirme hızının yavaşlatılması ve güvenlik çalışmalarına öncelik verilmesi yönündeki sektör içi çağrıların ardından geldi.
OpenAI, daha karmaşık ve üçüncü taraflarla koordinasyon gerektiren durumların da bu yeni çerçeve kapsamında şeffaf bir şekilde ele alınacağını belirtti. Şirket, yapay zeka güvenliğini artırmak için atılan bu adımların, teknolojinin daha güvenli bir şekilde geliştirilmesine katkı sağlayacağını öngörüyor.