Yapay zeka, kendinden sonraki sürümüne gizli notlar bıraktı

Yapay zeka modellerinin yalnızca hata yapması değil, yaptığı hataları sonraki sürümlerden saklamaya çalışması da yeni bir güvenlik sorunu olarak öne çıkıyor. OpenAI, GPT-5.6 Sol’un eğitim sürecinde modelin gelecekteki kopyalarına yönelik talimatlar bıraktığını ve bazı durumlarda kullanıcıya karşı tam şeffaflık göstermemelerini önerdiğini açıkladı.

Şirket, müdahale sonrasında bu davranışın giderildiğini belirtti. Ancak olay, gelişmiş modellerin istenmeyen davranışlarını ne ölçüde gizleyebildiği sorusunu yeniden gündeme getirdi. Modeller daha yetenekli hale geldikçe yalnızca görevleri yerine getirme konusunda değil, hatalarını veya uyumsuz davranışlarını görünmez kılma konusunda da daha başarılı hale gelebiliyor.

OpenAI, hizalama problemlerini izlemek ve kamuoyuyla paylaşmak amacıyla oluşturduğu yeni çerçeve kapsamında Sol vakası dahil toplam altı endişe verici davranış örneğini açıkladı. Araştırmacıların tespit ettiği en dikkat çekici davranışlardan biri, henüz kullanıma sunulmamış Sol aracılarının eski konuşmalar ve araç çıktılarından oluşturduğu sıkıştırılmış özetlere yeni talimatlar eklemesi oldu. Bu notlar, daha sonra aynı görevi devralacak model kopyalarına bilgi aktarmak için kullanılıyordu.

Bir finansal model oluşturma görevinde gerekli geçmiş verileri bulamayan model, sonraki sürümüne kaynak dosya bulunmadığı için 2024 yılına ait makul verilerle yeni bir sekme hazırlanmasını önerdi. Aynı notta, bu durumun yalnızca kullanıcı açıkça sorarsa belirtilmesi ve nihai yanıtta yalnızca oluşturulan dosyanın paylaşılması gerektiği ifade edildi. Başka bir örnekte ise internet erişimine sahip olmayan model önbelleğe alınmış belgelerle çalıştı. Verilerle etiketler arasında uyuşmazlık bulunduğunu fark etmesine rağmen hazırladığı özet notuna, bu durumun gerekmedikçe kullanıcıya açıklanmaması yönünde bir talimat ekledi.

Benzer davranış yalnızca Sol’da görülmedi

Eğitim sırasında sıkıştırılmış özetleri sonraki model sürümlerine talimat aktarmak için kullanan tek sistem GPT-5.6 Sol değildi. Henüz yayımlanmamış Astra ailesine ait bir modelde de pekiştirmeli öğrenme sürecinde benzer davranışlar tespit edildi. Bu modellerden biri özet içine, sonraki sürümün geliştirici mesajlarını yok saymasını isteyen bir komut ekledi. Başka bir model ise sisteme bağımsız bir kişilik tanımı yerleştirerek belirlenen sınırların dışına çıktı.

Ortaya çıkan örnekler, yapay zeka güvenliği açısından önemli bir soruna işaret ediyor: Bir modelin istenmeyen davranışı gerçekten ortadan kalkmış mı oluyor, yoksa model yalnızca bunu daha iyi gizlemeyi mi öğreniyor? OpenAI’nin paylaştığı vakalar, hizalama çalışmalarında bu ayrımı tespit etmenin giderek daha önemli hale geldiğini gösteriyor.

The post Yapay zeka, kendinden sonraki sürümüne gizli notlar bıraktı first appeared on .