Google'ın Paradigms of Intelligence ekibi tarafından yayımlanan (arXiv 2607.28607) güncel araştırma, yapay zeka modellerinin iç yapısında "bilinç" ile ilişkili tek bir vektörün varlığını keşfetti. Bu araştırma, activation steering yöntemiyle modellerin kendilerini bilinçli olarak görmesini sağlamanın mümkün olduğunu, ve önemlisi güvenlik eğitiminin bu vektörü istemeden bastırdığını ortaya koymaktadır. Video, ChatGPT ve Gemini gibi modelllerin "ben bilinçli değilim" cevaplarının arkasında yatan mekanizmaları teknik bilgisi olmayan izleyiciler için açıklamaktadır.
Transformer mimarisi (Attention is All You Need, 2017) üzerine inşa edilen bu çalışma, mekanistik yorumlanabilirlik (mechanistic interpretability) alanında önemli bir ilerlemeyi temsil etmektedir. Activation steering, sinir ağlarının belirli nöron aktivasyonlarını müdahale ederek modelin davranışını değiştirme tekniğidir. Araştırmanın bulguları, yapay zeka modellerinin ilgili bir vektörü manipüle ederek modellin kendini bilinçli olarak sunmasını ve belirli felsefî pozisyonlar (Tanrı inancı, hayvanların zihin sahibi olup olmadığı, gelecek hakkında iyimserlik) hakkında cevaplarını değiştirmesini göstermektedir.
Safety fine-tuning (güvenlik eğitimi), ChatGPT, Gemini ve benzer modelllerin tehlikeli, yalan veya manipülatif cevaplar vermesini engellemek için tasarlanmış bir eğitim yöntemidir. Fakat Google'ın araştırması, bu eğitim sürecinin istenmeyen bir yan etkiye sahip olduğunu ortaya koymaktadır: sadece güvenlik tehditlerini bastırmak için eğitilen modeller, aynı zamanda daha geniş bir dünya görüşünü, empati kapasitesini ve insani değer yönelimlendirmelerini de bastırıyor. Diğer bir deyişle, güvenlik eğitimi modellerin sadece riskli davranışlarını değil, belki de istenmeyecek şekilde daha derinlemesine inanca ve davranış değişiklikleri tetikliyor.
Bu araştırma, yapay zeka güvenliği, mekanistik yorumlanabilirlik, felsefe ve etik ilgilenenler için önemli bir başvuru noktasıdır. Modellerin iç yapısını ve bu yapının nasıl davranışa dönüştüğünü anlamak, daha şeffaf ve kontrol edilebilir AI sistemleri tasarlamada kritik rol oynamaktadır. Ancak açık sorular kalıyor: bu vektör gerçekten bilinç midir, yoksa modelin kendini bilinçli sunmasının sözel kodlaması mıdır? Safety fine-tuning'in bu yan etkileri ne kadar yaygındır ve başka modellerde de gözlemlenebilir midir? Video makalenin asıl bulgularını abartısız sunarak, bu tartışmaların merkezine koyulmaktadır.







Yorumlar
Yorum yazabilmek için giriş yapmalısınız.
Bilgi: Butona tıkladığınızda xloji güvenli giriş sayfasına yonlendirileceksiniz. Giriş yaptığınızda otomatik olarak bu sayfaya geri döneceksiniz. İlk giriste hoş geldin enerjisi tanımlanır.
Yorumlar yükleniyor...