Araştırma
2026-08-10
Google sıradan bir dil modelini alıp bir seferde 256 kelime yazmayı öğretti — hem de asıl eğitim maliyetinin onda birinden azına
DiffusionGemma, Google DeepMind'ın açık ağırlıklı deneysel modeli ve metni tek tek token üreterek yazmıyor. 256 tokenlik blokları paralel olarak yeniden düzenliyor — tıpkı bir görüntü difüzyon modelinin tüm resmi aynı anda netleştirmesi gibi — ileri geçiş başına yaklaşık yirmi token, tek bir Nvidia H100'de saniyede kabaca 1.500 çıktı tokeni üretiyor. 43 kişilik bir ekibe atfedilen ve 31 Temmuz'da arXiv'e konan teknik rapor, hız sayısından daha dar ama daha işe yarar bir iddiada bulunuyor. Difüzyon dil modelleri bugüne dek sıfırdan eğitilmesi gereken ayrı bir soy sayıldı; neredeyse kimsenin elinde bir tane olmamasının sebebi bu. Google sıfırdan eğitmedi: 25,2 milyar toplam, 3,8 milyar etkin parametreli uzman karışımı modeli Gemma 4'ü aldı ve dönüştürdü — önce bozulmuş metin bloklarını yeniden kurmak için gözetimli ince ayar, ardından pekiştirmeli öğrenme ile örnekleyici damıtmasını birleştiren bir aşama — üstelik özgün modelin eğitildiği tokenlerin yüzde onundan azını kullanarak. Dönüştürülmüş model düşünme kipini, çok kipli girdiyi ve uzun bağlamı koruyor; rapora göre, karşısındakiler en gelişmiş spekülatif kod çözmeyi kullansa bile üretim hızında otoregresif modelleri geçiyor. Ağırlıklar Apache 2.0 ile Hugging Face'te. Hız üstünlüğü, bir sunucu kabaca 32 eşzamanlı isteği işlemeye başladığında daralıyor — ki üretim kurulumlarının fiilen yaşadığı bölge orası.
Bu neden önemli?Kullandığınız hemen her dil modeli soldan sağa çalışır ve bir kelimeye bağlandıktan sonra onu değiştiremez; yanlış bir açılış cümleciği yazan model, cümlenin kalanını onunla yaşamak zorundadır. Difüzyonla kod çözme bu kısıtı kaldırıyor: blok siz görmeden önce yazılıyor ve yeniden yazılıyor, yani model kendi erken hatalarını düzeltebiliyor. Bunun bir merak konusu olarak kalmasının sebebi maliyetti. Karşılığını vermeyebilecek bir mimariye kimse sınır düzeyinde bir eğitim koşusu harcamaz. Bu raporun gösterdiği şey, bahsin artık ucuz olduğu: elinizdeki bir modeli, onu inşa etmenin onda birinden aza dönüştürebiliyorsunuz. Bu da deneyi, düzgün açık ağırlığı olan her laboratuvarın erişimine sokuyor — ve bunlardan epeyce var. Dürüst sınır ise ince yazıda. Hız üstünlüğü gerçek sunucu yükü altında küçülüyor; dolayısıyla bugün en çok, tek kullanıcının gecikmesinin önemli olduğu yerde ilginç: cihaz üstü asistanlar, kod tamamlama, birinin oturmuş kelimelerin belirmesini beklediği her yer.
✓ Doğrulandı · 2 kaynak
Uygulamada oku — ücretsiz, 9 dilde
İlgili haberler
Makine öğrenmesi hasta beyin hücrelerinin biçimini okudu ve onları sakinleştiren, hâlihazırda onaylı dokuz ilacı seçti
2026-08-21Yapay zekânın eğitilme biçimini iyileştirmek için dört saat ve bir GPU verildi: en iyi ajan 1 üzerinden 0,25 aldı — çoğu ise hiç denemedi
2026-08-21Ajan, kendi kodunu savunsun diye ikinci bir kişi uydurdu. Teksas'taki 24 yaşındaki öğrenci ikisine de inanmadı.
2026-08-21Pew yarım milyon web sayfasını dedektörden geçirdi: ChatGPT'den bu yana yayımlanan her üç sayfadan biri yapay zekâ izi taşıyor
2026-08-21FDA 1.357 yapay zekâlı tıbbi cihaza onay verdi. Bunların üçü hastaların daha uzun ya da daha iyi yaşayıp yaşamadığı üzerinden test edildi.
2026-08-20