aiminute. ← Tüm AI haberleri
Araştırma AI Minute Newsroom 2026-08-10

Google sıradan bir dil modelini alıp bir seferde 256 kelime yazmayı öğretti — hem de asıl eğitim maliyetinin onda birinden azına

Google sıradan bir dil modelini alıp bir seferde 256 kelime yazmayı öğretti — hem de asıl eğitim maliyetinin onda birinden azına

DiffusionGemma, Google DeepMind'ın açık ağırlıklı deneysel modeli ve metni tek tek token üreterek yazmıyor. 256 tokenlik blokları paralel olarak yeniden düzenliyor — tıpkı bir görüntü difüzyon modelinin tüm resmi aynı anda netleştirmesi gibi — ileri geçiş başına yaklaşık yirmi token, tek bir Nvidia H100'de saniyede kabaca 1.500 çıktı tokeni üretiyor. 43 kişilik bir ekibe atfedilen ve 31 Temmuz'da arXiv'e konan teknik rapor, hız sayısından daha dar ama daha işe yarar bir iddiada bulunuyor. Difüzyon dil modelleri bugüne dek sıfırdan eğitilmesi gereken ayrı bir soy sayıldı; neredeyse kimsenin elinde bir tane olmamasının sebebi bu. Google sıfırdan eğitmedi: 25,2 milyar toplam, 3,8 milyar etkin parametreli uzman karışımı modeli Gemma 4'ü aldı ve dönüştürdü — önce bozulmuş metin bloklarını yeniden kurmak için gözetimli ince ayar, ardından pekiştirmeli öğrenme ile örnekleyici damıtmasını birleştiren bir aşama — üstelik özgün modelin eğitildiği tokenlerin yüzde onundan azını kullanarak. Dönüştürülmüş model düşünme kipini, çok kipli girdiyi ve uzun bağlamı koruyor; rapora göre, karşısındakiler en gelişmiş spekülatif kod çözmeyi kullansa bile üretim hızında otoregresif modelleri geçiyor. Ağırlıklar Apache 2.0 ile Hugging Face'te. Hız üstünlüğü, bir sunucu kabaca 32 eşzamanlı isteği işlemeye başladığında daralıyor — ki üretim kurulumlarının fiilen yaşadığı bölge orası.

Bu neden önemli?Kullandığınız hemen her dil modeli soldan sağa çalışır ve bir kelimeye bağlandıktan sonra onu değiştiremez; yanlış bir açılış cümleciği yazan model, cümlenin kalanını onunla yaşamak zorundadır. Difüzyonla kod çözme bu kısıtı kaldırıyor: blok siz görmeden önce yazılıyor ve yeniden yazılıyor, yani model kendi erken hatalarını düzeltebiliyor. Bunun bir merak konusu olarak kalmasının sebebi maliyetti. Karşılığını vermeyebilecek bir mimariye kimse sınır düzeyinde bir eğitim koşusu harcamaz. Bu raporun gösterdiği şey, bahsin artık ucuz olduğu: elinizdeki bir modeli, onu inşa etmenin onda birinden aza dönüştürebiliyorsunuz. Bu da deneyi, düzgün açık ağırlığı olan her laboratuvarın erişimine sokuyor — ve bunlardan epeyce var. Dürüst sınır ise ince yazıda. Hız üstünlüğü gerçek sunucu yükü altında küçülüyor; dolayısıyla bugün en çok, tek kullanıcının gecikmesinin önemli olduğu yerde ilginç: cihaz üstü asistanlar, kod tamamlama, birinin oturmuş kelimelerin belirmesini beklediği her yer.

✓ Doğrulandı · 2 kaynak

WhatsApp X Telegram
Uygulamada oku — ücretsiz, 9 dilde

İlgili haberler

Bir model, bütün yapay zekâyı eğiten yöntem olmadan öğrendi.
2026-10-06
Matematikçiler beş açık problemi sıradan bir sohbet kutusuyla çözdü.
2026-10-05
Ham modeller, cilalı sürümlerinin çözemediği işleri çözdü.
2026-10-04
Sıradan fotoğraflarla eğitilen model akıl testinde %70 aldı.
2026-10-04
8.000 dolara eğitilen bir yapay zekâ Stratego ustasını yendi.
2026-10-03