aiminute. ← Tüm AI haberleri
Yeni Modeller 2026-08-20

Model kendi görevlerini uyduruyor, onları sınayacak düzeneği kendi kuruyor, sonra çıkan sonuçla eğitiliyor — DeepReinforce ağırlıkları da bedava verdi

Model kendi görevlerini uyduruyor, onları sınayacak düzeneği kendi kuruyor, sonra çıkan sonuçla eğitiliyor — DeepReinforce ağırlıkları da bedava verdi

DeepReinforce 19 Ağustos'ta Ornith-1.5'i üç açık ağırlıklı boyda yayımladı: 397 milyar parametreli bir uzman karışımı, jeton başına 3 milyar parametre çalıştıran 35 milyarlık bir model ve 9 milyarlık yoğun bir model. Hepsi MIT lisanslı, ağırlıklar Hugging Face'te. Asıl ilginç olan boyutlar değil. Model, insanların yazdığı sabit bir görev listesinden öğrenmek yerine görevleri kendi öneriyor; her birini geçerlilik, zorluk ve yenilik açısından puanlıyor; o görevi çalıştıracak iskeleyi kendi yazıyor; sonra ürettiği çözüm denemeleri pekiştirmeli öğrenmeye geri besleniyor. Ekip buna kendi kendine iskele kurmaktan kendi kendini geliştirmeye geçiş diyor. Laboratuvarın kendi verdiği rakamlara göre 397B modeli Terminal-Bench 2.1'de 86,1 ve DeepSWE'de 56,0 alıyor; Claude Opus 4.8 aynı testlerde 85,0 ve 59,0, GLM-5.2 ise 82,7 ve 46,2. GPQA Diamond'da 92,8 bildiriliyor. Bağlam penceresi 262.144 jeton; model BF16 biçiminde yaklaşık 800 gigabayt, yani buradaki açıklık dizüstünüzde çalışacağı anlamına gelmiyor. Onu yapan sürüm, Terminal-Bench 2.1'de 47,0 ve SWE-bench Verified'da 70,6 alan 9B.

Bu neden önemli?Artık her laboratuvar iyi eğitim probleminin tükendiğini söylüyor. Bu, o soruna verilen bir cevap: müfredatı modelin kendisi yazsın. Tutarsa, yetenek tavanı insanların kaç düzgün problem yazabildiği olmaktan çıkıp, modelin kendi uydurduğu problemin çözülmeye değer olup olmadığını ne kadar iyi yargıladığı hâline gelir. Bu daha rahatsız edici bir darboğaz, çünkü kendi zorluğunu kendi notlayan bir sistem zor ama anlamsız problemlere savrulabilir. Ayrıca bunlar DeepReinforce'un kendi seçtiği testlerdeki kendi rakamları; bağımsız bir değerlendirme henüz gelmedi. Tartışmasız olan şey lisans. Terminal ajanı işinde amiral gemisiyle başa baş olduğunu söyleyen MIT lisanslı bir model, herkesin gözü önünde yükseltilmiş bir taban demek; kapalı bir modele erişim satan herkes artık fiyatını buna göre koymak zorunda.
#Kodlama#Ajanlar

✓ Doğrulandı · 4 kaynak

▶ İlgili video: Ornith-1.5 Ships 9B Dense, 35B and 397B MoE Models | Models & Agents #Shorts
WhatsApp X Telegram
Uygulamada oku — ücretsiz, 9 dilde

İlgili haberler

Söylenti: Bir kodlama kıyaslamasının tepesine ücretsiz oturan isimsiz modelin, Zhipu'nun yayınlanmamış amiral gemisi olduğu iddia ediliyor
2026-08-21
DeepSeek'in ucuz beygiri artık görüyor — göz gerektiren ajan görevlerinde Anthropic'in en iyisine yaklaştığını söylüyor
2026-08-21
Nvidia, rakibinin model üreten makinesine 6 milyar dolar ödüyor — ve o makineyi çalıştıran 109 kişiyi işe alıyor
2026-08-21
Yapay zekânın eğitilme biçimini iyileştirmek için dört saat ve bir GPU verildi: en iyi ajan 1 üzerinden 0,25 aldı — çoğu ise hiç denemedi
2026-08-21
ChatGPT artık iMessage'larınızı okuyup mesaj gönderebiliyor — ve sormayı atlatan ayar, OpenAI'ın uyardığı ayarın ta kendisi
2026-08-21