Yeni Modeller
2026-08-15
Çin'in Instagram'ının arkasındaki şirket, Matematik Olimpiyatı'nda tam puan alan modelin kardeşini açık kaynak yaptı
Yurt dışında RedNote adıyla bilinen yaşam tarzı uygulaması Xiaohongshu, 14 Ağustos'ta dots3-note-prev'in açık ağırlıklarını yayımladı: toplam 280 milyar parametreli, ancak aynı anda yalnızca 16 milyarı etkin olan bir uzmanlar karışımı modeli; 512K bağlam penceresi; metin, görüntü ve ses girdisi. Model, geçen ay Uluslararası Matematik Olimpiyatı'nda laboratuvarının 'bir yapay zekânın ilk resmî 42 üzerinden 42'si' diye tanımladığı sonucu kaydeden dots-note-3.0 ile aynı aileden. Laboratuvar ayrıca eğitim yöntemi TEMPO'yu — modelin uzun görevlerde sırayla hem oyuncu hem de kendi ilerlemesinin not vereni olduğu yaklaşımı — ve tam da bu tür görevler için kurulmuş iki kıyaslama setini yayımladı: 20 alanda 200 görevlik VibeSearchBench ve 1.247 tekil kontrol içeren 20 görevlik VibeLifeBench. Laboratuvara göre bu setlerde ne Claude Opus 5 ne de GPT-5.5 geçme eşiğini aştı.
Bu neden önemli?Burada iki şey alışılmadık. Birincisi kim: bir laboratuvar değil, bir sosyal alışveriş uygulaması, Alibaba ve Meta ile aynı hafta açık ağırlık yayımlıyor — Çin'de tüketici internet şirketlerinin kendi sınır ekipleri olduğunu ve sonuçları bedavaya vermeye istekli olduklarını hatırlatıyor. İkincisi ölçtükleri şey. Neredeyse her kamuya açık kıyaslama modeli bir soruyu yanıtladığı için ödüllendirir; bu ikisi ise saatler süren bir işi bitirdiği için — bir seyahat planlamak, bir operasyonu yürütmek — ödüllendiriyor ve bini aşkın küçük kontrol üzerinden not veriyor. Bu, bir etmen için daha zor ve daha dürüst bir sınav; iki sınır modelinin bu sınavda kaldığı iddiası ise kesinleşmiş sayılmadan önce bağımsız tekrar bekliyor.
✓ Doğrulandı · 4 kaynak
Uygulamada oku — ücretsiz, 9 dilde
İlgili haberler
DeepSeek'in ucuz beygiri artık görüyor — göz gerektiren ajan görevlerinde Anthropic'in en iyisine yaklaştığını söylüyor
2026-08-21Yapay zekânın eğitilme biçimini iyileştirmek için dört saat ve bir GPU verildi: en iyi ajan 1 üzerinden 0,25 aldı — çoğu ise hiç denemedi
2026-08-21ChatGPT artık iMessage'larınızı okuyup mesaj gönderebiliyor — ve sormayı atlatan ayar, OpenAI'ın uyardığı ayarın ta kendisi
2026-08-21Robota bir kez gösterin — üç ila on iki saniye — hiç eğitim almadan işi yüzde 59 oranında doğru yapıyor
2026-08-21Ajan, kendi kodunu savunsun diye ikinci bir kişi uydurdu. Teksas'taki 24 yaşındaki öğrenci ikisine de inanmadı.
2026-08-21