aiminute. ← Tüm AI haberleri
Araçlar AI Minute Newsroom 2026-08-24

Geliştiriciler çaba göstergesinin düşük okuduğunu fark etti. Anthropic sunum ayarlarını test ettiğini, sayının bu hafta farklı anlama geldiğini söylüyor.

Geliştiriciler çaba göstergesinin düşük okuduğunu fark etti. Anthropic sunum ayarlarını test ettiğini, sayının bu hafta farklı anlama geldiğini söylüyor.

22 Ağustos hafta sonunda Claude Code kullanıcıları, aracın "effort" (çaba) göstergesinin beklenmedik biçimde düşük değerler gösterdiğini — bir ekran görüntüsünde 100 üzerinden 10 — ve aynı işlerin Opus 5 ile eski Opus 4.6 arasında çok farklı davrandığını paylaştı; bir örnekte aynı iş için 43 dakikaya karşı 2 dakika. Başlık Hacker News'in ana sayfasına çıktı. Anthropic'te Claude Code ekibini yöneten Thariq, herkese açık biçimde yanıt vererek şirketin şu anda API sunum yapılandırmalarını test ettiğini ve bu test sırasında sayısal çaba değerinin normalden "farklı eşlendiğini" söyledi. Kullanıcının seçtiği çabanın aldığı çaba olduğunu, şirketin kendi değerlendirmelerinin performansta düşüş göstermediğini belirtti. Başlığın geri kalanı bu kadar kolay kapanmıyor: uzun bir kullanıcı dizisi Opus 5'in çıktısını istediklerinden daha uzun ve daha süslü buluyor, bazıları 4.6'ya ya da rakip araçlara dönüyor. Bunlar izlenim, ölçüm değil; model kalitesine dair izlenimler de meşhur şekilde güvenilmezdir. Ama Anthropic'in doğruladığı şey somut: arayüzde gösterilen bir sayı bu hafta geçen haftakiyle aynı anlama gelmiyordu.

Bu neden önemli?Bu küçük olayın, jeton bazında yetenek satın almak konusunda büyük bir dersi var. Bir model sağlayıcısından kiraladığınız şey sabit bir nesne değil: ağırlıklar sabit olabilir ama etraflarındaki sunum yapılandırması — nicemleme, yönlendirme, çaba eşlemesi, bağlam işleme — sürekli ayarlanıyor ve genellikle bir sürüm notu olmadan. Burada değişiklik görünür oldu çünkü ekrandaki bir sayıyı oynattı; bu tür değişikliklerin çoğu görünmez. İşiniz model davranışının sabit kalmasına bağlıysa, pratik yanıt kendi küçük değerlendirme setinizi tutup düzenli olarak çalıştırmaktır; sağlayıcının panosuna ya da "bir şeyler ters gidiyor" hissinize güvenmek değil. "Model kötüleşti" paylaşımlarına da dikkatle yaklaşın: bazen haklı çıkarlar, ama neredeyse hiçbir zaman kanıt değildirler.
#Kodlama#Ajanlar

✓ Doğrulandı · 2 kaynak

WhatsApp X Telegram
Uygulamada oku — ücretsiz, 9 dilde

İlgili haberler

300 milyon parametrelik bir model, büyüğünün ne diyeceğini tahmin ediyor — ve MacBook 2,87 kat hızlı yanıt veriyor
2026-08-23
'Ajanlarınızın' kaçı çok adımlı bir işi gözetimsiz bitiriyor diye soruldu; on şirketten yedisi 'dörtte biri ya da daha azı' dedi
2026-08-23
İnsanlar için değil, kod yazan ajanlar için kurulmuş bir arama dizini: 70 milyon README, issue ve pull request — denemek için anahtar bile gerekmiyor
2026-08-23
Yapay zekâyı araçlarınıza bağlayan standart, 'izin ver'e basan bir insan varsayımıyla kurulmuştu. Yeni yol haritası, arayanın artık bir makine olduğunu kabul ediyor.
2026-08-23
27 milyar parametrelik bir model, yayımlanmış makaleleri yeniden üretmede Opus 4.8 ve GPT-5.5'i geçti
2026-08-23