动察 Beating AI hızlı haber: Anthropic, Claude Code'un resmi claude-api Skill'ine otomatik bir ayarlama iş akışı ekledi. build-eval önce gerçek konuşmalardan, hatalardan veya manuel örneklerden bir test seti ve puanlama yöntemi oluşturuyor; hillclimb ise Claude Code'a sistem Prompt'unu, araç açıklamalarını, modeli ve akıl yürütme yoğunluğunu tekrar tekrar değiştirtiyor. Her değişiklikten sonra testler yeniden çalıştırılıyor; sonuç iyileşirse korunuyor, kötüleşirse geri alınıyor.
Claude'un yalnızca test sorularına göre optimize etmesini önlemek için tüm örnekler birlikte ayarlanmıyor. Örneklerin bir kısmı sorunları bulmak ve yapılandırmayı değiştirmek için kullanılırken, başka bir grup örnek değişikliklerin daha önce görülmemiş sorunlarda işe yarayıp yaramadığını kontrol etmek için ayrılıyor. Eğer önceki puanlar yükselirken ayrılan test sonuçları iyileşmezse, bu değişiklik aşırı öğrenme (overfitting) olarak değerlendirilip geri çekilebiliyor.
Anthropic bu süreci 44 müşteri hizmetleri talebiyle gösterdi. Claude Code sırasıyla Prompt'u temizledi, iş kurallarını ekledi, farklı modeller denedi ve akıl yürütme yoğunluğunu düşürdü. Sonunda bir Sonnet 5 düşük effort yapılandırması bulundu. Ayarlamaya katılmayan 14 talepte doğruluk, başlangıç yapılandırmasındaki %78,6'dan %90,5'e yükseldi ve maliyet yaklaşık olarak öncekinin beşte birine düştü.
