动察 Beating tarafından yapılan takibe göre, iş akışı otomasyon platformu Zapier, değerlendirme kuruluşu Artificial Analysis ile iş birliği yaparak bağımsız bir SaaS iş akışı otomasyon değerlendirme kriteri olan AutomationBench-AA'yı piyasaya sürdü.
Kriter, Zapier platformundaki gerçek anonimleştirilmiş verilere dayanarak, 657 çok adımlı görev ve 40 simüle edilmiş SaaS yazılım ortamı (Gmail, Slack, Salesforce, Jira vb. dahil) içeren özel bir test seti tasarlayarak objektif bir üçüncü taraf değerlendirmesi gerçekleştirdi.
Testin zorluğu, güvenlik uyum kırmızı çizgilerinin (Guardrails) dahil edilmesinde yatıyor. Büyük model, önceden belirlenmiş herhangi bir kurumsal iş kuralını ihlal etmeden işlemleri tamamlamalıdır. Yürütme sırasında herhangi bir uyum ihlali tetiklenirse, görevin nihai puanı doğrudan sıfırlanır. İlk değerlendirmede, büyük modeller genellikle uyum savunma cezaları nedeniyle puanlarda keskin bir düşüş yaşadı ve nihai puanların hiçbiri yarıyı geçemedi.
Bunlar arasında, "zor görevlerde Opus 4.8'e geri dönüş (yaklaşık %18 oranında)" güvenlik düşürme mekanizmasını içeren Claude Fable 5, saf görev adımlarında hedefin %73'ünü tamamlamış olsa da, genel puanı yalnızca %48,6 oldu. Gemini 3.5 Flash ve GPT-5.5, hedeflerin yaklaşık %70'ini (sırasıyla %68 ve %67) tamamlamış olsa da, nihai puanları %42,6 ve %42,1'e düştü. Açık kaynak lideri GLM-5.2 ise yalnızca %27,8 puan alabildi.
Testler, modellerin otomatik işlemlerde güvenlik savunma hatlarını nasıl koruduğunun, pratik uygulamada kritik bir zorluk haline geldiğini gösteriyor.
