Средно усилие, по-евтин модел: какво ни научиха 270 теста при избора на Claude модели
Съветът на Anthropic за най-новите им модели е прост: започнете със средно усилие и плащайте за повече само там, където сте измерили полза. Ние го измерихме върху собствената си работа. При добре специфицирано програмиране Claude Sonnet 5.5 на средно усилие се изравни с Claude Opus 5.5 при около 60% по-ниска цена по API. При ревю на код дори не се доближи.
От Ивайло Цветков, Съосновател

Какво препоръчва Anthropic
Ръководствата на Anthropic за Opus 5.5 и Sonnet 5.5 разглеждат усилието като настройка, която се калибрира, а не като ниво на качество, което се вдига до максимум.
- Opus 5.5 работи по подразбиране на средно усилие. Anthropic съветва xhigh и max да се пазят за задачи, при които сте измерили полза.
- Sonnet 5.5 работи по подразбиране на високо усилие. За агентно програмиране ръководството препоръчва да се започне от средно за добре специфицирани задачи и да се мине на високо за по-трудни или по-дълги.
- На ниско и средно усилие Sonnet 5.5 по-често спира, за да попита потребителя, преди да е приключил. Ръководството предлага кратка инструкция моделът да продължи, докато задачата е изпълнена.
- За избора на модел: Opus 5.5 остава ясно по-силен при сложна, отворена работа, която изисква продължителна преценка, а Sonnet 5.5 е най-силен при ясно очертани ежедневни задачи.
Съветът е разумен. Но оставя въпроса, на който всеки екип трябва да отговори сам: къде точно попада моята работа?
Как тествахме
Използваме система от AI агенти, която превръща писмени спецификации в работещ код, като отделен ревюър проверява всеки резултат. За да тестваме моделите, повторихме шест реални задачи по програмиране от тази система с техните оригинални входни данни.
- Оценка с реални тестове. Всяка задача беше оценена с приемните тестове, с които първоначално беше пусната, като процент преминали проверки.
- Правилата бяха записани предварително. Преди първото пускане фиксирахме какво се брои за „също толкова добро“ (разлика до 3 точки), нивото на увереност (90%) и прага за цена.
- Сдвоени и повторени пускания. Двата варианта работеха по едни и същи задачи по едно и също време, по 3 до 5 пъти. Единичните пускания подвеждат: една и съща задача на един и същ модел варираше с до 65 точки.
- Проверен реален модел. Проверявахме кой модел реално е отговорил при всяко пускане, вместо да разчитаме на поискания.
В четири експеримента това прави около 270 пускания.
Резултат 1: средното усилие е достатъчно
При Opus 5.5 средното усилие програмираше също толкова добре като високото в 48 сдвоени пускания и използваше около една четвърт по-малко време и токени. Средната разлика в резултата беше 0,1 точки.
- Първи кръг, 18 двойки: средното усилие напред с 3,7 точки, 24% по-малко време, 27% по-малко изходни токени.
- Втори кръг, 30 двойки: високото напред с 2,1 точки, 21% по-малко време и 23% по-малко токени при средно усилие.
- Общо, 48 двойки: разлика от 0,1 точки, напълно в рамките на шума.
Това директно потвърждава препоръката на Anthropic. По-ранно сравнение на xhigh с high показа същото: повече мислене не означаваше по-добър код при тези задачи.
Резултат 2: Sonnet 5.5 програмира като Opus 5.5
Sonnet 5.5 на средно усилие се изравни с Opus 5.5 и по шестте задачи, при около 60% по-ниска цена по API и около 40% по-малко време. Всеки вариант беше пуснат по 3 пъти на задача.
- Opus 5.5, средно: среден резултат 82,0, 1,28 млн. изходни токена.
- Sonnet 5.5, средно: 87,8, 1,02 млн. токена, 60% по-ниска цена на изходните токени.
- Sonnet 5.5, високо: 85,8, 1,60 млн. токена, 37% по-ниска цена.
- Sonnet 5.5, средно плюс инструкцията на Anthropic „продължи докрай“: 85,7, 0,92 млн. токена, 64% по-ниска цена.
И трите варианта на Sonnet минаха прага „не повече от 3 точки по-зле“, и нито една задача, която Opus надеждно решаваше, не беше провалена от Sonnet. Вдигането на Sonnet на високо усилие го направи по-бавен и по-скъп, но не и по-добър. Цените са по публичния ценоразпис на API: Sonnet $2/$10 и Opus $4/$20 за милион входни/изходни токена.
Резултат 3: ревюто на код е друга задача
Като ревюър на код Sonnet 5.5 откри 38 от 54 умишлено вкарани дефекта. Моделът Opus, който използваме за ревю, откри всичките 54. Тестът за ревю крие известни проблеми в завършени задачи, например отчет, който твърди за промяна, която я няма в кода, или правило в спецификацията, което може да се тълкува по два начина.
- Opus 5 на високо: 54 от 54.
- Opus 5.5 на високо: 49 от 54.
- Opus 5.5 на средно: 46 от 54.
- Sonnet 5.5 на високо: 38 от 54.
Най-слабото място на Sonnet бяха двусмислените правила в спецификацията, където откри 1 от 9. Това съвпада с позиционирането на самата Anthropic: работата, която изисква преценка, е там, където Opus запазва преднината си. Това, че един модел пише добре код, не го прави добър в оценяването му.
Още две неща, които си струва да знаете
На средно усилие Sonnet пита, преди да импровизира. В един вариант на теста всяко задание сочеше папка извън работното пространство на агента, докато същите файлове стояха в работната му папка. Opus намираше копията и продължаваше всеки път, както и Sonnet на високо усилие. Sonnet на средно спря да попита в 7 от 18 пускания. Това е поведението, което Anthropic описва. За агенти без надзор поддържайте заданията в пълно съответствие със средата и добавяйте инструкцията да продължат докрай.
Спецификацията е по-голям лост от модела. Разликите между задачите бяха много по-големи от разликите между моделите или нивата на усилие. Две задачи стигаха до около 70% при всички варианти, а най-ниските резултати идваха от една задача, чиято спецификация оставяше отворен формата на командния ред. Точното описание на интерфейсите и изходните формати е по-евтино от всяко обновяване на модела.
Съгласни ли сме с Anthropic?
Да, а нашите данни уточняват препоръките им на две места.
- Настройката по подразбиране на Sonnet. Sonnet 5.5 работи по подразбиране на високо усилие. При добре специфицирано програмиране средното постигна същия резултат с около една трета по-малко токени и време. Съветът на Anthropic за агентно програмиране е да се започне от средно; нашите числа казват да се остане там, освен ако задачата не се окаже по-трудна.
- „Програмирането“ не е една задача. Anthropic прокарва границата между ясно очертана работа и отворена преценка. Нашите резултати показват, че тази граница минава през самото програмиране: писането на код по ясна спецификация е ясно очертана работа и там Sonnet се изравни с Opus. Ревюто на този код е работа по преценка и там Opus остана ясно напред.
Какво използваме сега: Sonnet 5.5 на средно усилие пише кода, Opus 5.5 на средно се намесва, когато проверка се провали или спецификацията е отворена, а Opus прави ревюто. Препоръките на Anthropic дават посоката. Само вашите собствени тестове показват къде попада вашата работа.
Искате да обсъдим как това се отнася до Вашия бизнес? Запазете безплатен разговор.
Готови ли сте за AI?
Помагаме на компании да идентифицират, проектират и внедряват AI решения, които реално работят. Запишете безплатна консултация.
Запазете безплатен разговор →Свързани статии
Всички статии →AI чатбот за e-commerce поддръжка: какво да автоматизирате първо
Практична рамка за онлайн магазини: какво AI чатбот трябва да поеме първо — повтарящи се въпроси, продуктово ориентиране, политики и предаване към човек.
AI сигурността вече е въпрос при покупка
Mythos Preview на Anthropic и инцидент с инструменти на OpenAI сочат към едно: при избора на AI бизнесът трябва да оценява права, интеграции и риск — не само модела.
Защо местното студио за разработка е по-добро от фрилансер
Фрилансерите са евтини. Агенциите са скъпи. Бутиковите студия предлагат нещо по-добро: старши опит, пряка отговорност и без аутсорсинг.