холивары «какая модель умнее» уже скучные. модели у всех плюс-минус одинаковые, а вот результаты - нет. реальный gap сейчас в другом: кто как оркеструет. повидал за последний год кучу сетапов - по сути все они складываются в три уровня. разберем от простого, так чтобы зашло даже если вы вчера поставили свой первый агент, а дальше нырнем глубже
теория на пальцах
модель сама по себе - это текст-в-текст: спросил - ответила. все.
агент - это модель, которую запустили в цикл и дали руки: терминал, файлы, браузер. сделала шаг - посмотрела что вышло - сделала следующий. и так пока задача не решена (или пока не кончился контекст, но об этом ниже)
оркестрация - это ответ на один вопрос: кто решает, что делать дальше. ты сам? агент? агент над агентами? крон по расписанию? от этого ответа зависит главная метрика - сколько твоего времени стоит одна фича
и сквозная мысль на весь пост: чем выше уровень, тем меньше решают промпты и тем больше решают правила. промпт живет одну сессию, правило (md файл, скилл, конвенция репозитория) - живет всегда. запомните, ниже пригодится
уровень 1 - ручник
сидишь в чате с агентом, контролируешь каждый шаг, каждый diff глазами. попросил - посмотрел - поправил - дальше
медленно? да. но насамом деле это обязательный этап, перепрыгивать его нельзя. именно тут калибруется доверие: ты узнаешь, что модель тащит сама, а где стабильно падает. без этой калибровки на верхних уровнях будешь либо перепроверять все (и тогда зачем автоматика), либо вообще не проверять (и тогда жди сюрпризов в проде)
ручник навсегда остается правильным режимом для двух вещей: критичный код (auth, деньги, миграции) и незнакомая кодовая база
уровень 2 - полуавтомат
ты все еще в чате, но говоришь уже не с исполнителем, а с оркестратором: агент сам спавнит других агентов и разруливает работу между ними. ты рулишь одним - он рулит десятью
зачем это, обьясняю просто: у агента лимит внимания, как у тебя в пятницу вечером. контекстное окно - самый дефицитный ресурс: прочитал двадцать файлов - начал забывать первые. сабагенты решают это разделением труда: каждый копает свой угол в своем чистом контексте, а наверх приносит только выжимку. оркестратор держит картину, воркеры - детали
как это выглядит в живых инструментах:
- сабагенты в Claude Code: главный агент раздает подзадачи, каждый сабагент со своим контекстом, работают параллельно
- threads control в Codex: одна сессия форкает от себя дочерние треды. киллер деталь - fork_context: форк наследует всю память родителя, тоесть клону не надо заново обьяснять проект. лимиты крутятся через agents.max_threads (дефолт 6 параллельных) и max_depth (дефолт 1 - чтобы клоны не плодили клонов до бесконечности)
уровень 3 - автомат
тут ты уже не в чате. тут три рабочих формата
лупы / cron
джоба запускается условно каждые 15 минут, ловит новый pull request, делает review, отвечает или мержит. без тебя
и вот тут возвращается мысль из начала: вся магия - в правилах. агент в лупе не думает «как правильно», он читает «как принято тут» - из репозитория, из md файлов, из скиллов. написал правила один раз - они отрабатывают каждые 15 минут вечно. очень недооцененный формат, работает жестко хорошо
spec-driven
дал спецификацию, ответил на вопросы агента и пошел по своим делам. вечером посмотрел что вышло
такой уровень дает Droid by Factory AI с его mission control. и килер фича там - микс моделей разных семейств в одном pipeline:
свежая жара по этой теме: GPT-5.6 Sol - новый фронтир OpenAI, вышел на прошлой неделе. по интеллекту на уровне Fable 5 от антропик, но токенно эффективнее (Altman заявляет -54% токенов на агентном кодинге) и примерно вдвое дешевле в реальных тасках. расклад для pipeline получается идеальный: Fable 5 думает и проверяет, Sol копает. умный планирует - эффективный исполняет
ultracode
и самый простой вход в полный автопилот - режим ultracode в Claude Code. разбивает таску на теже этапы: оркестрация/planning -> воркеры -> верификация. разница с Droid философская: у Droid этапы прибиты гвоздями, у ultracode они динамические - модель сама решает, как собрать workflow, сколько ей нужно воркеров, валидаций и retry. на схеме выше пунктир - это оно
лайфхак про подписки
за подписку Droid можно не платить. берете CLIProxyAPI или VibeProxy - они цепляют ваш существующий аккаунт Codex/Claude по oauth и экспозят локальный API прямо у вас на машине. дальше прописываете endpoint в config.json - и mission control крутится на подписках, которые у вас и так есть
*VibeProxy - только apple silicon, менюбар аппка. CLIProxyAPI - кроссплатформенный, go
вывод
уровень оркестрации = цена фичи в твоем времени. на ручнике платишь вечер, на полуавтомате - час, на автомате - пять минут на спеку и правила
и да, правила важнее промптов. с них и начните
спишь - агенты работают)
