BORKISS* / blog

orchestration

холивары «какая модель умнее» уже скучные. модели у всех плюс-минус одинаковые, а вот результаты - нет. реальный gap сейчас в другом: кто как оркеструет. повидал за последний год кучу сетапов - по сути все они складываются в три уровня. разберем от простого, так чтобы зашло даже если вы вчера поставили свой первый агент, а дальше нырнем глубже

теория на пальцах

модель сама по себе - это текст-в-текст: спросил - ответила. все.

агент - это модель, которую запустили в цикл и дали руки: терминал, файлы, браузер. сделала шаг - посмотрела что вышло - сделала следующий. и так пока задача не решена (или пока не кончился контекст, но об этом ниже)

оркестрация - это ответ на один вопрос: кто решает, что делать дальше. ты сам? агент? агент над агентами? крон по расписанию? от этого ответа зависит главная метрика - сколько твоего времени стоит одна фича

01 РУЧНИК каждый шаг - твой 02 ПОЛУАВТОМАТ ты рулишь оркестратором 03 АВТОМАТ правила работают без тебя - ты - агенты твоего времени на фичу: вечер -> час -> 5 минут
лестница оркестрации: чем выше - тем меньше тебя в цикле

и сквозная мысль на весь пост: чем выше уровень, тем меньше решают промпты и тем больше решают правила. промпт живет одну сессию, правило (md файл, скилл, конвенция репозитория) - живет всегда. запомните, ниже пригодится

уровень 1 - ручник

сидишь в чате с агентом, контролируешь каждый шаг, каждый diff глазами. попросил - посмотрел - поправил - дальше

медленно? да. но насамом деле это обязательный этап, перепрыгивать его нельзя. именно тут калибруется доверие: ты узнаешь, что модель тащит сама, а где стабильно падает. без этой калибровки на верхних уровнях будешь либо перепроверять все (и тогда зачем автоматика), либо вообще не проверять (и тогда жди сюрпризов в проде)

ручник навсегда остается правильным режимом для двух вещей: критичный код (auth, деньги, миграции) и незнакомая кодовая база

уровень 2 - полуавтомат

ты все еще в чате, но говоришь уже не с исполнителем, а с оркестратором: агент сам спавнит других агентов и разруливает работу между ними. ты рулишь одним - он рулит десятью

зачем это, обьясняю просто: у агента лимит внимания, как у тебя в пятницу вечером. контекстное окно - самый дефицитный ресурс: прочитал двадцать файлов - начал забывать первые. сабагенты решают это разделением труда: каждый копает свой угол в своем чистом контексте, а наверх приносит только выжимку. оркестратор держит картину, воркеры - детали

как это выглядит в живых инструментах:

  • сабагенты в Claude Code: главный агент раздает подзадачи, каждый сабагент со своим контекстом, работают параллельно
  • threads control в Codex: одна сессия форкает от себя дочерние треды. киллер деталь - fork_context: форк наследует всю память родителя, тоесть клону не надо заново обьяснять проект. лимиты крутятся через agents.max_threads (дефолт 6 параллельных) и max_depth (дефолт 1 - чтобы клоны не плодили клонов до бесконечности)

уровень 3 - автомат

тут ты уже не в чате. тут три рабочих формата

лупы / cron

джоба запускается условно каждые 15 минут, ловит новый pull request, делает review, отвечает или мержит. без тебя

и вот тут возвращается мысль из начала: вся магия - в правилах. агент в лупе не думает «как правильно», он читает «как принято тут» - из репозитория, из md файлов, из скиллов. написал правила один раз - они отрабатывают каждые 15 минут вечно. очень недооцененный формат, работает жестко хорошо

spec-driven

дал спецификацию, ответил на вопросы агента и пошел по своим делам. вечером посмотрел что вышло

такой уровень дает Droid by Factory AI с его mission control. и килер фича там - микс моделей разных семейств в одном pipeline:

спека ты, 5 минут planning fable 5 воркер · sol воркер · sol воркер · sol верификация fable 5 merge retry - сколько решит модель сплошное - этапы прибиты гвоздями (Droid mission control) пунктир - динамика: воркеры и retry решает модель (ultracode)
один pipeline - два семейства моделей: умный планирует, эффективный копает

свежая жара по этой теме: GPT-5.6 Sol - новый фронтир OpenAI, вышел на прошлой неделе. по интеллекту на уровне Fable 5 от антропик, но токенно эффективнее (Altman заявляет -54% токенов на агентном кодинге) и примерно вдвое дешевле в реальных тасках. расклад для pipeline получается идеальный: Fable 5 думает и проверяет, Sol копает. умный планирует - эффективный исполняет

ultracode

и самый простой вход в полный автопилот - режим ultracode в Claude Code. разбивает таску на теже этапы: оркестрация/planning -> воркеры -> верификация. разница с Droid философская: у Droid этапы прибиты гвоздями, у ultracode они динамические - модель сама решает, как собрать workflow, сколько ей нужно воркеров, валидаций и retry. на схеме выше пунктир - это оно

лайфхак про подписки

за подписку Droid можно не платить. берете CLIProxyAPI или VibeProxy - они цепляют ваш существующий аккаунт Codex/Claude по oauth и экспозят локальный API прямо у вас на машине. дальше прописываете endpoint в config.json - и mission control крутится на подписках, которые у вас и так есть

0$ сверху - все крутится у тебя на машине твои подписки Codex / Claude oauth CLIProxyAPI или VibeProxy localhost · config.json api Droid или любой другой tool
подписка уже оплачена - пусть работает во всех инструментах

*VibeProxy - только apple silicon, менюбар аппка. CLIProxyAPI - кроссплатформенный, go

вывод

уровень оркестрации = цена фичи в твоем времени. на ручнике платишь вечер, на полуавтомате - час, на автомате - пять минут на спеку и правила

и да, правила важнее промптов. с них и начните

спишь - агенты работают)