Неделя началась с наблюдения, которое сначала звучало как частный случай, а к среде превратилось в общую жалобу. Участник под ником LSTR сказал, что модель многословна, противоречит сама себе и плохо работает на больших задачах анализа. Артур подхватил: текста стало больше, а единиц мысли в нем меньше, и достать их получается с трудом. Дмитрий, который параллельно купил подписку на конкурента, описал то же самое своими словами.
Дальше появилась гипотеза о причине. Станислав предположил, что вендор встраивает в тексты водяной знак для детекции сгенерированного, и это начинает сказываться на изложении. Андрей возразил по существу: водяной знак нельзя сделать так, чтобы он не отразился на структуре текста, разве что кодировать знаками препинания. Гипотеза остается гипотезой, но она объясняет ровно то, что все заметили: код модель пишет не хуже, а объясняет заметно хуже.
Интереснее реакции, чем сама жалоба. LSTR откатился на предыдущую версию и добавил в промпт «be brief and keep plain English». Азат повесил хук, который запрещает модели писать комментарии и markdown-файлы, потому что ее хлебом не корми, дай написать десятистраничный слоп. Артур пошел третьим путем и прогоняет ответы через другую модель. Три разные стратегии на одну и ту же проблему: закрепить версию, ограничить вывод, поставить переводчика.
Полезная рамка отсюда такая: качество модели не одномерно, и деградация может прийти в измерении, которого нет ни в одном бенчмарке. Кодинг остался на месте, а объяснения просели – и если ваш пайплайн опирается на то, что модель внятно передает контекст другим агентам, вы потеряете качество там, где не думали его мерить. Знаете ли вы, в каком измерении ваша модель важна для вас больше всего?
«Просто вижу текст, а единицы мыслей достать из них не получается, или получается с трудом. Раньше такого не было» – Артур
«Я привык, что опус делает хорошо и за ним не надо перепроверять, и для опус 4.8 это было валидно» – LSTR
Из жалобы выросла конфигурация, которая заслуживает отдельного разбора. У Артура две максимальные подписки, и долгое время вторая была запасной: либо одна модель, либо другая. Теперь они работают параллельно и по разным ролям. Одна пишет код, вторая переписывает за ней все тексты – документацию, HTML, объяснения, и она же ходит в интернет и исследует кодовые базы.
Самое неожиданное наблюдение в этой ветке: когда вторая модель работает сабагентом у первой, она справляется лучше нативных инструментов – просто потому, что результаты ее ресерча человекочитаемы и в таком виде ложатся в контекст оркестратора. То есть выигрыш не в том, что модель умнее, а в том, что она отдает наверх более чистый вход. Постпроцессинг при этом стоит немного токенов.
Артур сам задал следующий вопрос, на который ответа в чате не нашлось: а не пострадали ли менеджерские качества модели-оркестратора. Промпт для сабагента – это тоже текст. Если модель стала хуже формулировать мысли, то она хуже ставит задачи другим моделям, и деградация уходит на уровень ниже, где ее уже не видно глазами.
В сумме это довод в пользу того, что связка моделей по сильным сторонам перестает быть экзотикой. Не «какая модель лучше», а «какую роль в пайплайне кому отдать». А у вас в пайплайне одна модель делает все или роли уже разъехались?
«GLM стал сильно дополнять Claude Code и они работают вместе параллельно» – Артур
«Есть ощущение что когда GLM выступает в качестве Sub Agents for Opus 5/Fable 5, он даже лучше справляется чем нативные инструменты» – Артур
Станислав всю неделю вслух вел разработку личного приложения и приносил в чат цифры. В понедельник – двенадцать часов работы одного агента-оркестратора, сабагенты писали код и тесты, восемь долларов на дешевой модели, около 20% плана. В четверг – сорок долларов и примерно 70% плана. Цифры интересны не сами по себе, а тем, что между ними произошло.
Изменилось две вещи. Во-первых, модели пришлось брать умнее: не быструю, а сильную, потому что сложность приложения выросла и нужно разбирать, почему что-то не прошло по тестам. Во-вторых, пошли интеграции с внешними инструментами в части распознавания, а это требует экспериментов. Стоимость агентной разработки растет не линейно от объема кода, а скачками, когда меняется характер задач.
Отдельно стоит замкнутый цикл. После каждой завершенной задачи агенты гоняют UI-тесты, написанные во встроенном фреймворке платформы, и запускает их машина, а не агент. Дмитрий уточнил ровно этот момент, и это важное различие: агент пишет тест один раз, дальше его исполняет обычный раннер. Иначе за проверку вы платите токенами каждый прогон.
И бытовая деталь, которая тоже про разработку: чтобы обучить распознавание чеков, нужны реальные чеки, и Станислав два дня просил их у чата, а собрал в основном сам на заправках. Данные для маленького продукта достаются дороже кода. Сколько в вашем последнем прототипе стоил код и сколько – данные к нему?
«Один агент оркестрировал (собственно он и 12 часов работал), сабагенты выполняли работу» – Станислав
«Модели теперь использую умнее (не flash, а pro), потому что сложность приложения растет и нужно дополнительно разбирать, почему что-то не прошло по тестам» – Станислав
Артур рассказал, как за год сдвинулся его продукт по аналитике работы команд. Изначальная гипотеза была про продуктивность: поставим систему, инженеры будут больше кодить, посмотрим, работает контроль или нет. На практике покупают другое – разбор расходов организации по проектам и задачам, картину того, кто уже уверенно работает с ИИ, а кто пишет код руками, и удобочитаемые датасеты, по которым можно исследовать процессы вместе с моделью.
Второе смещение – в том, кто платит. Ожидали аутсорс, где время команды продается напрямую, а обнаружили продуктовые компании. Клиентов около двадцати, и уже не хватает инженеров первой и второй линии. Из технических деталей запомнилась одна: они видят процент попадания в кэш и процент выходов из него, и по их данным у одной модели около 90%, у другой около 70%.
Станислав ответил четырьмя возражениями, и они полезнее похвалы: есть способ оптимизации дешевле, чем разбираться, куда уходят траты в промпте, – просто переключиться на дешевые модели; организаций с построенным агентным пайплайном пока немного; двадцать клиентов – это еще не рынок; и есть оптимизации другого класса, которые бьют по той же боли. Артур на это заметил, что даже корпоративный пакет вендора не показывает разрезы по задачам и проектам.
Спор получился про типичную развилку раннего продукта: вы продаете видимость расходов или экономию расходов? Первое покупают, пока расходы непонятны. Второе – всегда. А вы бы заплатили за детальную аналитику ИИ-трат своей команды или сначала просто перевели бы половину задач на модель дешевле?
«Изначальная гипотеза была что систему буду использовать для эффективной работы... Но нащупали более существенные вещи чем просто контроль работает или не работает» – Артур
«20 клиентов – это немного, не сказать что это рынок» – Станислав
Разговор начался с локального запуска моделей на новых маках и быстро ушел в экономику. Андрей сформулировал позицию просто: покупать железо, потому что интеллектуальная собственность важнее денег, и это разовые расходы раз в год. LSTR добавил довод про независимость от противоречивого стороннего поставщика. Логика понятная и знакомая любому, кто помнит спор об аренде против покупки.
Азат возразил с другой стороны. Рынок токенов конкурентный до предела, поставщики спорят, кто быстрее дойдет до дна по цене. Рынок железа, наоборот, поднимает цены из-за спроса. Значит, пока равновесие не достигнуто, вложение в железо в пересчете на токены будет год от года хуже: цена токена падает быстрее, чем работает закон Мура. Плюс классический аргумент финансиста – деньги сейчас дороже денег потом.
Проверка реальностью пришла от Артура: под серьезную открытую модель нужен кластер, который они посчитали в 500 тысяч долларов. Андрей ответил, что для богатого рынка это зарплата пяти инженеров, а в странах победнее – пятнадцати, и тут же добавил, что обвязка выйдет дороже самого железа, и ее в смету обычно не закладывают. Станислав отметил встречный тренд: локальные модели требуют все больше ресурсов, и разовая покупка превращается в постоянную.
Разумный вывод из этой ветки не про деньги, а про критерий. Железо покупают под требование к данным, которое нельзя обойти, а не под экономию, потому что экономика тут ненадежна и меняется каждый квартал. Знаете ли вы точно, какая доля ваших данных действительно не может уйти наружу?
«Любой финансист скажет – деньги сейчас дороже денег потом» – Азат
«Лучше железо, чем зависеть от противоречивого third-party» – LSTR
Станислав принес разбор расследования взлома крупной платформы моделей. Ведущий исследователь называет свою работу slop-vestigation: в куче логов нормально не разберешься, приходится полагаться на ИИ, который выдумывает, ошибается и звучит уверенно. Вывод из отчета отрезвляющий: выводы аналитических агентов часто упускали ключевые детали, были неверными, самоуверенными или просто трудными для понимания.
И это был еще легкий случай. В отчете перечислены условия, которые сделали расследование возможным: агенты общались между собой на человеческом языке, а не через активации весов; агентов было всего 1200; они были не сильно умнее человека; и не было причин думать, что модели, помогающие расследованию, саботируют его. Каждый пункт этого списка со временем перестанет выполняться.
В чате зацепились за координацию: как вообще управляются 1200 агентов. Ответ оказался скучнее ожиданий – никак. Нашли место, где они писали сообщения и делились результатами, но это не управление, а толпа независимых агентов с общей доской. Тот самый случай, когда впечатляющая цифра описывает не архитектуру, а ее отсутствие.
Любопытно, что эта тема смыкается с первой темой недели. Там модель уверенно и многословно объясняет так, что мысль не достать. Здесь – уверенно и убедительно объясняет неверно, и цена ошибки уже другая. Готовы ли вы принимать решение по инциденту на основании разбора, который написала модель, без ручной сверки фактов?
«В этой куче логов нормально не разберешься – только полагаться на ИИ, который выдумывает, врет, ну все как обычно» – Станислав
«Это толпа агентов, каждый который действовал независимо и шарил свои результаты» – Станислав
Самая длинная дискуссия недели началась с предложения перевести туториал по TLA+ на казахский и переросла в спор о том, нужна ли вообще техническая литература на родном языке. Андрей занял радикальную позицию: английский дискриминирует людей в получении знаний, людям интересен их родной язык, а все остальное – лишние когнитивные затраты. И отдельно – если человек уходит в англоязычное пространство, он теряется для сообщества на родном языке, потому что общих точек соприкосновения не остается.
LSTR разложил вопрос на уровни и снял часть спора. Для техдоков достаточно чтения на уровне B2, для переписки нужна еще письменная часть, для работы в англоязычной среде – заметно больше, для жизни – еще шире. Отсюда его вывод: мост нужен на входе в область, а дальше он же начинает ограничивать кругозор своими пределами. Он же признал встречный довод: английский не только дискриминирует, но и унифицирует, давая общий словарь очень разным людям.
Станислав возражал с позиции скорости: ожидая все на родном языке, вы отстаете, потому что перевод требует времени, а индустрия успевает уйти вперед раньше, чем перевод выйдет. Его рамка получилась трехступенчатой – отсутствие литературы на родном языке это оправдание, отсутствие людей, способных учить на родном языке, это уже проблема, а отсутствие желания разбираться в неизвестной нише – проблема еще большая. Пример подвернулся сам: Канемана перевели на эстонский спустя пятнадцать лет после того, как его прочли в чате.
Показательно, чем разговор кончился. Андрей признал, что согласен со всеми тезисами оппонента, и объяснил свою жесткость целью: показать абсурдность намеков, что перевод базовой технической литературы это глупость. Станислав ответил, что поддерживает любого, кто переводит, и уже поддержал перевод PMBoK. Спор был не про факты, а про приоритет. Где для вашей команды проходит граница между «прочтите в оригинале» и «нужен перевод»?
«Я говорю что Английский дискриминирует людей в приобретении знаний» – Андрей
«Отсутствие литературы на родном языке – это оправдание. Отсутствие людей, кто может учить на родном языке – вот это уже проблема» – Станислав
В середине недели участник спросил, как остальные справляются с нервами, выгоранием и стрессом. Дальше выяснились подробности: 20 лет, четвертый год опыта, недавно сменил работу, много работает и получает мало, все раздражает. Ответы посыпались десятками, и разбор получился неожиданно системным для чата тимлидов.
Сначала отработали гипотезы. Отпуск и смена обстановки – отпадает, только вышел на новую работу. Дмитрий проверил тревожные признаки: нарушения сна, непонятные эффекты в теле – если есть, это повод идти к врачу, а не искать мотивацию. Их не оказалось. Азат спросил про соцсети и сформулировал механизм: если вы часто видите чужой успешный успех, вы сравниваете себя с картинкой, а картинка приукрашена. Айгерим и Андрей добавили простое – возраст тут ни при чем, и «я в твои годы» это плохой аргумент.
Дальше пошли рабочие советы: вести дневник или блог, чтобы структурировать мысли, попробовать психолога и не считать это чем-то постыдным, или просто поговорить с друзьями – у них, как заметила Айгерим, контекст уже прогружен и не надо рассказывать все заново. На вопрос «а можно вернуться в норму через модель» Азат ответил точно: очень опасно, у нее склонность к угодничеству и есть риск зарыться в кроличью нору глубже.
Через два дня участник вернулся и сказал, что советы помогли – он поговорил с товарищем и рассказал, что происходит. Никакой техники, кроме одной: назвать проблему вслух живому человеку. Для чата, где неделю обсуждали замену людей агентами, финал ироничный. Когда вы последний раз спрашивали своего человека в команде, как у него дела, и дожидались второго ответа?
«Человеку нужен человек, нужен социум, мы ведь существа социальные» – Айгерим
«Очень опасно. У него любовь к сикофансии и есть риск зарыться в кроличью нору еще больше» – Азат
Хотите продолжить обсуждение?
Обсудить в Telegram