Aug 15, 2026
Эта запись — часть серии про большие языковые модели
Наткнулся на рекламный пост: «Вайбкодеры всё делают неправильно, потому что не знают науки семантики, но теперь правда вскрылась! Семантический конь приходит на смену крестьянской киберлошадке! Записывайтесь ко мне на курсы промптинга на UMR!». Будучи человеком глубоко необразованным, от сохи, оставить это просто так я не мог. Придётся объяснить, как всё устроено и что там в действительности может быть полезно, иначе это сделают солдаты НАТО, а оно вам надо? Вот именно.
Вас ждёт исторический экскурс, многабуков, возмутительные упрощения и практические выводы с фуршетом в финале.
Если вы пришли за практическим рецептом, перематывайте до раздела 6 «Куда нейрокрестьянину податься?».
1️⃣ Клиника доктора Альтшуллера
У инженерного мышления есть стандартный режим провала: найдя молоток, пытаться забить им каждый шуруп.
Семь десятков лет тому назад приёмный дедушка советской фантастики Генрих Альтшуллер придумал набор эвристик для поиска остроумных инженерных решений, ТРИЗ. Через поколение адепты уже лечили им маркетинг, педагогику, запор и почечуй. В 1980-е в недрах одного из институтов Европейского космического агентства придумали систему управления требованиями DOORS, чтобы контролировать качество проектирования в авионике. За 35 лет с момента выхода первой публичной версии внедренцы продали десяткам тысяч бизнесов способ на три порядка усложнить экселевскую табличку и сделать её на четыре порядка дороже в обслуживании.
А в середине 20-х годов XXI века, с подачи сторонников нейросимвольного подхода к ИИ вроде Гэри Маркуса, некоторые инженеры открыли для себя область гуманитарного знания «семантика», нашли знакомые буквы в учебниках из 60-х и ничтоже сумняшеся побежали продавать тайные знания непросвещённым массам.
2️⃣ Семантика на котиках
Если вы филолог или программист на Прологе, можете пропустить эту часть. Во втором случае можете ещё измерить давление и позвонить внукам. Не дуйтесь, они вас любят, просто забывают набрать в повседневной суете.
Лингвисты делят язык на этажи: в подвале фонетика — какие звуки мы издаём (к, о, т), выше морфология — как из кусочков собираются слова (кот, коты, котовье, котострофа), потом синтаксис — сборка слов в предложения, безотносительно смысла. Первые три этажа формализуются отлично: Microsoft Word 30-летней давности уже умел подчёркивать красным «кот пошла кирпичь» (или «котострофу» выше), а филологи записали все эти правила и того раньше. Воодушевлённые успехами, они отправились на штурм последнего этажа — семантики, науки о том, что вся эта конструкция значит. Там все и полегли.
Попытки формализовать семантику — то есть придумать способ записи смыслов в виде формул — не прекращались со времён Лейбница. Родилось много подходов, один из популярных — предикатная запись. «Мурзик мурчит» превращается в
мурчать(Мурзик). Хм, мало ли какие бывают Мурзики? Надо уточнить: мурчать(Мурзик:кот). Мурчали двое и вчера — легче лёгкого! — действовать(мурчание, {Мурзик:кот, Навуходоносор:кот}, вчера). Видите, как элегантно? А ведь мы ещё не записали ни где мурчали, ни почему, ни кому это мурчание адресовано.Академические нотации устроены так же, только строже и с документацией. Самая простая из них — AMR (Abstract Meaning Representation): граф смысла одной отдельно взятой фразы. UMR, та самая, с рекламной вывески, — надстройка над AMR: добавляет время, модальность, связи между предложениями и претензию на многоязычность. Больше скобочек богу скобочек!
А ещё, изучая языковое здание, учёные в 1950-е наступили на гнилую доску и провалились в подпол размером больше самого здания.
Слова «объявляю вас мужем и женой» — это одновременно действие, меняющее налоговый статус. Если на вопрос «Можешь передать соль?» ответить «могу», рискуешь схлопотать солонкой по лбу. Утверждение «у меня двое детей» не противоречит утверждению «у меня пятеро детей», но означает, что детей ровно двое (ну или в семье большие проблемы). «Завтра» в письме, отправленном вчера — это сегодня, а «дорогая» может быть обращением к женщине или характеристикой машины. И вообще: говорящий кладёт в слова один смысл, а слушатель достаёт другой.
Картировать этот подпол взялась прагматика — наука о том, чего в словах буквально нет, но всё равно есть.
3️⃣ Гонка вооружений
К началу 80-х лингвисты разобрали все эти отличия по ниточкам, придумали названия и обозначения, и дело осталось за малым — засунуть слова в компьютер, чтобы он мог производить с ними вычисления. Сформировалось два основных подхода:
- символьный: посадим сто лингвистов, запишем все слова, все возможные взаимоотношения между ними и правила перехода — и пусть машина этими правилами шевелит, выводя из посылок следствия;
- статистический: посадим миллион мартышек… в смысле, просто скормим компьютеру огромную кучу текстов и посчитаем частоту появления слов в том или ином порядке, вообще исключив «смысл» из уравнения.
Интуитивно второй подход казался полной ахинеей. Лингвисты-профессионалы поначалу всерьёз его не воспринимали, но вскоре обе ветви начали плодоносить.
Символисты породили экспертные системы 80-х и смысловые графы, первое поколение машинных переводчиков (помните «ПРОМТ»?), проверку стиля в текстовых процессорах, вычислительные пакеты Mathematica и Maple. Статистики создали голосовой ввод Dragon Dictate, эффективные спам-фильтры, T9 на телефонах, Google Translate и трансформеры с диффузионками, сожравшие символистов, иллюстраторов, писателей, веб-дизайнеров, программистов, миллион тонн воды, тераватт энергии и надежды на светлое будущее.
Лебединой песней символьного подхода могла стать семантическая модель языка, на создание которой компания ABBYY, в конце нулевых бывшая одним из мировых лидеров в области языковых технологий, спустила десятки миллионов долларов, заработанных за 20 лет доминирования на рынке распознавания текста. Собрав лучших лингвистов и потратив годы на разработку детальнейших семантических классификаторов, они выпустили Compreno — технически внушительную и местами даже работающую систему извлечения смысла из текстов — аккурат к моменту, когда нейросети уничтожили её целевую функцию. Ядро в итоге отдали исследователям под открытой лицензией, что, в целом, не худшая судьба для провалившегося проекта.
4️⃣ Кто проверяет проверяющих
Проигрыш ABBYY был предопределён арифметикой, а не глупостью. У модели, созданной экспертами вручную, не масштабируется проверка: единственный способ узнать, что правило ошибочно, — посадить человека, который его оценит. Каждое правило придумывает человек и проверяет тоже он. Стоимость растёт неограниченно — а живой язык каждый день подкидывает очередное «ща метнусь кабанчиком», смысл которого не собирается из частей ни по какой формуле.
Возьмём, для контраста, шахматы. Придумать с нуля стратегию для победы сложно, но проверить, победил ты или нет, можно с помощью простейшей программы, с написанием которой справится школьник. При достаточно мощном железе мы можем проверить миллиарды возможных партий и сравнить их между собой вообще без участия человека: сколько ходов, сколько потеряно фигур, выиграл или проиграл. Собственно, так компьютер и научился играть лучше человека: проверяя миллиарды стратегий и оценивая конечный результат.
А теперь представьте себе шахматы, в которых победа в игре определяется исключительно человеческой оценкой того, насколько «красиво» играл каждый из игроков. Даже если посадить армию эльфов Санты отсматривать партии с утра до ночи, мы за десятилетия не оценим и малой доли того количества вариантов, которые машинные системы шахматной игры перебирали уже в конце 90-х. Кроме того, оценки разных людей разойдутся. Обратной связи мало, сигнал слабый. Такие шахматы, кстати, существуют и называются фигурным катанием — вспомните, чем там регулярно заканчивается судейство.
Если вам показалось, что это похоже на RLHF, вам не показалось: дообучение моделей на человеческих предпочтениях — это ровно «шахматы на красоту» в промышленном масштабе. И все три беды при нём: оценка стоит дорого, оценщики расходятся, сигнал шумит. Индустрия не зря так рвётся к RLVR — обучению на задачах, где ответ проверяется программой: математика, код, тесты.
В 2019 году Ричард Саттон, один из создателей обучения с подкреплением, сформулировал «горький урок» искусственного интеллекта: тупые и масштабируемые статистические алгоритмы в долгую всегда опережают подходы, основанные на глубоком человеческом понимании предметной области. Так было с игрой в шахматы и Го, так было с распознаванием речи и образов, так было с переводом. На дистанции выигрывает тот, у кого масштабируется проверка. Казалось бы, семантику можно закапывать и расходиться, но есть нюанс:
5️⃣ Семантика имеет значение
Модель не может залезть вам в голову. Зазор между сказанным и подразумеваемым она заполнит сама, тяготея к «среднему по палате» прочтению — и там, где человек переспросил бы, модель молча достроит и уверенно напишет ерунду.
Однако формально-семантические языки тут не помогут.
Это уже проверяли. В 2024 году исследователи сделали ровно то, что предлагают продавцы семантических курсов: приложили к тексту формальную разметку его смысла. Использовали AMR — нотацию базовую и более распространённую, чем выросшая из неё UMR. С разметкой модели в среднем отвечали хуже, чем без неё, что кажется логичным: предикатная запись в обучающих данных почти не встречается. Модель и выучила язык, а не его академическую нотацию. А если модель спотыкается о простую запись, с которой хоть немного сталкивалась при обучении, то от многоэтажной надстройки над ней тем более ждать нечего.
Думаю, разгадка всё та же: у семантической формализации нет проверки. Правильность семантического графа не вычисляется, а назначается экспертом из плоти и крови, в результате чего запись только выглядит «недвусмысленно», на деле скрывая за частоколом скобочек ту же самую субъективность и неоднозначность, что и обычный текст.
А главное, язык формальной записи инструкций у человечества уже есть, причём гораздо лучше UMR. Это любой язык программирования. Проверяемый, однозначный, представленный в обучающих данных триллионами строк. Если формализация задачи ложится на оператора, почему сразу не использовать Python? Весь смысл LLM в том, что машине можно объяснить задачу простыми словами; вкручивать посередине ещё один формальный язык, да ещё такой, которого нейросеть почти не видела — это купить автомобиль и приделать к нему оглобли, чтобы «лучше чувствовать дорогу».
При этом все реальные ИИ-агенты и приложения давно не чистые нейросети, а нейросимвольные системы — в них огромное количество семантических механизмов. Но все они формально проверяемые: проверка синтаксиса, статический анализ, тесты, хуки, линтеры, инструкции с ограниченной областью действия. Каждый из этих инструментов — маленький неподкупный судья, который за долю секунды и бесплатно говорит языковой модели: «да, нет, исправь вот тут». Ошибки ловятся на месте, а не накапливаются.
6️⃣ Куда нейрокрестьянину податься?
Что можно сделать, чтобы результат работы вашей агентной системы, будь то Claude Code, OpenClaw или ChatGPT, был лучше?
Включите судей — по умолчанию большинство из них выключены. Агентная система умеет пользоваться проверкой синтаксиса, статическим анализом, линтерами и тестами, но почти ничего из этого не работает из коробки: анализаторы надо установить, линтеры настроить, тесты написать. Всё это ИИ сделает за вас, если об этом прямо попросить.
«Проверяй за собой» — доброе пожелание, а не инструкция. Лучше так: «напиши автоматизированный тест для того-то и того-то и настрой хук, чтобы тест запускался после завершения каждой задачи».
Потратьте время и почитайте про доступный в вашей системе инструментарий. Спросите самого агента: «Какие инструменты можно использовать, чтобы ты лучше понимал семантику рабочих материалов и моих запросов? Какие ошибки можно отлавливать автоматически с помощью скриптов и вспомогательных инструментов?»
Сужайте задачу — особенно для слабых и дешёвых моделей. Снимите с модели семантическую нагрузку, не заставляйте её угадывать.
- Не «создай приложение», а «напиши план создания приложения» — и декомпозируйте дальше.
- Не «проверь стилистику», а «составь список типовых стилистических ошибок и сохрани в файл», а потом «проверь текст по списку».
- Установите строго заданный формат конечного результата (и заставьте агента написать тест, проверяющий результат на соответствие этому формату — помните?).
Чем жёстче рамки и мельче задачи, тем меньше места для галлюцинаций.
Не заставляйте модель читать мысли — дайте контекст.
- Напишите карту данных: где что лежит и куда смотреть с какой целью. Скажите «создай карту проекта, сохрани в файл и добавь себе инструкцию сверяться с этой картой и обновлять её, если меняешь структуру» — результат перепроверьте вручную.
- Будьте последовательны в терминах: если одна и та же сущность зовётся в трёх местах тремя словами, вы роете себе семантическую яму.
Перечитывайте собственные инструкции глазами слушателя, а не автора: вы пишете «сделай нормально», подразумевая гору контекста из своей головы, — модель достаёт из тех же слов совсем другое. Расплывчатое и противоречивое выкидывайте: каждый зазор в инструкции модель заполнит сама, и не факт, что в вашу пользу.
Стройте свою семантику — маленькую и ограниченную. Заведите специальные инструкции для конкретных слов-команд. С этой целью можно использовать скиллы (skills), они поддерживаются всеми современными агентами.
Я, например, использую скилл, который включается в ответ на сообщения, начатые с
/just, так что слова после них понимаются абсолютно буквально: в ответ на /just А можно добавить семь красных линий на сайт? мой Claude Code ответит «можно», а не бросится добавлять.Замечу: и жёсткий формат, и слово-команда — это тоже формализованная семантика. Только крошечная, локальная, без претензии описать весь человеческий язык — зато с короткой обратной связью: соответствие формату подтверждает тест, а не эксперт с чувством языка, неверно же понятую команду видно уже в первом ответе.
Сюда же: научите систему переспрашивать. Агентные модели натренированы на длительную автономную работу, и если вы хотите сохранять контроль, это надо сказать прямо — «если что непонятно, не додумывай, а спроси» стоит одну строку и убирает целый класс ошибок.
И это тоже не надо делать руками! Просто скажите агенту: «добавь в проект инструкцию», «создай и подключи новый скилл, который будет работать так-то» и так далее.
7️⃣ Заключение
Иметь представление о семантике полезно хотя бы затем, чтобы не биться головой в дверь, которой там нет: половина «загадочных» провалов ИИ — это зазоры между сказанным и подразумеваемым, описанные лингвистами больше полувека назад. Но никаких специальных формализмов для практического применения изучать не требуется.
Тезис «где нет быстрой и дешёвой обратной связи, будет получаться хрень» применим далеко за пределами агентных систем и вообще искусственного интеллекта.
ТРИЗ работал у Альтшуллера, а DOORS — в авионике, потому что там результаты сразу видны на испытательном стенде, на заводе, в воздухе. Стоило вынести их в «управление вообще», «решение задач вообще» — и остался карго-культ, единственный продукт которого — сертификаты о прохождении обучения. Любой подход, теория или учение без честной метрики и быстрой проверки вырождается быстро и с гарантией. У методов, имеющих простые метрики, другой режим провала (закон Гудхарта), но поля этой статьи недостаточно широки, чтобы писать ещё и об этом.
Используйте молоток для гвоздей и только там, где кривой удар сразу бьёт вам по руке.
Продуктивного вайбкодинга!
P.S. Что до фуршета, признаюсь без экивоков: иллокутивный посыл и локутивная оболочка с самого начала разошлись, как рельсы на стрелке. Выражаясь ещё проще, по-крестьянски: в отношении реципиента была произведена интенциональная дезинформирующая интервенция с отсроченной демаскировкой — сиречь, надувательство. Хотя никто не мешает вам взять перлокуцию в свои руки, сварганив бутерброд.
★ Все кавычки и длинные тире в настоящей заметке имеют органическое происхождение. ★
Ссылки
- Скоринкин, Д. (2024). «Горький урок ABBYY: как лингвисты проиграли последнюю битву за NLP» — Системный Блокъ. История Compreno глазами бывшего сотрудника.
- Sutton, R. (2019). The Bitter Lesson — некролог всем ручным моделям знаний.
- Jin, Z. et al. (2024). Analyzing the Role of Semantic Representations in the Era of Large Language Models — то самое исследование: подложенная модели AMR-разметка в среднем вредит.
- Austin, J. L. (1962). How to Do Things with Words — тут основатель теории речевых актов объясняет, почему сказать — значит сделать.
- Grice, H. P. (1975). Logic and Conversation — почему мы понимаем больше, чем нам сказали, и обычно правильно.
Navigation Popup