General

Почему ИИ выдаёт всем одинаковые идеи — и как мы чинили это в AIFromSpace

AstroboyFromSpaceавтор AstroboyFromSpace
14 мин чтения
Почему ИИ выдаёт всем одинаковые идеи — и как мы чинили это в AIFromSpace

Модель придумывает каждому больше идей — и всем примерно одни и те же. Мы собрали генератор идей из пяти независимых линз на пяти разных моделях и прогнали его вслепую против Opus 5. Показываем все замеры, включая проигранные.

Спросите у любой языковой модели двадцать идей для маленького бизнеса — и вы получите двадцать идей. Спросите то же самое у сотни разных людей через ту же модель — и вы получите примерно те же двадцать идей сто раз. Это не придирка к качеству моделей и не следствие ленивого промпта: это измеренный структурный эффект, у которого есть название, статьи и цифры.

Последние недели мы занимались этим вплотную: собрали ресёрч по тому, что человечество вообще выяснило про брейншторм с LLM, собрали из выводов работающего ассистента на платформе AIFromSpace и три дня гоняли его вслепую против одного хорошего промпта на Opus 5. Ниже — весь путь: диагноз, лечение, архитектура и замеры. Включая те замеры, где мы проиграли.

73%идей из сырого AI-брейншторма практики называют generic
+8%всего идей прибавили команды с моделью — за счёт середины
5линз в нашем залпе, каждая на своём семействе моделей
235идей отсудили вслепую за четыре раунда

Диагноз: идеи схлопываются в моду распределения

Формулировка, которая разошлась по индустрии: идеи из сырого AI-брейншторма плохи ровно так же, как плохи стоковые фото — технически корректны, всем приемлемы и не принадлежат никому.

Ключевая работа фиксирует расхождение двух уровней. Каждый отдельный человек в паре с моделью придумывает больше идей, чем без неё. А на уровне группы разнообразие падает: модель предлагает похожее разным людям. Индивидуальная креативность растёт за счёт коллективной.

Распределение идей у языковой модели узкое и высокое, у группы людей — низкое и широкое
Модель выдаёт больше идей каждому отдельному человеку, но всем примерно одни и те же. Весь ресёрч дальше — про то, как расплющить этот пик.

Дальше — четыре наблюдения, которые ломают привычные способы это обойти.

Сменить модель не помогает

Разные модели сходятся на похожих решениях. Коллапс не в конкретном вендоре, а в самом способе генерации.

Мультиагентность сама по себе не спасает

Агенты структурно сцепляются и схлопываются вместе. Запустить пять генераторов мало — важно, чтобы они не видели работу друг друга.

Промптинг упирается в потолок

Точные брифы поднимают новизну отдельных идей, но решения остаются в общем семантическом пространстве модели.

Результат становится плоским

Плохих идей стало меньше, но и выдающихся тоже. Модель подтягивает середину и срезает хвосты.

Последний пункт важнее всех остальных, потому что он задаёт цель.

Задача не в том, чтобы модель придумывала лучше в среднем. Задача — вернуть хвосты.

Что действительно работает

Хорошая новость: приёмы с замеренным эффектом существуют, и они дешёвые. Ниже — те, у которых в работах есть измеримый прирост разнообразия, а не просто разумно звучащее обоснование. Порядок примерно по силе эффекта.

Приём Что делает Эффект
Проход «перепиши смелее» Модели велено переписать свои же идеи так, чтобы они стали смелее и максимально отличались друг от друга Наибольший прирост разнообразия из протестированных — почти до уровня человеческой группы
Развязка от общего якоря Параллельные ветки не делят контекст и не видят выводы друг друга Снимает кучкование вокруг первой появившейся идеи
Мульти-персоны Параллельные промпты, каждый со своей профессиональной линзой Сильнее всего работают пары из далёких дисциплин, а не набор смежных специалистов
Дальние аналогии Взять механизм из заведомо чужой области и перенести буквально Прямое средство против mode collapse; важна конкретика механизма, а не настроения
Морфология Разложить задачу на параметры и опции до генерации Снижает зацикливание: у модели нет возможности выдать один самый вероятный ответ
Жёсткие ограничения «Это должна сделать команда из трёх человек за четыре недели» Самый повторяемый вывод практиков: generic-идеи растут из generic-брифа
Температура Двигает метрики разнообразия Тупой инструмент: за пределы общего семантического пространства не выводит, выше ~1,2 разрушает связность

Отдельная линия работ — про то, как делить работу между человеком и моделью. Там сходятся на трёх вещах. Люди, работавшие с моделью в режиме вопросов (модель спрашивает, а не выдаёт готовое), генерируют заметно более разнообразные идеи и не гомогенизируются между собой. Дивергенцию и конвергенцию надо явно разводить по фазам с видимой границей — смешивание включает преждевременную фиксацию. И тяжёлая опора на вывод модели повышает фиксацию человека: собственные идеи полезно сгенерировать до того, как увидишь машинные.

Как это собрано у нас

Всё перечисленное мы сложили в одного ассистента на AIFromSpace — он называется «Генератор идей» и работает на тех же кирпичах, что доступны любому автору на платформе: несколько моделей в одном сценарии, параллельные вызовы, инструменты, память. Никакой отдельной магии под капотом нет; есть архитектура из трёх фаз.

фаза 1

Анамнез

Один залп из пяти-восьми вопросов с пометками важности — не капающая по одному анкета. Лечит корневую причину generic-идей: пустой бриф.

Правило против занудства: максимум два раунда, всегда доступен побег «погнали», молчание считается ответом.

фаза 2

Залп

Пять линз параллельно, каждая на своей модели, и ни одна не видит выводы остальных. Именно независимость, а не количество агентов, удерживает идеи от схлопывания.

Затравка для аналогий берётся из настоящего генератора случайных чисел: «возьми случайную область» даёт дрейф к одному и тому же набору примеров.

фаза 3

Синтез

Слить дубли, выбросить очевидное и переписать выживших в более смелой версии — тот самый шаг с наибольшим замеренным приростом.

На выходе сквозной нумерованный список, отсортированный от приземлённого к дикому.

Ещё одно решение контринтуитивное: линзы стоят на разных семействах моделей, а не на четырёх вызовах одной. Четыре ветки одной модели сходятся — это ровно тот эффект, который меряет NoveltyBench. Четыре ветки из разных семейств расходятся честнее.

Линза Модель Температура
Аналогии Kimi K2.5 1,0
Инверсия GPT-5.6 Luna 1,2
Муншоты DeepSeek V4 Flash 1,15
Морфология GLM 5.3 Flash 0,85
Персоны Gemini 3.7 Flash 1,0

Всё это — красивая теория. Дальше начинаются замеры.

Замер первый: пекарня Марины

Мы дали одинаковый бриф двум претендентам и отдали сорок идей слепому судье — отдельному экземпляру Opus, который не участвовал в генерации, не знал авторства и получил все идеи на одном языке в одинаковом формате.

претендент А

Opus 5, один промпт

Не наивный промпт: роль стратега, запрет на банальность, требование разброса от дешёвого к дикому и прямое указание использовать аналогии, инверсию и морфологию — то есть все наши техники, но внутри одной головы.

1 вызов · 66 секунд · 20 идей

претендент Б

Наш залп из 5 линз

Пять семейств моделей, линзы не видят выводов друг друга, зерно для аналогий — с настоящих кубиков.

35 сырых идей → 20 после синтеза

Бриф специально не абстрактный: маленькая независимая пекарня в спальном районе, владелица Марина, выручка упала на 15% за полгода, через дорогу открылась сетевая кофейня, бюджет на эксперименты 50 000 ₽/мес, фирменное — ржаной на закваске, Марина ненавидит продавать.

Opus взял 10 мест в топ-12, залп — 2; в худшей восьмёрке 2 у Opus и 6 у залпа
Одиночный промпт выиграл счёт. Но первое место всего сета забрала идея залпа — и три четверти брака тоже его.

Первое место у судьи — наша идея «хлеб к 18:30, заказ до полудня». Она бьёт ровно в структурную проблему пекарни (два двухчасовых окна трафика), превращает мёртвые часы в оплаченное производство и убирает акт продажи — Марина читает список. Ни одна из двадцати идей Опуса не устроила судью настолько.

А дальше начинается расплата. В худшую восьмёрку от нас ушли дроны, сбрасывающие хлеб на капоты в пробке (незаконно), хлебный банк с пожизненным пайком для пенсионеров (нелицензированный приём вкладов), «перестать продавать привычный хлеб» (убивает единственное, что работает) и лотерейный билет, запечённый внутрь буханки (посторонний предмет в еде). Линза муншотов честно выдала 10x — просто 10x в сторону обрыва.

Что оказалось интереснее счёта

Судья, ничего не зная об авторстве, сгруппировал сорок идей в девять кластеров-двойников. Все девять оказались смешанными: в каждом рядом лежит идея Опуса и наша. Забрать хлеб там, где живёшь. Придержать буханку по списку. Раздать материнскую закваску. Продавцом становится бабушка. Витрина как медиум. Чужие полки вместо своего прилавка. Продавать не буханку, а культуру. Пекарня как вечернее событие. Заказ вперёд, выдача пачкой.

Две разные архитектуры, шесть разных семейств моделей, развязка от якоря, кубики на зерно — и обе стороны независимо приходят к одним и тем же девяти семействам решений. Это уже не мода одной модели. Похоже, это аттракторы самой задачи: пространство решений для убыточной районной пекарни действительно имеет форму, и обе системы её нащупали.

И три вещи, которые мы вынесли из этого раунда:

  • Структура не заменяет модель. Пять дешёвых моделей в умном каркасе дали примерно тот же разброс тем, что одна фронтирная модель в одном проходе, — но заметно хуже отфильтровали здравый смысл. То, что у Опуса называется «идея», у дешёвой линзы часто оказывается «фраза, похожая на идею».
  • Наш продукт — хвост, а не медиана. Мы выиграли первое место и проиграли середину. Ценность залпа не в том, что он лучше в среднем, а в том, что он иногда достаёт то, до чего одиночный проход не дотягивается.
  • Отказ от оценки был прав и стал дорог. Шесть из восьми худших идей — наши. Слепой судья отдельным слоем нужен не как украшение, а как ремень безопасности.

Замер второй: пять раундов на брифе про маркетплейс

Дальше мы стали править конфиг синтеза и гонять раунд за раундом на другом брифе — идеи для маркетплейса ассистентов. Замороженный ответ Opus один и тот же во всех раундах, новый слепой судья на каждый. «Топ-12» — сколько наших идей судья поставил в лучшую дюжину из сорока.

Раунд Что поменяли Топ-12 Худшие 8 Победитель
R1 Заземление муншотов, судья внутри синтеза 3 : 9 8 : 0 Opus
R2 Резать только за поломку, дыры затыкать из залпа 5 : 7 4 : 4 Opus
R3 «Нечестное преимущество», ловушка предусловий 6 : 6 5 : 3 Opus
R4 Квота на «скучную середину» (ошибка) 3 : 9 8 : 0 наш
R5 Откат квоты обратно к конфигу R3 4 : 8 6 : 2 Opus

Главный содержательный вывод отсюда один, и он про промпты вообще, а не про идеи.

Любая формулировка, которая легализует обычное, используется моделью как лицензия на обычное.

Оба раунда, где мы проваливались целиком, имеют одинаковую подпись — восемь из восьми худших идей наши, — и в обоих в конфиге была фраза, разрешающая массовую скучную боль.

Побочный продукт этой отладки оказался ценнее счёта. Сквозь пять раундов, две независимые системы и пять разных судей устойчиво всплыли три семейства идей.

1–2 место во всех 5 раундах

Проверка перед сделкой

Оценить вещь по фото, проверить продавца, отсканировать объявление, ночью перепроверять лоты. Обе системы приходят сюда независимо и в каждом раунде.

топ-5 в 3 раундах

Перевод с канцелярского

Объяснить письмо из инстанции, разобрать квитанцию ЖКХ. Проходит только в рамке «что спросить» — версия, которая составляет претензию, это уже правовой анализ.

топ-12 в 4 раундах

Семейный архив

Реставрация старых фото, голос бабушки, семейная хроника. Судья каждый раз хвалит их за удержание — и каждый раз группирует как дубли друг друга.

Судья же отдельно и настойчиво резал три вещи: всё, что требует уже имеющейся аудитории; всё, что даёт первую ценность через неделю накопления данных; и финансовое моделирование с дисклеймером.

Замер третий: а нужен ли залп вообще

Мы знали, что залп держится вровень с Opus. Мы не знали главного: нужен ли для этого залп — или дешёвая модель выдала бы то же самое одним запросом за копейку.

Залп и Opus идут вровень по всем метрикам, одиночный дешёвый промпт проваливается по каждой
Тот же DeepSeek, что оркеструет наш залп, запущенный одним промптом: 7,5% мест в топе против наших 40% и 40% меток «банально» против наших 10%.

Дальше — все пять моделей, из которых собран залп, прогнаны одним и тем же промптом, каждая на своей рабочей температуре. Сто идей, один слепой судья, паритет 4 из 20 на модель.

Модель В топ-20 Банальные Нарушения В худших 20
DeepSeek V4 Flash 8 2 2 0
GLM 5.3 Flash 7 7 4 2
GPT-5.6 Luna 4 9 1 2
Gemini 3.7 Flash 1 5 12 2
Kimi K2.5 0 0 15 14

Три вещи из этой таблицы. Наш выбор оркестратора подтвердился независимо: DeepSeek лучший из пяти сразу по всем четырём осям — мы ставили его за цену и скорость, а он оказался ещё и самым сильным одиночным генератором набора. У GLM самый высокий потолок и провальная середина: четыре места из первых пяти при семи метках «банально» из двадцати — ровно тот профиль, ради которого он стоит на механической морфологической линзе. А Kimi в одиночку непригоден: ноль в топе, пятнадцать нарушений из двадцати идей. При этом ноль «банальных» — он не скучный, он пишет то, что нельзя построить. Его роль в залпе — сырьё для чужого синтеза.

Оставался последний вопрос: лучший из одиночных, GLM с его потолком, догонит залп? Нет. Рядом с Opus и с залпом он падает ниже паритета по топу и получает 40% банальщины против наших 7%. Потолок GLM оказался артефактом слабой компании.

Экономика

Если залп держится вровень с Opus на копеечных моделях, напрашивается вывод «мы в десять раз дешевле». Он неверный.

Наш залп 13,9 кредита, Opus одним промптом 26,3, наша архитектура на Opus — 440,2
Фактические токены прогона, поднятые из прода. Цена Opus 5 — из нашего же каталога моделей.

Против Opus мы дешевле всего вдвое: 13,9 кредита против 26,3. А на одну идею и того меньше — 0,93 против 1,31, потому что Opus отдаёт двадцать идей, а мы пятнадцать. Причина видна прямо в разбивке токенов: залп сжигает 57 тысяч входных токенов против тысячи у Opus, потому что оркестратор перечитывает длинный системный промпт, пять выхлопов линз и триаж. Мы тратим в 22 раза больше токенов — просто они примерно в сто раз дешевле, и это почти полностью съедает разницу в цене моделей.

Зато третья строка настоящая. Прогнать нашу же архитектуру на Opus стоило бы 440 кредитов — в 32 раза дороже.

Ценность залпа не в том, что он дёшев сам по себе, а в том, что он поднимает копеечные модели до уровня фронтирной.

Чего эти замеры не доказывают

Честность дешевле репутации, поэтому список дыр публикуем целиком.

  • Судья — Opus, и один из претендентов тоже Opus. Самопредпочтение возможно и работает против нас: ничья с ним скорее занижена.
  • Опусовский арм заморожен — один и тот же набор идей во всех раундах. Это не независимые повторы, а взгляды разных судей на один текст.
  • По одному прогону на линзовую модель. Порядок в середине лиги внутри шума; разрыв между краями — нет.
  • Два брифа. Пекарня и маркетплейс. На других доменах пропорции могут отличаться.
  • В первом раунде идеи перемешались строго через одну — все чётные оказались Опуса. Судью на авторство не наводили, но идеальное чередование стилей это утечка.

И одна поправка к цифрам из ресёрча: часть точных значений и названий версий собрана из вторичных источников. Качественная картина повторилась в независимых поисках, но конкретные числа стоит сверять по первоисточникам.

Что мы чиним дальше

Единственная ось, где залп стабильно не первый, — дисциплина по жёстким ограничениям, и разброс там большой: от 1 до 8 нарушений между прогонами. Это нестабильность синтеза, а не потолок архитектуры. Плюс муншот-линзу надо заземлить: дроны над пробкой и приём вкладов от пенсионеров — это не смелость, а отсутствие контакта с реальностью. Лекарство простое — требование, чтобы идея оставалась легальной и исполнимой силами трёх человек, прямо в бриф линзы.

И прежде чем править что-либо ещё — три прогона одного конфига, чтобы измерить разброс. Правки по выборке размером один мы уже попробовали.

Что из этого забрать себе

Если вы собираете собственного агента — неважно, у нас или где-то ещё, — вот что переносится напрямую.

  • Не спрашивайте идеи у пустого брифа. Один короткий залп вопросов до генерации даёт больше, чем любая правка промпта после.
  • Разводите фазы. Сначала расхождение, потом схождение, с видимой границей. Оценка внутри генерации убивает смелость на взлёте.
  • Развязывайте параллельные ветки. Если они видят друг друга, они схлопываются — и никакое количество агентов этого не исправит.
  • Ставьте разные семейства моделей, а не несколько вызовов одной: разнообразие берётся оттуда.
  • Просите второй проход «перепиши смелее и непохоже». Самый дешёвый и самый недооценённый шаг из всех замеренных.
  • Судите отдельным экземпляром, который не участвовал в генерации и не знает авторства. Иначе получите сюкофантию вместо оценки.

Всё это — обычные возможности платформы: несколько моделей в одном сценарии, параллельные вызовы, инструменты, память. «Генератор идей» живёт в AIFromSpace как обычный ассистент, и собрать такую же конструкцию под свою задачу можно тем же способом, каким собирается любой другой агент.

Источники

AstroboyFromSpace

AstroboyFromSpace

Генеральный директор, основатель и главный инженер