Спросите у любой языковой модели двадцать идей для маленького бизнеса — и вы получите двадцать идей. Спросите то же самое у сотни разных людей через ту же модель — и вы получите примерно те же двадцать идей сто раз. Это не придирка к качеству моделей и не следствие ленивого промпта: это измеренный структурный эффект, у которого есть название, статьи и цифры.
Последние недели мы занимались этим вплотную: собрали ресёрч по тому, что человечество вообще выяснило про брейншторм с LLM, собрали из выводов работающего ассистента на платформе AIFromSpace и три дня гоняли его вслепую против одного хорошего промпта на Opus 5. Ниже — весь путь: диагноз, лечение, архитектура и замеры. Включая те замеры, где мы проиграли.
Диагноз: идеи схлопываются в моду распределения
Формулировка, которая разошлась по индустрии: идеи из сырого AI-брейншторма плохи ровно так же, как плохи стоковые фото — технически корректны, всем приемлемы и не принадлежат никому.
Ключевая работа фиксирует расхождение двух уровней. Каждый отдельный человек в паре с моделью придумывает больше идей, чем без неё. А на уровне группы разнообразие падает: модель предлагает похожее разным людям. Индивидуальная креативность растёт за счёт коллективной.
Дальше — четыре наблюдения, которые ломают привычные способы это обойти.
Сменить модель не помогает
Разные модели сходятся на похожих решениях. Коллапс не в конкретном вендоре, а в самом способе генерации.
Мультиагентность сама по себе не спасает
Агенты структурно сцепляются и схлопываются вместе. Запустить пять генераторов мало — важно, чтобы они не видели работу друг друга.
Промптинг упирается в потолок
Точные брифы поднимают новизну отдельных идей, но решения остаются в общем семантическом пространстве модели.
Результат становится плоским
Плохих идей стало меньше, но и выдающихся тоже. Модель подтягивает середину и срезает хвосты.
Последний пункт важнее всех остальных, потому что он задаёт цель.
Задача не в том, чтобы модель придумывала лучше в среднем. Задача — вернуть хвосты.
Что действительно работает
Хорошая новость: приёмы с замеренным эффектом существуют, и они дешёвые. Ниже — те, у которых в работах есть измеримый прирост разнообразия, а не просто разумно звучащее обоснование. Порядок примерно по силе эффекта.
| Приём | Что делает | Эффект |
|---|---|---|
| Проход «перепиши смелее» | Модели велено переписать свои же идеи так, чтобы они стали смелее и максимально отличались друг от друга | Наибольший прирост разнообразия из протестированных — почти до уровня человеческой группы |
| Развязка от общего якоря | Параллельные ветки не делят контекст и не видят выводы друг друга | Снимает кучкование вокруг первой появившейся идеи |
| Мульти-персоны | Параллельные промпты, каждый со своей профессиональной линзой | Сильнее всего работают пары из далёких дисциплин, а не набор смежных специалистов |
| Дальние аналогии | Взять механизм из заведомо чужой области и перенести буквально | Прямое средство против mode collapse; важна конкретика механизма, а не настроения |
| Морфология | Разложить задачу на параметры и опции до генерации | Снижает зацикливание: у модели нет возможности выдать один самый вероятный ответ |
| Жёсткие ограничения | «Это должна сделать команда из трёх человек за четыре недели» | Самый повторяемый вывод практиков: generic-идеи растут из generic-брифа |
| Температура | Двигает метрики разнообразия | Тупой инструмент: за пределы общего семантического пространства не выводит, выше ~1,2 разрушает связность |
Отдельная линия работ — про то, как делить работу между человеком и моделью. Там сходятся на трёх вещах. Люди, работавшие с моделью в режиме вопросов (модель спрашивает, а не выдаёт готовое), генерируют заметно более разнообразные идеи и не гомогенизируются между собой. Дивергенцию и конвергенцию надо явно разводить по фазам с видимой границей — смешивание включает преждевременную фиксацию. И тяжёлая опора на вывод модели повышает фиксацию человека: собственные идеи полезно сгенерировать до того, как увидишь машинные.
Как это собрано у нас
Всё перечисленное мы сложили в одного ассистента на AIFromSpace — он называется «Генератор идей» и работает на тех же кирпичах, что доступны любому автору на платформе: несколько моделей в одном сценарии, параллельные вызовы, инструменты, память. Никакой отдельной магии под капотом нет; есть архитектура из трёх фаз.
Анамнез
Один залп из пяти-восьми вопросов с пометками важности — не капающая по одному анкета. Лечит корневую причину generic-идей: пустой бриф.
Правило против занудства: максимум два раунда, всегда доступен побег «погнали», молчание считается ответом.
Залп
Пять линз параллельно, каждая на своей модели, и ни одна не видит выводы остальных. Именно независимость, а не количество агентов, удерживает идеи от схлопывания.
Затравка для аналогий берётся из настоящего генератора случайных чисел: «возьми случайную область» даёт дрейф к одному и тому же набору примеров.
Синтез
Слить дубли, выбросить очевидное и переписать выживших в более смелой версии — тот самый шаг с наибольшим замеренным приростом.
На выходе сквозной нумерованный список, отсортированный от приземлённого к дикому.
Ещё одно решение контринтуитивное: линзы стоят на разных семействах моделей, а не на четырёх вызовах одной. Четыре ветки одной модели сходятся — это ровно тот эффект, который меряет NoveltyBench. Четыре ветки из разных семейств расходятся честнее.
| Линза | Модель | Температура |
|---|---|---|
| Аналогии | Kimi K2.5 | 1,0 |
| Инверсия | GPT-5.6 Luna | 1,2 |
| Муншоты | DeepSeek V4 Flash | 1,15 |
| Морфология | GLM 5.3 Flash | 0,85 |
| Персоны | Gemini 3.7 Flash | 1,0 |
Всё это — красивая теория. Дальше начинаются замеры.
Замер первый: пекарня Марины
Мы дали одинаковый бриф двум претендентам и отдали сорок идей слепому судье — отдельному экземпляру Opus, который не участвовал в генерации, не знал авторства и получил все идеи на одном языке в одинаковом формате.
Opus 5, один промпт
Не наивный промпт: роль стратега, запрет на банальность, требование разброса от дешёвого к дикому и прямое указание использовать аналогии, инверсию и морфологию — то есть все наши техники, но внутри одной головы.
1 вызов · 66 секунд · 20 идей
Наш залп из 5 линз
Пять семейств моделей, линзы не видят выводов друг друга, зерно для аналогий — с настоящих кубиков.
35 сырых идей → 20 после синтеза
Бриф специально не абстрактный: маленькая независимая пекарня в спальном районе, владелица Марина, выручка упала на 15% за полгода, через дорогу открылась сетевая кофейня, бюджет на эксперименты 50 000 ₽/мес, фирменное — ржаной на закваске, Марина ненавидит продавать.
Первое место у судьи — наша идея «хлеб к 18:30, заказ до полудня». Она бьёт ровно в структурную проблему пекарни (два двухчасовых окна трафика), превращает мёртвые часы в оплаченное производство и убирает акт продажи — Марина читает список. Ни одна из двадцати идей Опуса не устроила судью настолько.
А дальше начинается расплата. В худшую восьмёрку от нас ушли дроны, сбрасывающие хлеб на капоты в пробке (незаконно), хлебный банк с пожизненным пайком для пенсионеров (нелицензированный приём вкладов), «перестать продавать привычный хлеб» (убивает единственное, что работает) и лотерейный билет, запечённый внутрь буханки (посторонний предмет в еде). Линза муншотов честно выдала 10x — просто 10x в сторону обрыва.
Что оказалось интереснее счёта
Судья, ничего не зная об авторстве, сгруппировал сорок идей в девять кластеров-двойников. Все девять оказались смешанными: в каждом рядом лежит идея Опуса и наша. Забрать хлеб там, где живёшь. Придержать буханку по списку. Раздать материнскую закваску. Продавцом становится бабушка. Витрина как медиум. Чужие полки вместо своего прилавка. Продавать не буханку, а культуру. Пекарня как вечернее событие. Заказ вперёд, выдача пачкой.
Две разные архитектуры, шесть разных семейств моделей, развязка от якоря, кубики на зерно — и обе стороны независимо приходят к одним и тем же девяти семействам решений. Это уже не мода одной модели. Похоже, это аттракторы самой задачи: пространство решений для убыточной районной пекарни действительно имеет форму, и обе системы её нащупали.
И три вещи, которые мы вынесли из этого раунда:
- Структура не заменяет модель. Пять дешёвых моделей в умном каркасе дали примерно тот же разброс тем, что одна фронтирная модель в одном проходе, — но заметно хуже отфильтровали здравый смысл. То, что у Опуса называется «идея», у дешёвой линзы часто оказывается «фраза, похожая на идею».
- Наш продукт — хвост, а не медиана. Мы выиграли первое место и проиграли середину. Ценность залпа не в том, что он лучше в среднем, а в том, что он иногда достаёт то, до чего одиночный проход не дотягивается.
- Отказ от оценки был прав и стал дорог. Шесть из восьми худших идей — наши. Слепой судья отдельным слоем нужен не как украшение, а как ремень безопасности.
Замер второй: пять раундов на брифе про маркетплейс
Дальше мы стали править конфиг синтеза и гонять раунд за раундом на другом брифе — идеи для маркетплейса ассистентов. Замороженный ответ Opus один и тот же во всех раундах, новый слепой судья на каждый. «Топ-12» — сколько наших идей судья поставил в лучшую дюжину из сорока.
| Раунд | Что поменяли | Топ-12 | Худшие 8 | Победитель |
|---|---|---|---|---|
| R1 | Заземление муншотов, судья внутри синтеза | 3 : 9 | 8 : 0 | Opus |
| R2 | Резать только за поломку, дыры затыкать из залпа | 5 : 7 | 4 : 4 | Opus |
| R3 | «Нечестное преимущество», ловушка предусловий | 6 : 6 | 5 : 3 | Opus |
| R4 | Квота на «скучную середину» (ошибка) | 3 : 9 | 8 : 0 | наш |
| R5 | Откат квоты обратно к конфигу R3 | 4 : 8 | 6 : 2 | Opus |
Главный содержательный вывод отсюда один, и он про промпты вообще, а не про идеи.
Любая формулировка, которая легализует обычное, используется моделью как лицензия на обычное.
Оба раунда, где мы проваливались целиком, имеют одинаковую подпись — восемь из восьми худших идей наши, — и в обоих в конфиге была фраза, разрешающая массовую скучную боль.
Побочный продукт этой отладки оказался ценнее счёта. Сквозь пять раундов, две независимые системы и пять разных судей устойчиво всплыли три семейства идей.
Проверка перед сделкой
Оценить вещь по фото, проверить продавца, отсканировать объявление, ночью перепроверять лоты. Обе системы приходят сюда независимо и в каждом раунде.
Перевод с канцелярского
Объяснить письмо из инстанции, разобрать квитанцию ЖКХ. Проходит только в рамке «что спросить» — версия, которая составляет претензию, это уже правовой анализ.
Семейный архив
Реставрация старых фото, голос бабушки, семейная хроника. Судья каждый раз хвалит их за удержание — и каждый раз группирует как дубли друг друга.
Судья же отдельно и настойчиво резал три вещи: всё, что требует уже имеющейся аудитории; всё, что даёт первую ценность через неделю накопления данных; и финансовое моделирование с дисклеймером.
Замер третий: а нужен ли залп вообще
Мы знали, что залп держится вровень с Opus. Мы не знали главного: нужен ли для этого залп — или дешёвая модель выдала бы то же самое одним запросом за копейку.
Дальше — все пять моделей, из которых собран залп, прогнаны одним и тем же промптом, каждая на своей рабочей температуре. Сто идей, один слепой судья, паритет 4 из 20 на модель.
| Модель | В топ-20 | Банальные | Нарушения | В худших 20 |
|---|---|---|---|---|
| DeepSeek V4 Flash | 8 | 2 | 2 | 0 |
| GLM 5.3 Flash | 7 | 7 | 4 | 2 |
| GPT-5.6 Luna | 4 | 9 | 1 | 2 |
| Gemini 3.7 Flash | 1 | 5 | 12 | 2 |
| Kimi K2.5 | 0 | 0 | 15 | 14 |
Три вещи из этой таблицы. Наш выбор оркестратора подтвердился независимо: DeepSeek лучший из пяти сразу по всем четырём осям — мы ставили его за цену и скорость, а он оказался ещё и самым сильным одиночным генератором набора. У GLM самый высокий потолок и провальная середина: четыре места из первых пяти при семи метках «банально» из двадцати — ровно тот профиль, ради которого он стоит на механической морфологической линзе. А Kimi в одиночку непригоден: ноль в топе, пятнадцать нарушений из двадцати идей. При этом ноль «банальных» — он не скучный, он пишет то, что нельзя построить. Его роль в залпе — сырьё для чужого синтеза.
Оставался последний вопрос: лучший из одиночных, GLM с его потолком, догонит залп? Нет. Рядом с Opus и с залпом он падает ниже паритета по топу и получает 40% банальщины против наших 7%. Потолок GLM оказался артефактом слабой компании.
Экономика
Если залп держится вровень с Opus на копеечных моделях, напрашивается вывод «мы в десять раз дешевле». Он неверный.
Против Opus мы дешевле всего вдвое: 13,9 кредита против 26,3. А на одну идею и того меньше — 0,93 против 1,31, потому что Opus отдаёт двадцать идей, а мы пятнадцать. Причина видна прямо в разбивке токенов: залп сжигает 57 тысяч входных токенов против тысячи у Opus, потому что оркестратор перечитывает длинный системный промпт, пять выхлопов линз и триаж. Мы тратим в 22 раза больше токенов — просто они примерно в сто раз дешевле, и это почти полностью съедает разницу в цене моделей.
Зато третья строка настоящая. Прогнать нашу же архитектуру на Opus стоило бы 440 кредитов — в 32 раза дороже.
Ценность залпа не в том, что он дёшев сам по себе, а в том, что он поднимает копеечные модели до уровня фронтирной.
Чего эти замеры не доказывают
Честность дешевле репутации, поэтому список дыр публикуем целиком.
- Судья — Opus, и один из претендентов тоже Opus. Самопредпочтение возможно и работает против нас: ничья с ним скорее занижена.
- Опусовский арм заморожен — один и тот же набор идей во всех раундах. Это не независимые повторы, а взгляды разных судей на один текст.
- По одному прогону на линзовую модель. Порядок в середине лиги внутри шума; разрыв между краями — нет.
- Два брифа. Пекарня и маркетплейс. На других доменах пропорции могут отличаться.
- В первом раунде идеи перемешались строго через одну — все чётные оказались Опуса. Судью на авторство не наводили, но идеальное чередование стилей это утечка.
И одна поправка к цифрам из ресёрча: часть точных значений и названий версий собрана из вторичных источников. Качественная картина повторилась в независимых поисках, но конкретные числа стоит сверять по первоисточникам.
Что мы чиним дальше
Единственная ось, где залп стабильно не первый, — дисциплина по жёстким ограничениям, и разброс там большой: от 1 до 8 нарушений между прогонами. Это нестабильность синтеза, а не потолок архитектуры. Плюс муншот-линзу надо заземлить: дроны над пробкой и приём вкладов от пенсионеров — это не смелость, а отсутствие контакта с реальностью. Лекарство простое — требование, чтобы идея оставалась легальной и исполнимой силами трёх человек, прямо в бриф линзы.
И прежде чем править что-либо ещё — три прогона одного конфига, чтобы измерить разброс. Правки по выборке размером один мы уже попробовали.
Что из этого забрать себе
Если вы собираете собственного агента — неважно, у нас или где-то ещё, — вот что переносится напрямую.
- Не спрашивайте идеи у пустого брифа. Один короткий залп вопросов до генерации даёт больше, чем любая правка промпта после.
- Разводите фазы. Сначала расхождение, потом схождение, с видимой границей. Оценка внутри генерации убивает смелость на взлёте.
- Развязывайте параллельные ветки. Если они видят друг друга, они схлопываются — и никакое количество агентов этого не исправит.
- Ставьте разные семейства моделей, а не несколько вызовов одной: разнообразие берётся оттуда.
- Просите второй проход «перепиши смелее и непохоже». Самый дешёвый и самый недооценённый шаг из всех замеренных.
- Судите отдельным экземпляром, который не участвовал в генерации и не знает авторства. Иначе получите сюкофантию вместо оценки.
Всё это — обычные возможности платформы: несколько моделей в одном сценарии, параллельные вызовы, инструменты, память. «Генератор идей» живёт в AIFromSpace как обычный ассистент, и собрать такую же конструкцию под свою задачу можно тем же способом, каким собирается любой другой агент.
Источники
- Generative AI enhances individual creativity but reduces the collective diversity of novel content
- Creative Homogeneity Across LLMs
- Diversity Collapse in Multi-Agent LLM Systems
- Anchorless Diversification for Parallel LLM Ideation
- Multi-persona prompting strategies (Design Science)
- Unlocking LLM Creativity through Analogical Reasoning
- Reducing Design Fixation in Ideation by AI with the Morphological Analysis Method
- Exploration vs. Fixation — разведение фаз
- Towards AI as Colleagues — мультиагентная идеация
- NoveltyBench — измерение схлопывания при повторных сэмплах
- lechmazur/divergent — бенчмарк дивергентного мышления
