Синтетические данные — данные, сгенерированные алгоритмом или моделью, а не полученные из реальных процессов: обращения вымышленных клиентов, документы несуществующих контрагентов, вопрос-ответные пары по базе знаний. В ИИ-проектах их применяют, когда реальных данных мало, их нельзя использовать как есть или нужна массовая проверочная выборка.
Зачем генерируют данные
Дефицит примеров редких классов. Мошеннические заявки, редкие интенты обращений, аварийные ситуации — доли процента выборки; без балансировки модель игнорирует такие классы, потому что на них почти нечему учиться. Синтетика пополняет редкий класс до объёма, на котором модель его различает.
Приватность. Структура и формат реальны, содержание вымышленно: на таких данных обучают, тестируют и демонстрируют без вывоза персональных данных из контура. Синтетика — не замена самого процесса обезличивания, у того своя статья — «Обезличивание данных».
Проверочные вопросы. Сгенерировать сотни вопрос-ответных пар по документам для оценки RAG дешевле, чем составлять вручную. Ограничение: вопросы получаются «в стиле документа», редкие перефразировки и многошаговые сценарии добавляются руками.
Генерация и контроль качества
Три источника генерации. Модель по промпту с описанием класса; шаблоны с подстановкой параметров; возмущение реальных примеров — замена имён, сумм, дат с сохранением структуры. Возмущение сильнее всех сохраняет связь с реальностью и потому ценнее генерации с нуля.
Разнообразие проверяется, а не предполагается. Генератор по одному промпту выдаёт однотипные формулировки. Лечится вариативностью промптов, сменой стиля и регистра, несколькими генераторами; проверяется кластеризацией эмбеддингов — если тысячи примеров ложатся в несколько кластеров, разнообразия нет.
Факты проверяются по исходникам. Синтетическая пара вопрос-ответ проверяется по документу, из которого сгенерирована: автоматически моделью-судьёй и выборочно вручную — про механику судей отдельная статья «Оценка моделью-судьёй». Непроверенная синтетика тиражирует фактические ошибки так же уверенно, как и правильные ответы.
Доля в смеси — управляемый параметр. Как правило 10–30% синтетики в обучающей смеси не разрушает качество; выше — растёт риск смещения к стилю генератора. Итоговая проверка любой смеси — только на реальном отложенном наборе.
Риски: шаблонность, утечка паттернов, само-оценка
Шаблонность. Реальная речь грязнее синтетической: опечатки, канцелярит одних авторов, разговорность других, смешение языков. Модель, обученная на чистой генерации, уверенно работает на тесте из той же генерации и падает на реальном потоке — типовой разрыв между лабораторией и эксплуатацией.
Утечка паттернов. Если генератор и оцениваемая модель из одного семейства, метрики на синтетике завышены: модель узнаёт «почерк родственника». Та же логика действует для судьи из того же семейства — оценки смещены в пользу знакомого стиля.
Само-оценка. Генерировать вопросы моделью и мерить на них ту же модель — метрика растёт, качество нет. Тестовая выборка хотя бы частично независима от генератора: ручная выверка доли, другой поставщик, реальные примеры.
Утечка реальных данных в синтетику. Если в промпт генератору положили реальные документы, модель может воспроизвести их фрагменты дословно. Проверка совпадений словосочетаний с исходниками обязательна, когда исходники содержат персональные данные или коммерческую тайну.
Где уместно и когда помогает
Помогает: балансировка редких классов, проверочные наборы для конвейеров, демонстрации без утечки персональных данных, вопрос-ответные пары для оценки, нагрузочные тесты с реалистичным объёмом.
Вредит: как основной источник фактических знаний — модель усваивает стилистику генератора, а не факты, и галлюцинирует уверенно; как единственный тест качества; как вытеснение реальных данных из смеси при доступном реальном потоке.
Правило применения. Синтетика добавляется под конкретный дефицит: «не хватает примеров класса», «нельзя показывать реальные данные». «Нагенерируем побольше» без гипотезы, что именно чинится, смесь ухудшает.
Типичные ошибки
- Мерить модель на синтетике того же генератора. Метрика отражает узнавание почерка, а не качество; вердикт выносит только реальный отложенный набор.
- Генерация без контроля разнообразия. Сотни перефразировок одного шаблона создают иллюзию объёма: модель учит один пример, повторённый сто раз.
- Синтетика вместо обезличивания. «Похожие» паспорта и счета с реальными форматами и контрольными суммами формально валидны — ответственность за их использование не исчезает; персональные данные требуют обезличивания, а не стилизации.
- Вытеснение реальных данных. 70–80% синтетики в смеси при доступном реальном потоке смещает модель к стилю генератора; реальный пример информативнее синтетического почти всегда.
- Полностью автоматический конвейер без ручной выборки. Без выборочной людской проверки фактические ошибки тиражируются молча; доля ручного контроля — единственная страховка от систематического перекоса.
Частые вопросы
Можно ли обучать модель только на синтетике?
Для формата и стиля — иногда: шаблоны ответов, структура записей. Для фактов и классификации реальных обращений — нет: без реальных примеров модель не видит настоящего распределения и завышает качество на собственных порождениях.
Как проверить, что синтетика помогла?
Только сравнением на реальном отложенном наборе: смесь с синтетикой против смеси без неё, одна модель и одни гиперпараметры. Если выигрыша на реальных данных нет — синтетику убирают, какой бы дешёвой она ни была.
Сколько синтетики добавлять в обучающую смесь?
Стартовый ориентир — 10–30%; для балансировки редкого класса — до сопоставимости с частыми классами, но с контролем разнообразия внутри класса. Дальше доля подбирается замером, а не приращением «на глаз».
Чем синтетика отличается от аугментации?
Аугментация — преобразование реальных примеров: перефразировка, замена сущностей, изменение длины. Синтетика — генерация с нуля. Аугментация сильнее сохраняет связь с реальным распределением и потому предпочтительна, когда реальные данные есть.
Законно ли использовать синтетические персональные данные?
Сами по себе вымышленные данные ограничений не несут. Но генерация на основе реальных персональных данных наследует их правовой режим, а совпадения фрагментов с исходниками надо проверять; режим работы разобран в статье про обезличивание.
Зачем синтетические вопросы для оценки RAG, если их генерирует та же модель?
Дёшево и массово закрывают базовые сценарии. Независимость обеспечивается проверкой ответов по исходным документам и ручной выверкой доли вопросов; рискованные сценарии — перефразировки, многошаговые вопросы — добавляются вручную.
Что почитать по теме
- Обезличивание данных — работа с персональными данными до ИИ-контура.
- Оценка моделью-судьёй — автоматическая проверка сгенерированного.
- Проверочный набор и бенчмарк — куда идут проверочные вопросы.
- Разметка данных — человеческая альтернатива генерации эталонов.
- Обучение на своих данных — где смесь с синтетикой применяется.