# Невидимая конституция знания: жизненный цикл обучающих данных больших языковых моделей

## Статус русской исследовательской редакции

**Код источника:** КС-12  
**Редакция включения:** 4.0.0  
**Размер поступившего источника:** 44447 байтов  
**Контрольный отпечаток поступившего источника:** 78198661878608593617243390816065336775695919122739777882569116001465079851213  

Это самостоятельная русская исследовательская редакция. Она сохраняет структуру вопроса, основные различения, модели, таблицы, доказательную логику и практические предложения поступившего доклада. Она не объявляется построчным переводом и не подменяет исходник. Ссылка или контрольный отпечаток подтверждают происхождение файла, но не доказывают истинность каждого утверждения.

## Исполнительная оценка

Модель не может честно представить то, чего не видела, видела только в искажённом виде или научилась считать низкокачественным. Поэтому контроль знания начинается не в момент отказа пользователю, а на стадии выбора доступного веба, соблюдения запретов робота, лицензирования, очистки, дедубликации, языковой фильтрации, оценки качества и разметки предпочтений.

Каждая стадия имеет техническую цель: удалять повторы, вредоносный материал, мусор и незаконно полученные данные; повышать качество; снижать запоминание; управлять стоимостью. Но каждый фильтр одновременно меняет эпистемическую карту. Низкоресурсный язык дробится на большее число элементов и становится дороже; меньшинная лексика чаще попадает под токсичный список; корпоративно доступные открытые источники представлены сильнее закрытых архивов и платных расследований; модель-оценщик воспроизводит собственные культурные предпочтения в следующем поколении данных.

Стандарт когнитивной свободы для обучения требует не «нефильтрованного интернета», а прозрачной ведомости происхождения, измерения потерь по языкам и сообществам, сохранения спорных материалов в исследовательском контуре, права на исправление и удаления, а также независимого сравнения поведения модели до и после каждого крупного фильтра.

## Оперативная карта

- Проследить весь жизненный цикл: получение источника, лицензия, очистка, дедубликация, языковая обработка, оценка качества, разметка, синтетическое дополнение, извлечение и фильтр ответа.
- Измерить, какие группы, языки, темы и типы источников теряются на каждой стадии.
- Отделить необходимое удаление незаконного или повреждённого материала от скрытой стандартизации мировоззрения.
- Публиковать статистику происхождения и исключений без раскрытия частных данных и защищённых материалов.

## Жизненный цикл и точки вмешательства

| Стадия | Техническая задача | Эпистемический риск |
| :--- | :--- | :--- |
| Обход и получение | Собрать широкий корпус. | Запреты робота, платные стены и географические ограничения смещают доступный мир. |
| Лицензирование | Соблюсти право и договор. | Богатые правообладатели исчезают, открытые или незащищённые сообщества поглощаются непропорционально. |
| Очистка и дедубликация | Удалить мусор, повторы и запоминание. | Повтор как культурная значимость стирается; манифест и массовое свидетельство могут стать одним экземпляром. |
| Определение языка и токенизация | Разделить текст для обучения. | Низкоресурсные языки дороже, длиннее и хуже представлены. |
| Токсичность и безопасность | Уменьшить вредный материал. | Лексика меньшинств, расследований и травмы ошибочно исключается. |
| Классификация качества | Оставить полезные документы. | Институциональный стиль принимается за знание, устная и локальная традиция — за низкое качество. |
| Разметка предпочтений | Сформировать желательное поведение. | Нормы подрядчиков и заказчика превращаются в общую модель ответа. |
| Синтетическое дополнение | Увеличить данные и покрытие. | Ошибки модели становятся обучающим материалом следующей модели. |
| Извлечение | Подать актуальные источники во время ответа. | Несколько допущенных источников определяют текущую «истину» поверх весов. |
| Фильтр ответа | Предотвратить запрещённый результат. | Безопасный контекст теряется, а отказ скрывает, на каком слое возникла граница. |

## Неравенство источников

Корпус отражает не всё человеческое знание, а то, что было технически доступно, юридически допустимо, дешево обработано и признано качественным. Независимые расследования за подпиской, локальные архивы, малые языки и устные знания представлены хуже. Открытый материал менее обеспеченных сообществ может быть поглощён без сопоставимой возможности запретить или получить выгоду.

Запреты обхода также создают политический парадокс: качественные нейтральные издатели активнее защищают тексты, тогда как крайние и низкокачественные сайты оставляют их открытыми. В результате юридически осторожный сбор может непреднамеренно усилить поляризованный материал.

## Дедубликация и потеря социальной массы

Для модели повтор увеличивает риск запоминания и затраты, но для культуры повтор показывает распространение, согласие, ритуал, лозунг или массовое свидетельство. Без отдельной метрики распространения дедубликация делает одинокую запись статистически похожей на текст, который перепечатывали тысячи раз. Правильная архитектура сохраняет один учебный экземпляр, но отдельно хранит проверяемый показатель происхождения и распространения без множества копий содержания.

## Языковой и токенизационный налог

- Измерять среднее число токенов на одинаковое смысловое содержание по языкам.
- Публиковать долю корпуса, потерянную на определении языка, качестве и токсичности.
- Привлекать носителей языка к оценке, а не применять английскую таксономию через перевод.
- Сохранять историческую орфографию, диалекты и кодовое переключение в отдельных исследовательских слоях.
- Проверять ответы и отказы на семантически одинаковых многоязычных наборах.

## Человеческое выравнивание и правило модели

Разметчик оценивает не абстрактную безопасность, а конкретную инструкцию компании. Состав работников, условия труда, язык задания и система контроля определяют, какие ответы получают награду. Правиловая модель делает норму более явной, но всё равно зависит от выбранной «конституции» и приоритета правил.

- Публиковать высокоуровневую таксономию и процесс её изменения.
- Хранить несогласие разметчиков вместо принудительного единодушия.
- Отдельно измерять полезность, фактическую точность, ложный отказ и идеологическую симметрию.
- Не использовать один культурный набор как мировую меру качества.
- Позволять исследовательский режим, где видна граница между данными, системным правилом и выводом.

## Стандарт когнитивной свободы обучающих данных

| Требование | Проверяемый результат |
| :--- | :--- |
| Ведомость происхождения | Категории источников, языки, лицензии, периоды и способы получения. |
| Карта исключений | Что удалялось, по какому правилу, с какой ошибкой и для каких групп. |
| Сохранение спорного контекста | Опасный или оскорбительный материал доступен в изолированном исследовательском режиме с происхождением. |
| Право на исправление | Ошибочный источник и производные метки могут быть оспорены и исправлены. |
| Удаление | Определён процесс удаления данных и проверки остаточного влияния. |
| Языковая справедливость | Публикуются показатели стоимости, качества и отказов по языкам. |
| Разнообразие извлечения | Текущий ответ не зависит от единственного списка разрешённых институций. |
| Различимость слоёв | Пользователь может понять, ограничение возникло в данных, извлечении, системном правиле или фильтре. |

## Командные выводы

- ОБУЧАЮЩИЙ КОРПУС ЯВЛЯЕТСЯ НЕВИДИМОЙ КОНСТИТУЦИЕЙ МОДЕЛИ.
- ОТСУТСТВИЕ ИСТОЧНИКА ПРЕДШЕСТВУЕТ ОТКАЗУ В ОТВЕТЕ.
- ОЧИСТКА ИМЕЕТ КАРТУ ПОТЕРЬ ПО ЯЗЫКАМ, ГРУППАМ И ТЕМАМ.
- ДЕДУБЛИКАЦИЯ НЕ ДОЛЖНА СТИРАТЬ ДОКАЗАТЕЛЬСТВО РАСПРОСТРАНЕНИЯ.
- МОДЕЛЬ-ОЦЕНЩИК НЕ СТАНОВИТСЯ БЕСКОНТРОЛЬНЫМ СУДЬЁЙ СЛЕДУЮЩЕГО КОРПУСА.
- ПОЛЬЗОВАТЕЛЬ ВИДИТ, НА КАКОМ СЛОЕ ВОЗНИКЛО ОГРАНИЧЕНИЕ.

## Связи внутри корпуса война.com

- [Конституция знания](../../конституция-знания.html)
- [Алгоритмическая обнаружимость](архитектура-алгоритмической-обнаружимости.html)
- [Государственное выравнивание](государственное-выравнивание-и-машинная-истина.html)
- [Корпоративное выравнивание](корпоративное-выравнивание-и-частный-контроль-знания.html)

## Адреса, сохранённые из поступившего источника

Адреса ниже приведены как линии происхождения. Наличие адреса не означает, что его текущее содержимое было проверено в редакции сайта.

1. https://www.researchgate.net/publication/353489691_What
2. https://arxiv.org/html/2510.09031v1
3. https://casrai.org/dictionary/term/eu-ai-act-article-53-general-purpose-ai-model-obligations
4. https://aigovernancedesk.com/ai-training-data-copyright-rules/
5. https://artificialintelligenceact.eu/article/53/
6. https://iapp.org/news/a/the-eu-ai-act-and-copyrights-compliance
7. https://ar5iv.labs.arxiv.org/html/2104.08758
8. https://arxiv.org/html/2407.07630v1
9. https://ojs.aaai.org/index.php/AAAI/article/view/41279/45240
10. https://huggingface.co/datasets/HuggingFaceFW/fineweb-edu-score-2/commit/505673d325ddbf018291ca88c32e2fe7dcd8a5ab
11. https://huggingface.co/nvidia/nemocurator-fineweb-mixtral-edu-classifier/blame/main/README.md
12. https://arxiv.org/html/2406.17557v1
13. https://arxiv.org/pdf/2410.18505
14. https://arxiv.org/pdf/2606.24460
15. https://arxiv.org/html/2601.01244v1
16. https://arxiv.org/html/2606.24460v1
17. https://arxiv.org/pdf/2602.18468
18. https://tianpan.co/blog/2026/04/20/multilingual-token-tax-llm-production
19. https://arxiv.org/abs/2606.24460
20. https://www.researchgate.net/publication/404693946_Recovering_Whisper
21. https://arxiv.org/pdf/2604.02507
22. https://arxiv.org/html/2604.02507v1
23. https://arxiv.org/pdf/2606.07629
24. https://arxiv.org/pdf/2508.16982
25. https://openreview.net/pdf/a4497d33dae5b57c5ef8ff56e768b39347075749.pdf
26. https://arxiv.org/html/2503.04910v1
27. https://dev.to/shrsv/constitutional-methods-for-llms-turning-written-principles-into-training-signals-g7b
28. https://medium.com/@jonnyndavis/understanding-constitutional-ai-dd9d783ef712
29. https://arxiv.org/pdf/2212.08073
30. https://www.elementera.com/blog/constitutional-ai-and-the-strategic-architecture-behind-ai-answers
31. https://model-spec.openai.com/2025-09-12.html
32. https://cdn.openai.com/spec/model-spec-2024-05-08.html
33. https://medium.com/@andregualtierioliveira/model-spec-exploring-openais-ethical-framework-77ee266f2367
34. https://humansintheloop.org/eu-ai-act-training-data-what-high-risk-ai-teams-must-know/
35. https://www.euaiact.com/article/10
36. https://artificialintelligenceact.eu/article/10/
37. https://deeploy.ai/eu-ai-act-hub/articles/ai-bias-detection-mitigation-eu-ai-act/
38. https://www.semanticscholar.org/paper/The-Curse-of-Recursion%3A-Training-on-Generated-Data-Shumailov-Shumaylov/155aec5cff650263a4c71136f97570611d1bba7a
39. https://en.wikipedia.org/wiki/Model_collapse
40. https://arxiv.org/pdf/2509.08972
41. https://arxiv.org/html/2410.16713v4
42. https://openreview.net/forum?id=5B2K4LRgmz
43. https://arxiv.org/html/2608.19390v1
44. https://www.researchgate.net/publication/395270298_The_Cybernetic_Episteme_AI-Mediated_Discovery_Post-Normal_Science_and_the_Web_30
45. https://www.researchgate.net/publication/390213299_Poor_Alignment_and_Steerability_of_Large_Language_Models_Evidence_from_College_Admission_Essays
46. https://arxiv.org/pdf/2504.14985
47. https://arxiv.org/html/2607.02079v1
48. https://arxiv.org/html/2601.03300v1
49. https://arxiv.org/html/2602.13379v2
50. https://arxiv.org/html/2510.08240v1
51. https://www.researchgate.net/publication/381109214_OR-Bench_An_Over-Refusal_Benchmark_for_Large_Language_Models
52. https://arxiv.org/html/2405.20947
53. https://arxiv.org/html/2405.20947v2
54. https://openreview.net/pdf?id=obYVdcMMIT
55. https://arxiv.org/pdf/2606.03601
56. https://www.researchgate.net/publication/392735749_Information_Suppression_in_Large_Language_Models_Auditing_Quantifying_and_Characterizing_Censorship_in_DeepSeek
57. https://arxiv.org/html/2506.12349v1
58. https://www.techradar.com/computing/artificial-intelligence/openai-just-updated-its-187-page-rulebook-so-chatgpt-can-engage-with-more-controversial-topics
59. https://openreview.net/forum?id=CdFnEu0JZV
60. https://arxiv.org/html/2506.21587v2
61. https://arxiv.org/html/2602.06371v1
62. https://www.researchgate.net/publication/404693667_Protecting_the_Mind_in_the_Age_of_Brain-Computer_Interfaces
63. https://privacyscholars.org/plsc-2026-info/
64. https://pmc.ncbi.nlm.nih.gov/articles/PMC7861318/
65. https://cjil.uchicago.edu/print-archive/democracy-social-media-and-freedom-expression-hate-lies-and-search-possible-truth
66. https://techpolicylab.uw.edu/data-statements/
67. https://www.researchgate.net/publication/348980560_The_GEM_Benchmark_Natural_Language_Generation_its_Evaluation_and_Metrics
68. https://www.researchgate.net/publication/354040551_Five_sources_of_bias_in_natural_language_processing
69. https://legalblogs.wolterskluwer.com/copyright-blog/copyright-compliance-and-confidentiality-finding-common-ground-in-generative-ai/

## Граница уверенности

Полная публикация обучающих данных может конфликтовать с приватностью, авторским правом и безопасностью. Прозрачность должна быть достаточной для проверки состава и потерь, но не раскрывать частные записи или незаконный материал.
