Теория на социалния избор и съгласуване на изкуствения интелект =============================================================== Теорията на социалния избор и съгласуването на изкуствения интелект е изследователско направление, което разглежда обучението на големите езикови модели като задача за колективно решение. Когато един модел се настройва според оценките на много хора, които не са съгласни помежду си, някакво правило неизбежно превръща техните различни предпочитания в едно поведение на модела. Така стар въпрос на политическата теория се оказва в центъра на най-новата технология: чии ценности следва изкуственият интелект и по какво правило се решава това. Изследователите отбелязват, че много съвременни системи за машинно обучение вече прилагат механизми на социален избор, но често неявно и без нормативна проверка. Как моделите се учат от човешки предпочитания --------------------------------------------- Водещият метод от 2022 г. насам е обучението с подсилване от човешка обратна връзка (RLHF). При него оценители сравняват или подреждат отговори на модела, а събраните класирания се използват за допълнителното му обучение. Обикновено от сравненията първо се извлича „модел на наградата“ – функция, която дава числова оценка на всеки отговор, – а след това езиковият модел се оптимизира да получава висока оценка. Ефектът е голям: в изследването на OpenAI отговорите на модел с 1,3 милиарда параметъра, обучен по този начин, са предпочитани пред отговорите на модел със 175 милиарда параметъра без такова обучение. Извличането на една награда от сравненията на много хора всъщност е агрегиране на предпочитания – задача, която според Луизе Ге, Ариел Прокача и съавтори попада в обхвата на теорията на социалния избор. Теоремата на Ароу ----------------- Теорията на социалния избор изследва как индивидуалните предпочитания могат да се обединят в колективно решение. Още маркиз дьо Кондорсе показва през XVIII век, че мнозинството може едновременно да предпочита A пред B, B пред C и C пред A – т.нар. парадокс на гласуването. Кенет Ароу обобщава проблема през 1951 г.: когато алтернативите са повече от две, не съществува правило за агрегиране, което да изпълнява едновременно пет привидно скромни условия: • Неограничена област – правилото работи при всякакви индивидуални предпочитания. • Колективна рационалност – резултатът е последователно подреждане на алтернативите. • Принцип на Парето – ако всички предпочитат x пред y, обществото също предпочита x пред y. • Независимост от несвързани алтернативи – колективната преценка между x и y зависи само от това как хората подреждат x и y. • Липса на диктатор – няма човек, чиито предпочитания винаги определят резултата. През 1972 г. Ароу получава Нобелова награда за икономика. Теоремата не означава, че всички правила са еднакво лоши, а че всяко правило жертва някое от условията. Изборът кое условие да бъде жертвано е ценностно решение, а не техническа подробност. Изводът за изкуствения интелект ------------------------------- Абхилаш Мишра (2023) прилага резултатите за невъзможност към RLHF и заключава, че няма единствен протокол за гласуване, с който системите с изкуствен интелект да бъдат универсално съгласувани чрез демократични процеси. Оттук той извежда две препоръки: правилата за агрегиране да бъдат задължително прозрачни, за да могат създателите на моделите да носят отговорност, и вместо един „универсален“ модел да се разработват системи, съгласувани с конкретни групи потребители. Позиционна статия на Винсент Коницър, Стюарт Ръсел и още десет автори, подготвена след семинар в Бъркли през декември 2023 г., стига до сходен извод от обратната посока: щом проблемът е агрегиране, натрупаното знание на теорията на социалния избор трябва да насочва съгласуването на моделите. Скритото гласуване по Борда --------------------------- Важен резултат идва от Ананд Сититаранджан, Касиди Лейдлоу и Дилън Хадфийлд-Менел (2024). Те доказват, че когато оценителите имат различни, невидими за системата критерии, стандартното обучение на модел на наградата на практика агрегира техните предпочитания по добре познатото правило на Борда. Това правило точкува всяка алтернатива според мястото ѝ в класиранията. То нарушава независимостта от несвързани алтернативи и е уязвимо на стратегическо гласуване. Авторите показват, че оценителите наистина имат стимул да подават неискрени предпочитания, за да повлияят на модела. Ге, Прокача и съавтори доказват още, че моделът на Брадли–Тери–Люс, на който се основава обичайното обучение на наградата, както и широки негови обобщения, не изпълняват основни аксиоми на социалния избор. Те предлагат нови правила с по-силни гаранции и наричат подхода „линеен социален избор“. Алтернативни правила за агрегиране ---------------------------------- Изследванията предлагат няколко пътя за преодоляване на проблема: • Дистрибутивно обучение на предпочитания – вместо една оценка за всеки отговор моделът научава разпределение от възможни оценки и така прави несъгласието между оценителите видимо. В експериментите методът значително намалява уязвимостта към опити за заобикаляне на защитите (jailbreak). • Обучение на Наш от човешка обратна връзка (NLHF) – изследователи от Google DeepMind предлагат да не се търси числова награда, а политика, чиито отговори са последователно предпочитани пред отговорите на всяка конкурентна политика, т.е. равновесие на Наш в игра на предпочитания. • Максимални лотарии – вероятностно правило на социалния избор, което зачита предпочитанията на мнозинството при сравнения по двойки. Маура-Риверо и съавтори (2025) го предлагат като заместител на RLHF и показват, че NLHF и сродни методи се доближават до неговите резултати. Плурализъм вместо един глас --------------------------- Друго направление поставя под въпрос самата цел всички предпочитания да се сведат до едно поведение. Тейлър Сорънсен и съавтори (2024) описват три начина да се определи и измери плурализмът в системите с изкуствен интелект: • модел, който представя целия спектър от разумни отговори; • модел, който може да бъде насочван към определена гледна точка; • модел, чиито отговори следват разпределението на мненията в дадено население. Авторите предупреждават, че настоящите техники за съгласуване може да са принципно ограничени за плуралистичен изкуствен интелект и дори да намаляват разнообразието в отговорите на моделите. Опити за демократично съгласуване --------------------------------- • Колективен конституционен AI (2023) – Anthropic и Collective Intelligence Project провеждат обществено допитване чрез платформата Polis, за да съставят принципите на един модел. Около половината от понятията и ценностите в публичната конституция съвпадат с тези във вътрешната конституция на компанията. Подробности: Колективен конституционен AI. • Събрания за съгласуване в Тайван – Министерството на цифровите въпроси си партнира с Collective Intelligence Project, а през 2024 г. провежда делиберативно събрание за целостта на информацията със статистически представителни граждани от цял Тайван. • Habermas Machine (2024) – модел на Google DeepMind, който обобщава мненията в група и предлага общи позиции. В експериментите участниците избират неговите формулировки пред тези на хора медиатори в 56% от случаите. Подробности: Habermas Machine: AI медиатор за групово съгласие. • Колективно съгласуване в OpenAI (2025) – компанията проучва над 1000 души по света за това как да се държат моделите ѝ. Част от предложенията не са приети. Сред тях е по-голямата свобода за персонализирано политическо съдържание, отхвърлена заради риска от мащабно индивидуално политическо таргетиране. Отворени въпроси ---------------- • Кой е „електоратът“? Оценителите, наети от компаниите, не са представителна извадка на обществото. Дори при обществени допитвания остава въпросът кой подбира участниците и формулира въпросите. • Стратегическо поведение. Когато правилото за агрегиране е известно, участниците могат да го използват в своя полза. При системите медиатори съществува риск злонамерени участници да насочат резултата към предварително зададен дневен ред. • Прозрачност и отговорност. Правилото за агрегиране рядко се оповестява, макар че от него зависи чие мнение тежи повече. • Нова изследователска програма. Обзор от 2026 г. посочва 18 отворени проблема в пресечната точка на социалния избор и машинното обучение, включително съгласуването на големите генеративни модели. Вижте също ----------- Законът на ЕС за изкуствен интелект: https://wikib.online/article/es-zakon-za-izkustven-intelekt Колективен конституционен AI: https://wikib.online/article/kolektiven-konstitutsionen-ai Plurality: технология за съвместно многообразие и демокрация: https://wikib.online/article/plurality-tehnologiya-za-demokratsiya Habermas Machine: AI медиатор за групово съгласие: https://wikib.online/article/habermas-machine-ai-mediator Същност и развитие на технологията на изкуствения интелект (2022-2026): https://wikib.online/article/sashtnost-i-razvitie-na-ai-tehnologiyata vTaiwan: цифровата демокрация в Тайван: https://wikib.online/article/vtaiwan-tsifrova-demokratsia Мажоритарна избирателна система: https://wikib.online/article/mazhoritarna-izbiratelna-sistema Делиберативна демокрация: https://wikib.online/article/deliberativna-demokratsia Забранените практики и графикът на Закона на ЕС за изкуствен интелект: https://wikib.online/article/es-zakon-za-ai-zabraneni-praktiki-i-grafik Законът на Ню Йорк за ИИ-спътници (2025): https://wikib.online/article/nyu-york-zakon-ai-sapatnitsi-2025 Доказателства към твърденията ----------------------------- 1. Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback https://arxiv.org/abs/2404.10271 2. Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment https://arxiv.org/abs/2602.03003 3. Training language models to follow instructions with human feedback https://arxiv.org/abs/2203.02155 4. Training language models to follow instructions with human feedback https://arxiv.org/abs/2203.02155 5. Axioms for AI Alignment from Human Feedback https://arxiv.org/abs/2405.14758 6. Arrow's Theorem https://plato.stanford.edu/entries/arrows-theorem/ 7. Arrow's Theorem https://plato.stanford.edu/entries/arrows-theorem/ 8. AI Alignment and Social Choice: Fundamental Limitations and Policy Implications https://arxiv.org/abs/2310.16048 9. AI Alignment and Social Choice: Fundamental Limitations and Policy Implications https://arxiv.org/abs/2310.16048 10. Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback https://arxiv.org/abs/2404.10271 11. Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF https://arxiv.org/abs/2312.08358 12. Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF https://arxiv.org/abs/2312.08358 13. Axioms for AI Alignment from Human Feedback https://arxiv.org/abs/2405.14758 14. Axioms for AI Alignment from Human Feedback https://arxiv.org/abs/2405.14758 15. Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF https://arxiv.org/abs/2312.08358 16. Nash Learning from Human Feedback https://arxiv.org/abs/2312.00886 17. Jackpot! Alignment as a Maximal Lottery https://arxiv.org/abs/2501.19266 18. A Roadmap to Pluralistic Alignment https://arxiv.org/abs/2402.05070 19. A Roadmap to Pluralistic Alignment https://arxiv.org/abs/2402.05070 20. Collective Constitutional AI: Aligning a Language Model with Public Input https://www.anthropic.com/research/collective-constitutional-ai-aligning-a-language-model-with-public-input 21. Collective Constitutional AI: Aligning a Language Model with Public Input https://www.anthropic.com/research/collective-constitutional-ai-aligning-a-language-model-with-public-input 22. Alignment Assemblies https://moda.gov.tw/en/major-policies/alignment-assemblies/1453 23. Alignment Assemblies https://moda.gov.tw/en/major-policies/alignment-assemblies/1453 24. MIT Technology Review — AI could help people find common ground during deliberations https://www.technologyreview.com/2024/10/17/1105810/ai-could-help-people-find-common-ground-during-deliberations/ 25. Collective alignment: public input on our Model Spec https://openai.com/index/collective-alignment-aug-2025-updates 26. Collective alignment: public input on our Model Spec https://openai.com/index/collective-alignment-aug-2025-updates 27. Revel & Pénigaud — AI-Enhanced Deliberative Democracy: risks and safeguards (arXiv 2503.05830) https://arxiv.org/pdf/2503.05830 28. Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment https://arxiv.org/abs/2602.03003 Каноничен URL: https://wikib.online/article/teoriya-na-sotsialniya-izbor-i-saglasuvane-na-ai Ревизия: 1 Статус: published Език: bg Лиценз: CC BY-SA 4.0 (https://creativecommons.org/licenses/by-sa/4.0/)