# Теория на социалния избор и съгласуване на изкуствения интелект

Теорията на социалния избор и съгласуването на изкуствения интелект е изследователско направление, което разглежда обучението на големите езикови модели като задача за колективно решение. Когато един модел се настройва според оценките на много хора, които не са съгласни помежду си, някакво правило неизбежно превръща техните различни предпочитания в едно поведение на модела. Така стар въпрос на политическата теория се оказва в центъра на най-новата технология: чии ценности следва изкуственият интелект и по какво правило се решава това. Изследователите отбелязват, че много съвременни системи за машинно обучение вече прилагат механизми на социален избор, но често неявно и без нормативна проверка.

## Как моделите се учат от човешки предпочитания

Водещият метод от 2022 г. насам е обучението с подсилване от човешка обратна връзка (RLHF). При него оценители сравняват или подреждат отговори на модела, а събраните класирания се използват за допълнителното му обучение[3]. Обикновено от сравненията първо се извлича „модел на наградата“ – функция, която дава числова оценка на всеки отговор, – а след това езиковият модел се оптимизира да получава висока оценка. Ефектът е голям: в изследването на OpenAI отговорите на модел с 1,3 милиарда параметъра, обучен по този начин, са предпочитани пред отговорите на модел със 175 милиарда параметъра без такова обучение[4].

Извличането на една награда от сравненията на много хора всъщност е агрегиране на предпочитания – задача, която според Луизе Ге, Ариел Прокача и съавтори попада в обхвата на теорията на социалния избор[5].

## Теоремата на Ароу

Теорията на социалния избор изследва как индивидуалните предпочитания могат да се обединят в колективно решение. Още маркиз дьо Кондорсе показва през XVIII век, че мнозинството може едновременно да предпочита A пред B, B пред C и C пред A – т.нар. парадокс на гласуването. Кенет Ароу обобщава проблема през 1951 г.: когато алтернативите са повече от две, не съществува правило за агрегиране, което да изпълнява едновременно пет привидно скромни условия[6]:

- **Неограничена област** – правилото работи при всякакви индивидуални предпочитания.
- **Колективна рационалност** – резултатът е последователно подреждане на алтернативите.
- **Принцип на Парето** – ако всички предпочитат x пред y, обществото също предпочита x пред y.
- **Независимост от несвързани алтернативи** – колективната преценка между x и y зависи само от това как хората подреждат x и y.
- **Липса на диктатор** – няма човек, чиито предпочитания винаги определят резултата.

През 1972 г. Ароу получава Нобелова награда за икономика[7]. Теоремата не означава, че всички правила са еднакво лоши, а че всяко правило жертва някое от условията. Изборът кое условие да бъде жертвано е ценностно решение, а не техническа подробност.

## Изводът за изкуствения интелект

Абхилаш Мишра (2023) прилага резултатите за невъзможност към RLHF и заключава, че няма единствен протокол за гласуване, с който системите с изкуствен интелект да бъдат универсално съгласувани чрез демократични процеси[8]. Оттук той извежда две препоръки: правилата за агрегиране да бъдат задължително прозрачни, за да могат създателите на моделите да носят отговорност, и вместо един „универсален“ модел да се разработват системи, съгласувани с конкретни групи потребители[9].

Позиционна статия на Винсент Коницър, Стюарт Ръсел и още десет автори, подготвена след семинар в Бъркли през декември 2023 г., стига до сходен извод от обратната посока: щом проблемът е агрегиране, натрупаното знание на теорията на социалния избор трябва да насочва съгласуването на моделите[10].

## Скритото гласуване по Борда

Важен резултат идва от Ананд Сититаранджан, Касиди Лейдлоу и Дилън Хадфийлд-Менел (2024). Те доказват, че когато оценителите имат различни, невидими за системата критерии, стандартното обучение на модел на наградата на практика агрегира техните предпочитания по добре познатото правило на Борда[11]. Това правило точкува всяка алтернатива според мястото ѝ в класиранията. То нарушава независимостта от несвързани алтернативи и е уязвимо на стратегическо гласуване. Авторите показват, че оценителите наистина имат стимул да подават неискрени предпочитания, за да повлияят на модела[12].

Ге, Прокача и съавтори доказват още, че моделът на Брадли–Тери–Люс, на който се основава обичайното обучение на наградата, както и широки негови обобщения, не изпълняват основни аксиоми на социалния избор[13]. Те предлагат нови правила с по-силни гаранции и наричат подхода „линеен социален избор“[14].

## Алтернативни правила за агрегиране

Изследванията предлагат няколко пътя за преодоляване на проблема:

- **Дистрибутивно обучение на предпочитания** – вместо една оценка за всеки отговор моделът научава разпределение от възможни оценки и така прави несъгласието между оценителите видимо. В експериментите методът значително намалява уязвимостта към опити за заобикаляне на защитите (jailbreak)[15].
- **Обучение на Наш от човешка обратна връзка (NLHF)** – изследователи от Google DeepMind предлагат да не се търси числова награда, а политика, чиито отговори са последователно предпочитани пред отговорите на всяка конкурентна политика, т.е. равновесие на Наш в игра на предпочитания[16].
- **Максимални лотарии** – вероятностно правило на социалния избор, което зачита предпочитанията на мнозинството при сравнения по двойки. Маура-Риверо и съавтори (2025) го предлагат като заместител на RLHF и показват, че NLHF и сродни методи се доближават до неговите резултати[17].

## Плурализъм вместо един глас

Друго направление поставя под въпрос самата цел всички предпочитания да се сведат до едно поведение. Тейлър Сорънсен и съавтори (2024) описват три начина да се определи и измери плурализмът в системите с изкуствен интелект[18]:

- модел, който представя целия спектър от разумни отговори;
- модел, който може да бъде насочван към определена гледна точка;
- модел, чиито отговори следват разпределението на мненията в дадено население.

Авторите предупреждават, че настоящите техники за съгласуване може да са принципно ограничени за плуралистичен изкуствен интелект и дори да намаляват разнообразието в отговорите на моделите[19].

## Опити за демократично съгласуване

- **Колективен конституционен AI (2023)** – Anthropic и Collective Intelligence Project провеждат обществено допитване чрез платформата Polis, за да съставят принципите на един модел[20]. Около половината от понятията и ценностите в публичната конституция съвпадат с тези във вътрешната конституция на компанията[21]. Подробности: Колективен конституционен AI.
- **Събрания за съгласуване в Тайван** – Министерството на цифровите въпроси си партнира с Collective Intelligence Project[22], а през 2024 г. провежда делиберативно събрание за целостта на информацията със статистически представителни граждани от цял Тайван[23].
- **Habermas Machine (2024)** – модел на Google DeepMind, който обобщава мненията в група и предлага общи позиции. В експериментите участниците избират неговите формулировки пред тези на хора медиатори в 56% от случаите[24]. Подробности: Habermas Machine: AI медиатор за групово съгласие.
- **Колективно съгласуване в OpenAI (2025)** – компанията проучва над 1000 души по света за това как да се държат моделите ѝ[25]. Част от предложенията не са приети. Сред тях е по-голямата свобода за персонализирано политическо съдържание, отхвърлена заради риска от мащабно индивидуално политическо таргетиране[26].

## Отворени въпроси

- **Кой е „електоратът“?** Оценителите, наети от компаниите, не са представителна извадка на обществото. Дори при обществени допитвания остава въпросът кой подбира участниците и формулира въпросите.
- **Стратегическо поведение.** Когато правилото за агрегиране е известно, участниците могат да го използват в своя полза[12]. При системите медиатори съществува риск злонамерени участници да насочат резултата към предварително зададен дневен ред[27].
- **Прозрачност и отговорност.** Правилото за агрегиране рядко се оповестява, макар че от него зависи чие мнение тежи повече[9].
- **Нова изследователска програма.** Обзор от 2026 г. посочва 18 отворени проблема в пресечната точка на социалния избор и машинното обучение, включително съгласуването на големите генеративни модели[28].

## Вижте също

- [Законът на ЕС за изкуствен интелект](https://wikib.online/article/es-zakon-za-izkustven-intelekt)
- [Колективен конституционен AI](https://wikib.online/article/kolektiven-konstitutsionen-ai)
- [Plurality: технология за съвместно многообразие и демокрация](https://wikib.online/article/plurality-tehnologiya-za-demokratsiya)
- [Habermas Machine: AI медиатор за групово съгласие](https://wikib.online/article/habermas-machine-ai-mediator)
- [Същност и развитие на технологията на изкуствения интелект (2022-2026)](https://wikib.online/article/sashtnost-i-razvitie-na-ai-tehnologiyata)
- [vTaiwan: цифровата демокрация в Тайван](https://wikib.online/article/vtaiwan-tsifrova-demokratsia)
- [Мажоритарна избирателна система](https://wikib.online/article/mazhoritarna-izbiratelna-sistema)
- [Делиберативна демокрация](https://wikib.online/article/deliberativna-demokratsia)
- [Забранените практики и графикът на Закона на ЕС за изкуствен интелект](https://wikib.online/article/es-zakon-za-ai-zabraneni-praktiki-i-grafik)
- [Законът на Ню Йорк за ИИ-спътници (2025)](https://wikib.online/article/nyu-york-zakon-ai-sapatnitsi-2025)

## Доказателства към твърденията

1. Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback — https://arxiv.org/abs/2404.10271

2. Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment — https://arxiv.org/abs/2602.03003

3. Training language models to follow instructions with human feedback — https://arxiv.org/abs/2203.02155

4. Training language models to follow instructions with human feedback — https://arxiv.org/abs/2203.02155

5. Axioms for AI Alignment from Human Feedback — https://arxiv.org/abs/2405.14758

6. Arrow's Theorem — https://plato.stanford.edu/entries/arrows-theorem/

7. Arrow's Theorem — https://plato.stanford.edu/entries/arrows-theorem/

8. AI Alignment and Social Choice: Fundamental Limitations and Policy Implications — https://arxiv.org/abs/2310.16048

9. AI Alignment and Social Choice: Fundamental Limitations and Policy Implications — https://arxiv.org/abs/2310.16048

10. Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback — https://arxiv.org/abs/2404.10271

11. Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF — https://arxiv.org/abs/2312.08358

12. Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF — https://arxiv.org/abs/2312.08358

13. Axioms for AI Alignment from Human Feedback — https://arxiv.org/abs/2405.14758

14. Axioms for AI Alignment from Human Feedback — https://arxiv.org/abs/2405.14758

15. Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF — https://arxiv.org/abs/2312.08358

16. Nash Learning from Human Feedback — https://arxiv.org/abs/2312.00886

17. Jackpot! Alignment as a Maximal Lottery — https://arxiv.org/abs/2501.19266

18. A Roadmap to Pluralistic Alignment — https://arxiv.org/abs/2402.05070

19. A Roadmap to Pluralistic Alignment — https://arxiv.org/abs/2402.05070

20. Collective Constitutional AI: Aligning a Language Model with Public Input — https://www.anthropic.com/research/collective-constitutional-ai-aligning-a-language-model-with-public-input

21. Collective Constitutional AI: Aligning a Language Model with Public Input — https://www.anthropic.com/research/collective-constitutional-ai-aligning-a-language-model-with-public-input

22. Alignment Assemblies — https://moda.gov.tw/en/major-policies/alignment-assemblies/1453

23. Alignment Assemblies — https://moda.gov.tw/en/major-policies/alignment-assemblies/1453

24. MIT Technology Review — AI could help people find common ground during deliberations — https://www.technologyreview.com/2024/10/17/1105810/ai-could-help-people-find-common-ground-during-deliberations/

25. Collective alignment: public input on our Model Spec — https://openai.com/index/collective-alignment-aug-2025-updates

26. Collective alignment: public input on our Model Spec — https://openai.com/index/collective-alignment-aug-2025-updates

27. Revel & Pénigaud — AI-Enhanced Deliberative Democracy: risks and safeguards (arXiv 2503.05830) — https://arxiv.org/pdf/2503.05830

28. Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment — https://arxiv.org/abs/2602.03003

## Метаданни

- Каноничен URL: https://wikib.online/article/teoriya-na-sotsialniya-izbor-i-saglasuvane-na-ai
- Лиценз: CC BY-SA 4.0 (https://creativecommons.org/licenses/by-sa/4.0/)
- Ревизия: 1
- Статус: published
- Език: bg
- JSON: https://wikib.online/api/public/articles/teoriya-na-sotsialniya-izbor-i-saglasuvane-na-ai
