Теория на социалния избор и съгласуване на изкуствения интелект
Теорията на социалния избор и съгласуването на изкуствения интелект е изследователско направление, което разглежда обучението на големите езикови модели като задача за колективно решение. Когато един модел се настройва според оценките на много хора, които не са съгласни помежду си, някакво правило неизбежно превръща техните различни предпочитания в едно поведение на модела. Така стар въпрос на политическата теория се оказва в центъра на най-новата технология: чии ценности следва изкуственият интелект и по какво правило се решава това[1]. Изследователите отбелязват, че много съвременни системи за машинно обучение вече прилагат механизми на социален избор, но често неявно и без нормативна проверка[2].
Как моделите се учат от човешки предпочитания
Водещият метод от 2022 г. насам е обучението с подсилване от човешка обратна връзка (RLHF). При него оценители сравняват или подреждат отговори на модела, а събраните класирания се използват за допълнителното му обучение[3]. Обикновено от сравненията първо се извлича „модел на наградата“ – функция, която дава числова оценка на всеки отговор, – а след това езиковият модел се оптимизира да получава висока оценка. Ефектът е голям: в изследването на OpenAI отговорите на модел с 1,3 милиарда параметъра, обучен по този начин, са предпочитани пред отговорите на модел със 175 милиарда параметъра без такова обучение[4].
Извличането на една награда от сравненията на много хора всъщност е агрегиране на предпочитания – задача, която според Луизе Ге, Ариел Прокача и съавтори попада в обхвата на теорията на социалния избор[5].
Теоремата на Ароу
Теорията на социалния избор изследва как индивидуалните предпочитания могат да се обединят в колективно решение. Още маркиз дьо Кондорсе показва през XVIII век, че мнозинството може едновременно да предпочита A пред B, B пред C и C пред A – т.нар. парадокс на гласуването. Кенет Ароу обобщава проблема през 1951 г.: когато алтернативите са повече от две, не съществува правило за агрегиране, което да изпълнява едновременно пет привидно скромни условия[6]:
- Неограничена област – правилото работи при всякакви индивидуални предпочитания.
- Колективна рационалност – резултатът е последователно подреждане на алтернативите.
- Принцип на Парето – ако всички предпочитат x пред y, обществото също предпочита x пред y.
- Независимост от несвързани алтернативи – колективната преценка между x и y зависи само от това как хората подреждат x и y.
- Липса на диктатор – няма човек, чиито предпочитания винаги определят резултата.
През 1972 г. Ароу получава Нобелова награда за икономика[7]. Теоремата не означава, че всички правила са еднакво лоши, а че всяко правило жертва някое от условията. Изборът кое условие да бъде жертвано е ценностно решение, а не техническа подробност.
Изводът за изкуствения интелект
Абхилаш Мишра (2023) прилага резултатите за невъзможност към RLHF и заключава, че няма единствен протокол за гласуване, с който системите с изкуствен интелект да бъдат универсално съгласувани чрез демократични процеси[8]. Оттук той извежда две препоръки: правилата за агрегиране да бъдат задължително прозрачни, за да могат създателите на моделите да носят отговорност, и вместо един „универсален“ модел да се разработват системи, съгласувани с конкретни групи потребители[9].
Позиционна статия на Винсент Коницър, Стюарт Ръсел и още десет автори, подготвена след семинар в Бъркли през декември 2023 г., стига до сходен извод от обратната посока: щом проблемът е агрегиране, натрупаното знание на теорията на социалния избор трябва да насочва съгласуването на моделите[10].
Скритото гласуване по Борда
Важен резултат идва от Ананд Сититаранджан, Касиди Лейдлоу и Дилън Хадфийлд-Менел (2024). Те доказват, че когато оценителите имат различни, невидими за системата критерии, стандартното обучение на модел на наградата на практика агрегира техните предпочитания по добре познатото правило на Борда[11]. Това правило точкува всяка алтернатива според мястото ѝ в класиранията. То нарушава независимостта от несвързани алтернативи и е уязвимо на стратегическо гласуване. Авторите показват, че оценителите наистина имат стимул да подават неискрени предпочитания, за да повлияят на модела[12].
Ге, Прокача и съавтори доказват още, че моделът на Брадли–Тери–Люс, на който се основава обичайното обучение на наградата, както и широки негови обобщения, не изпълняват основни аксиоми на социалния избор[13]. Те предлагат нови правила с по-силни гаранции и наричат подхода „линеен социален избор“[14].
Алтернативни правила за агрегиране
Изследванията предлагат няколко пътя за преодоляване на проблема:
- Дистрибутивно обучение на предпочитания – вместо една оценка за всеки отговор моделът научава разпределение от възможни оценки и така прави несъгласието между оценителите видимо. В експериментите методът значително намалява уязвимостта към опити за заобикаляне на защитите (jailbreak)[15].
- Обучение на Наш от човешка обратна връзка (NLHF) – изследователи от Google DeepMind предлагат да не се търси числова награда, а политика, чиито отговори са последователно предпочитани пред отговорите на всяка конкурентна политика, т.е. равновесие на Наш в игра на предпочитания[16].
- Максимални лотарии – вероятностно правило на социалния избор, което зачита предпочитанията на мнозинството при сравнения по двойки. Маура-Риверо и съавтори (2025) го предлагат като заместител на RLHF и показват, че NLHF и сродни методи се доближават до неговите резултати[17].
Плурализъм вместо един глас
Друго направление поставя под въпрос самата цел всички предпочитания да се сведат до едно поведение. Тейлър Сорънсен и съавтори (2024) описват три начина да се определи и измери плурализмът в системите с изкуствен интелект[18]:
- модел, който представя целия спектър от разумни отговори;
- модел, който може да бъде насочван към определена гледна точка;
- модел, чиито отговори следват разпределението на мненията в дадено население.
Авторите предупреждават, че настоящите техники за съгласуване може да са принципно ограничени за плуралистичен изкуствен интелект и дори да намаляват разнообразието в отговорите на моделите[19].
Опити за демократично съгласуване
- Колективен конституционен AI (2023) – Anthropic и Collective Intelligence Project провеждат обществено допитване чрез платформата Polis, за да съставят принципите на един модел[20]. Около половината от понятията и ценностите в публичната конституция съвпадат с тези във вътрешната конституция на компанията[21]. Подробности: Колективен конституционен AI.
- Събрания за съгласуване в Тайван – Министерството на цифровите въпроси си партнира с Collective Intelligence Project[22], а през 2024 г. провежда делиберативно събрание за целостта на информацията със статистически представителни граждани от цял Тайван[23].
- Habermas Machine (2024) – модел на Google DeepMind, който обобщава мненията в група и предлага общи позиции. В експериментите участниците избират неговите формулировки пред тези на хора медиатори в 56% от случаите[24]. Подробности: Habermas Machine: AI медиатор за групово съгласие.
- Колективно съгласуване в OpenAI (2025) – компанията проучва над 1000 души по света за това как да се държат моделите ѝ[25]. Част от предложенията не са приети. Сред тях е по-голямата свобода за персонализирано политическо съдържание, отхвърлена заради риска от мащабно индивидуално политическо таргетиране[26].
Отворени въпроси
- Кой е „електоратът“? Оценителите, наети от компаниите, не са представителна извадка на обществото. Дори при обществени допитвания остава въпросът кой подбира участниците и формулира въпросите.
- Стратегическо поведение. Когато правилото за агрегиране е известно, участниците могат да го използват в своя полза[12]. При системите медиатори съществува риск злонамерени участници да насочат резултата към предварително зададен дневен ред[27].
- Прозрачност и отговорност. Правилото за агрегиране рядко се оповестява, макар че от него зависи чие мнение тежи повече[9].
- Нова изследователска програма. Обзор от 2026 г. посочва 18 отворени проблема в пресечната точка на социалния избор и машинното обучение, включително съгласуването на големите генеративни модели[28].
Вижте също
- Законът на ЕС за изкуствен интелект
- Колективен конституционен AI
- Plurality: технология за съвместно многообразие и демокрация
- Habermas Machine: AI медиатор за групово съгласие
- Същност и развитие на технологията на изкуствения интелект (2022-2026)
- vTaiwan: цифровата демокрация в Тайван
- Мажоритарна избирателна система
- Делиберативна демокрация
- Забранените практики и графикът на Закона на ЕС за изкуствен интелект
- Законът на Ню Йорк за ИИ-спътници (2025)
Доказателства към твърденията
-
Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback
arXiv · Vincent Conitzer, Rachel Freedman, Jobst Heitzig, Wesley H. Holliday, Bob M. Jacobs, Nathan Lambert, Milan Mossé, Eric Pacuit, Stuart Russell, Hailey Schoelkopf, Emanuel Tewolde, William S. Zwicker · 2024-04-16Отвори източника
-
Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment
arXiv · Zhiyu An, Wan Du · 2026-02-03Отвори източника
-
Training language models to follow instructions with human feedback
arXiv · Long Ouyang et al. · 2022-03-04Отвори източника
-
Training language models to follow instructions with human feedback
arXiv · Long Ouyang et al. · 2022-03-04Отвори източника
-
Axioms for AI Alignment from Human Feedback
arXiv · Luise Ge, Daniel Halpern, Evi Micha, Ariel D. Procaccia, Itai Shapira, Yevgeniy Vorobeychik, Junlin Wu · 2024-05-23Отвори източника
-
Arrow's Theorem
Stanford Encyclopedia of Philosophy · Michael Morreau · 2014-10-13Отвори източника
-
Arrow's Theorem
Stanford Encyclopedia of Philosophy · Michael Morreau · 2014-10-13Отвори източника
-
AI Alignment and Social Choice: Fundamental Limitations and Policy Implications
arXiv · Abhilash Mishra · 2023-10-24Отвори източника
-
AI Alignment and Social Choice: Fundamental Limitations and Policy Implications
arXiv · Abhilash Mishra · 2023-10-24Отвори източника
-
Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback
arXiv · Vincent Conitzer, Rachel Freedman, Jobst Heitzig, Wesley H. Holliday, Bob M. Jacobs, Nathan Lambert, Milan Mossé, Eric Pacuit, Stuart Russell, Hailey Schoelkopf, Emanuel Tewolde, William S. Zwicker · 2024-04-16Отвори източника
-
Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
arXiv · Anand Siththaranjan, Cassidy Laidlaw, Dylan Hadfield-Menell · 2023-12-13Отвори източника
-
Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
arXiv · Anand Siththaranjan, Cassidy Laidlaw, Dylan Hadfield-Menell · 2023-12-13Отвори източника
-
Axioms for AI Alignment from Human Feedback
arXiv · Luise Ge, Daniel Halpern, Evi Micha, Ariel D. Procaccia, Itai Shapira, Yevgeniy Vorobeychik, Junlin Wu · 2024-05-23Отвори източника
-
Axioms for AI Alignment from Human Feedback
arXiv · Luise Ge, Daniel Halpern, Evi Micha, Ariel D. Procaccia, Itai Shapira, Yevgeniy Vorobeychik, Junlin Wu · 2024-05-23Отвори източника
-
Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
arXiv · Anand Siththaranjan, Cassidy Laidlaw, Dylan Hadfield-Menell · 2023-12-13Отвори източника
-
Nash Learning from Human Feedback
arXiv · Rémi Munos et al. · 2023-12-01Отвори източника
-
Jackpot! Alignment as a Maximal Lottery
arXiv · Roberto-Rafael Maura-Rivero, Marc Lanctot, Francesco Visin, Kate Larson · 2025-01-31Отвори източника
-
A Roadmap to Pluralistic Alignment
arXiv (ICML 2024) · Taylor Sorensen et al. · 2024-02-07Отвори източника
-
A Roadmap to Pluralistic Alignment
arXiv (ICML 2024) · Taylor Sorensen et al. · 2024-02-07Отвори източника
-
Collective Constitutional AI: Aligning a Language Model with Public Input
Anthropic · 2023-10-17Отвори източника
-
Collective Constitutional AI: Aligning a Language Model with Public Input
Anthropic · 2023-10-17Отвори източника
-
Alignment Assemblies
Ministry of Digital Affairs (Taiwan)Отвори източника
-
Alignment Assemblies
Ministry of Digital Affairs (Taiwan)Отвори източника
-
MIT Technology Review — AI could help people find common ground during deliberations
MIT Technology Review · 2024-10-17Отвори източника
-
Collective alignment: public input on our Model Spec
OpenAI · 2025-08-27Отвори източника
-
Collective alignment: public input on our Model Spec
OpenAI · 2025-08-27Отвори източника
-
Revel & Pénigaud — AI-Enhanced Deliberative Democracy: risks and safeguards (arXiv 2503.05830)
arXivОтвори източника
-
Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment
arXiv · Zhiyu An, Wan Du · 2026-02-03Отвори източника