W WikiBсвободна енциклопедия

Теория на социалния избор и съгласуване на изкуствения интелект

Теорията на социалния избор и съгласуването на изкуствения интелект е изследователско направление, което разглежда обучението на големите езикови модели като задача за колективно решение. Когато един модел се настройва според оценките на много хора, които не са съгласни помежду си, някакво правило неизбежно превръща техните различни предпочитания в едно поведение на модела. Така стар въпрос на политическата теория се оказва в центъра на най-новата технология: чии ценности следва изкуственият интелект и по какво правило се решава това[1]. Изследователите отбелязват, че много съвременни системи за машинно обучение вече прилагат механизми на социален избор, но често неявно и без нормативна проверка[2].

Как моделите се учат от човешки предпочитания

Водещият метод от 2022 г. насам е обучението с подсилване от човешка обратна връзка (RLHF). При него оценители сравняват или подреждат отговори на модела, а събраните класирания се използват за допълнителното му обучение[3]. Обикновено от сравненията първо се извлича „модел на наградата“ – функция, която дава числова оценка на всеки отговор, – а след това езиковият модел се оптимизира да получава висока оценка. Ефектът е голям: в изследването на OpenAI отговорите на модел с 1,3 милиарда параметъра, обучен по този начин, са предпочитани пред отговорите на модел със 175 милиарда параметъра без такова обучение[4].

Извличането на една награда от сравненията на много хора всъщност е агрегиране на предпочитания – задача, която според Луизе Ге, Ариел Прокача и съавтори попада в обхвата на теорията на социалния избор[5].

Теоремата на Ароу

Теорията на социалния избор изследва как индивидуалните предпочитания могат да се обединят в колективно решение. Още маркиз дьо Кондорсе показва през XVIII век, че мнозинството може едновременно да предпочита A пред B, B пред C и C пред A – т.нар. парадокс на гласуването. Кенет Ароу обобщава проблема през 1951 г.: когато алтернативите са повече от две, не съществува правило за агрегиране, което да изпълнява едновременно пет привидно скромни условия[6]:

  • Неограничена област – правилото работи при всякакви индивидуални предпочитания.
  • Колективна рационалност – резултатът е последователно подреждане на алтернативите.
  • Принцип на Парето – ако всички предпочитат x пред y, обществото също предпочита x пред y.
  • Независимост от несвързани алтернативи – колективната преценка между x и y зависи само от това как хората подреждат x и y.
  • Липса на диктатор – няма човек, чиито предпочитания винаги определят резултата.

През 1972 г. Ароу получава Нобелова награда за икономика[7]. Теоремата не означава, че всички правила са еднакво лоши, а че всяко правило жертва някое от условията. Изборът кое условие да бъде жертвано е ценностно решение, а не техническа подробност.

Изводът за изкуствения интелект

Абхилаш Мишра (2023) прилага резултатите за невъзможност към RLHF и заключава, че няма единствен протокол за гласуване, с който системите с изкуствен интелект да бъдат универсално съгласувани чрез демократични процеси[8]. Оттук той извежда две препоръки: правилата за агрегиране да бъдат задължително прозрачни, за да могат създателите на моделите да носят отговорност, и вместо един „универсален“ модел да се разработват системи, съгласувани с конкретни групи потребители[9].

Позиционна статия на Винсент Коницър, Стюарт Ръсел и още десет автори, подготвена след семинар в Бъркли през декември 2023 г., стига до сходен извод от обратната посока: щом проблемът е агрегиране, натрупаното знание на теорията на социалния избор трябва да насочва съгласуването на моделите[10].

Скритото гласуване по Борда

Важен резултат идва от Ананд Сититаранджан, Касиди Лейдлоу и Дилън Хадфийлд-Менел (2024). Те доказват, че когато оценителите имат различни, невидими за системата критерии, стандартното обучение на модел на наградата на практика агрегира техните предпочитания по добре познатото правило на Борда[11]. Това правило точкува всяка алтернатива според мястото ѝ в класиранията. То нарушава независимостта от несвързани алтернативи и е уязвимо на стратегическо гласуване. Авторите показват, че оценителите наистина имат стимул да подават неискрени предпочитания, за да повлияят на модела[12].

Ге, Прокача и съавтори доказват още, че моделът на Брадли–Тери–Люс, на който се основава обичайното обучение на наградата, както и широки негови обобщения, не изпълняват основни аксиоми на социалния избор[13]. Те предлагат нови правила с по-силни гаранции и наричат подхода „линеен социален избор“[14].

Алтернативни правила за агрегиране

Изследванията предлагат няколко пътя за преодоляване на проблема:

  • Дистрибутивно обучение на предпочитания – вместо една оценка за всеки отговор моделът научава разпределение от възможни оценки и така прави несъгласието между оценителите видимо. В експериментите методът значително намалява уязвимостта към опити за заобикаляне на защитите (jailbreak)[15].
  • Обучение на Наш от човешка обратна връзка (NLHF) – изследователи от Google DeepMind предлагат да не се търси числова награда, а политика, чиито отговори са последователно предпочитани пред отговорите на всяка конкурентна политика, т.е. равновесие на Наш в игра на предпочитания[16].
  • Максимални лотарии – вероятностно правило на социалния избор, което зачита предпочитанията на мнозинството при сравнения по двойки. Маура-Риверо и съавтори (2025) го предлагат като заместител на RLHF и показват, че NLHF и сродни методи се доближават до неговите резултати[17].

Плурализъм вместо един глас

Друго направление поставя под въпрос самата цел всички предпочитания да се сведат до едно поведение. Тейлър Сорънсен и съавтори (2024) описват три начина да се определи и измери плурализмът в системите с изкуствен интелект[18]:

  • модел, който представя целия спектър от разумни отговори;
  • модел, който може да бъде насочван към определена гледна точка;
  • модел, чиито отговори следват разпределението на мненията в дадено население.

Авторите предупреждават, че настоящите техники за съгласуване може да са принципно ограничени за плуралистичен изкуствен интелект и дори да намаляват разнообразието в отговорите на моделите[19].

Опити за демократично съгласуване

  • Колективен конституционен AI (2023) – Anthropic и Collective Intelligence Project провеждат обществено допитване чрез платформата Polis, за да съставят принципите на един модел[20]. Около половината от понятията и ценностите в публичната конституция съвпадат с тези във вътрешната конституция на компанията[21]. Подробности: Колективен конституционен AI.
  • Събрания за съгласуване в Тайван – Министерството на цифровите въпроси си партнира с Collective Intelligence Project[22], а през 2024 г. провежда делиберативно събрание за целостта на информацията със статистически представителни граждани от цял Тайван[23].
  • Habermas Machine (2024) – модел на Google DeepMind, който обобщава мненията в група и предлага общи позиции. В експериментите участниците избират неговите формулировки пред тези на хора медиатори в 56% от случаите[24]. Подробности: Habermas Machine: AI медиатор за групово съгласие.
  • Колективно съгласуване в OpenAI (2025) – компанията проучва над 1000 души по света за това как да се държат моделите ѝ[25]. Част от предложенията не са приети. Сред тях е по-голямата свобода за персонализирано политическо съдържание, отхвърлена заради риска от мащабно индивидуално политическо таргетиране[26].

Отворени въпроси

  • Кой е „електоратът“? Оценителите, наети от компаниите, не са представителна извадка на обществото. Дори при обществени допитвания остава въпросът кой подбира участниците и формулира въпросите.
  • Стратегическо поведение. Когато правилото за агрегиране е известно, участниците могат да го използват в своя полза[12]. При системите медиатори съществува риск злонамерени участници да насочат резултата към предварително зададен дневен ред[27].
  • Прозрачност и отговорност. Правилото за агрегиране рядко се оповестява, макар че от него зависи чие мнение тежи повече[9].
  • Нова изследователска програма. Обзор от 2026 г. посочва 18 отворени проблема в пресечната точка на социалния избор и машинното обучение, включително съгласуването на големите генеративни модели[28].

Вижте също

Доказателства към твърденията

  1. Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback
    arXiv · Vincent Conitzer, Rachel Freedman, Jobst Heitzig, Wesley H. Holliday, Bob M. Jacobs, Nathan Lambert, Milan Mossé, Eric Pacuit, Stuart Russell, Hailey Schoelkopf, Emanuel Tewolde, William S. Zwicker · 2024-04-16
    Отвори източника
  2. Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment
    arXiv · Zhiyu An, Wan Du · 2026-02-03
    Отвори източника
  3. Training language models to follow instructions with human feedback
    arXiv · Long Ouyang et al. · 2022-03-04
    Отвори източника
  4. Training language models to follow instructions with human feedback
    arXiv · Long Ouyang et al. · 2022-03-04
    Отвори източника
  5. Axioms for AI Alignment from Human Feedback
    arXiv · Luise Ge, Daniel Halpern, Evi Micha, Ariel D. Procaccia, Itai Shapira, Yevgeniy Vorobeychik, Junlin Wu · 2024-05-23
    Отвори източника
  6. Arrow's Theorem
    Stanford Encyclopedia of Philosophy · Michael Morreau · 2014-10-13
    Отвори източника
  7. Arrow's Theorem
    Stanford Encyclopedia of Philosophy · Michael Morreau · 2014-10-13
    Отвори източника
  8. AI Alignment and Social Choice: Fundamental Limitations and Policy Implications
    arXiv · Abhilash Mishra · 2023-10-24
    Отвори източника
  9. AI Alignment and Social Choice: Fundamental Limitations and Policy Implications
    arXiv · Abhilash Mishra · 2023-10-24
    Отвори източника
  10. Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback
    arXiv · Vincent Conitzer, Rachel Freedman, Jobst Heitzig, Wesley H. Holliday, Bob M. Jacobs, Nathan Lambert, Milan Mossé, Eric Pacuit, Stuart Russell, Hailey Schoelkopf, Emanuel Tewolde, William S. Zwicker · 2024-04-16
    Отвори източника
  11. Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
    arXiv · Anand Siththaranjan, Cassidy Laidlaw, Dylan Hadfield-Menell · 2023-12-13
    Отвори източника
  12. Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
    arXiv · Anand Siththaranjan, Cassidy Laidlaw, Dylan Hadfield-Menell · 2023-12-13
    Отвори източника
  13. Axioms for AI Alignment from Human Feedback
    arXiv · Luise Ge, Daniel Halpern, Evi Micha, Ariel D. Procaccia, Itai Shapira, Yevgeniy Vorobeychik, Junlin Wu · 2024-05-23
    Отвори източника
  14. Axioms for AI Alignment from Human Feedback
    arXiv · Luise Ge, Daniel Halpern, Evi Micha, Ariel D. Procaccia, Itai Shapira, Yevgeniy Vorobeychik, Junlin Wu · 2024-05-23
    Отвори източника
  15. Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
    arXiv · Anand Siththaranjan, Cassidy Laidlaw, Dylan Hadfield-Menell · 2023-12-13
    Отвори източника
  16. Nash Learning from Human Feedback
    arXiv · Rémi Munos et al. · 2023-12-01
    Отвори източника
  17. Jackpot! Alignment as a Maximal Lottery
    arXiv · Roberto-Rafael Maura-Rivero, Marc Lanctot, Francesco Visin, Kate Larson · 2025-01-31
    Отвори източника
  18. A Roadmap to Pluralistic Alignment
    arXiv (ICML 2024) · Taylor Sorensen et al. · 2024-02-07
    Отвори източника
  19. A Roadmap to Pluralistic Alignment
    arXiv (ICML 2024) · Taylor Sorensen et al. · 2024-02-07
    Отвори източника
  20. Collective Constitutional AI: Aligning a Language Model with Public Input
    Anthropic · 2023-10-17
    Отвори източника
  21. Collective Constitutional AI: Aligning a Language Model with Public Input
    Anthropic · 2023-10-17
    Отвори източника
  22. Alignment Assemblies
    Ministry of Digital Affairs (Taiwan)
    Отвори източника
  23. Alignment Assemblies
    Ministry of Digital Affairs (Taiwan)
    Отвори източника
  24. MIT Technology Review — AI could help people find common ground during deliberations
    MIT Technology Review · 2024-10-17
    Отвори източника
  25. Collective alignment: public input on our Model Spec
    OpenAI · 2025-08-27
    Отвори източника
  26. Collective alignment: public input on our Model Spec
    OpenAI · 2025-08-27
    Отвори източника
  27. Revel & Pénigaud — AI-Enhanced Deliberative Democracy: risks and safeguards (arXiv 2503.05830)
    arXiv
    Отвори източника
  28. Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment
    arXiv · Zhiyu An, Wan Du · 2026-02-03
    Отвори източника
Човешки преглед

Предложи промяна

Предложението влиза в опашка за преглед. Нищо не се публикува автоматично.

Не се притеснявайте за формата: можете да поставите обикновен текст, текст от Word или от друг сайт. Шлюзът за формат ще подреди заглавията, списъците и източниците, а рецензент ще провери резултата. Източниците изброете в края под „Източници:“ — по един на ред, със заглавие и адрес.

Модерация

Докладвай проблем

Сигналът отива при човешки модератор. Подаването му не скрива и не променя съдържанието.