{"id":"7de699ec-34fa-4bef-8d3e-bb973070f7c0","slug":"teoriya-na-sotsialniya-izbor-i-saglasuvane-na-ai","title":"Теория на социалния избор и съгласуване на изкуствения интелект","category":"Технологии · Управление на ИИ","tags":["изкуствен интелект","съгласуване на ИИ","теория на социалния избор","теорема на Ароу","RLHF","плурализъм"],"lead":"Теорията на социалния избор и съгласуването на изкуствения интелект е изследователско направление, което разглежда обучението на големите езикови модели като задача за колективно решение. Когато един модел се настройва според оценките на много хора, които не са съгласни помежду си, някакво правило неизбежно превръща техните различни предпочитания в едно поведение на модела. Така стар въпрос на политическата теория се оказва в центъра на най-новата технология: чии ценности следва изкуственият интелект и по какво правило се решава това[^conitzer-question]. Изследователите отбелязват, че много съвременни системи за машинно обучение вече прилагат механизми на социален избор, но често неявно и без нормативна проверка[^implicit-choice].","sections":[{"id":"kak-modelite-se-uchat-ot-choveshki-predpochitaniya","title":"Как моделите се учат от човешки предпочитания","paragraphs":["Водещият метод от 2022 г. насам е обучението с подсилване от човешка обратна връзка (RLHF). При него оценители сравняват или подреждат отговори на модела, а събраните класирания се използват за допълнителното му обучение[^rlhf-rankings]. Обикновено от сравненията първо се извлича „модел на наградата“ – функция, която дава числова оценка на всеки отговор, – а след това езиковият модел се оптимизира да получава висока оценка. Ефектът е голям: в изследването на OpenAI отговорите на модел с 1,3 милиарда параметъра, обучен по този начин, са предпочитани пред отговорите на модел със 175 милиарда параметъра без такова обучение[^rlhf-preferred].","Извличането на една награда от сравненията на много хора всъщност е агрегиране на предпочитания – задача, която според Луизе Ге, Ариел Прокача и съавтори попада в обхвата на теорията на социалния избор[^ge-aggregation]."]},{"id":"teoremata-na-arou","title":"Теоремата на Ароу","paragraphs":["Теорията на социалния избор изследва как индивидуалните предпочитания могат да се обединят в колективно решение. Още маркиз дьо Кондорсе показва през XVIII век, че мнозинството може едновременно да предпочита A пред B, B пред C и C пред A – т.нар. парадокс на гласуването. Кенет Ароу обобщава проблема през 1951 г.: когато алтернативите са повече от две, не съществува правило за агрегиране, което да изпълнява едновременно пет привидно скромни условия[^arrow-theorem]:","- **Неограничена област** – правилото работи при всякакви индивидуални предпочитания.\n- **Колективна рационалност** – резултатът е последователно подреждане на алтернативите.\n- **Принцип на Парето** – ако всички предпочитат x пред y, обществото също предпочита x пред y.\n- **Независимост от несвързани алтернативи** – колективната преценка между x и y зависи само от това как хората подреждат x и y.\n- **Липса на диктатор** – няма човек, чиито предпочитания винаги определят резултата.","През 1972 г. Ароу получава Нобелова награда за икономика[^arrow-nobel]. Теоремата не означава, че всички правила са еднакво лоши, а че всяко правило жертва някое от условията. Изборът кое условие да бъде жертвано е ценностно решение, а не техническа подробност."]},{"id":"izvodat-za-izkustveniya-intelekt","title":"Изводът за изкуствения интелект","paragraphs":["Абхилаш Мишра (2023) прилага резултатите за невъзможност към RLHF и заключава, че няма единствен протокол за гласуване, с който системите с изкуствен интелект да бъдат универсално съгласувани чрез демократични процеси[^mishra-impossible]. Оттук той извежда две препоръки: правилата за агрегиране да бъдат задължително прозрачни, за да могат създателите на моделите да носят отговорност, и вместо един „универсален“ модел да се разработват системи, съгласувани с конкретни групи потребители[^mishra-policy].","Позиционна статия на Винсент Коницър, Стюарт Ръсел и още десет автори, подготвена след семинар в Бъркли през декември 2023 г., стига до сходен извод от обратната посока: щом проблемът е агрегиране, натрупаното знание на теорията на социалния избор трябва да насочва съгласуването на моделите[^conitzer-position]."]},{"id":"skritoto-glasuvane-po-borda","title":"Скритото гласуване по Борда","paragraphs":["Важен резултат идва от Ананд Сититаранджан, Касиди Лейдлоу и Дилън Хадфийлд-Менел (2024). Те доказват, че когато оценителите имат различни, невидими за системата критерии, стандартното обучение на модел на наградата на практика агрегира техните предпочитания по добре познатото правило на Борда[^borda]. Това правило точкува всяка алтернатива според мястото ѝ в класиранията. То нарушава независимостта от несвързани алтернативи и е уязвимо на стратегическо гласуване. Авторите показват, че оценителите наистина имат стимул да подават неискрени предпочитания, за да повлияят на модела[^misreport].","Ге, Прокача и съавтори доказват още, че моделът на Брадли–Тери–Люс, на който се основава обичайното обучение на наградата, както и широки негови обобщения, не изпълняват основни аксиоми на социалния избор[^ge-btl]. Те предлагат нови правила с по-силни гаранции и наричат подхода „линеен социален избор“[^ge-linear]."]},{"id":"alternativni-pravila-za-agregirane","title":"Алтернативни правила за агрегиране","paragraphs":["Изследванията предлагат няколко пътя за преодоляване на проблема:","- **Дистрибутивно обучение на предпочитания** – вместо една оценка за всеки отговор моделът научава разпределение от възможни оценки и така прави несъгласието между оценителите видимо. В експериментите методът значително намалява уязвимостта към опити за заобикаляне на защитите (jailbreak)[^dpl].\n- **Обучение на Наш от човешка обратна връзка (NLHF)** – изследователи от Google DeepMind предлагат да не се търси числова награда, а политика, чиито отговори са последователно предпочитани пред отговорите на всяка конкурентна политика, т.е. равновесие на Наш в игра на предпочитания[^nlhf].\n- **Максимални лотарии** – вероятностно правило на социалния избор, което зачита предпочитанията на мнозинството при сравнения по двойки. Маура-Риверо и съавтори (2025) го предлагат като заместител на RLHF и показват, че NLHF и сродни методи се доближават до неговите резултати[^max-lottery]."]},{"id":"pluralizam-vmesto-edin-glas","title":"Плурализъм вместо един глас","paragraphs":["Друго направление поставя под въпрос самата цел всички предпочитания да се сведат до едно поведение. Тейлър Сорънсен и съавтори (2024) описват три начина да се определи и измери плурализмът в системите с изкуствен интелект[^pluralism-three]:","- модел, който представя целия спектър от разумни отговори;\n- модел, който може да бъде насочван към определена гледна точка;\n- модел, чиито отговори следват разпределението на мненията в дадено население.","Авторите предупреждават, че настоящите техники за съгласуване може да са принципно ограничени за плуралистичен изкуствен интелект и дори да намаляват разнообразието в отговорите на моделите[^pluralism-limits]."]},{"id":"opiti-za-demokratichno-saglasuvane","title":"Опити за демократично съгласуване","paragraphs":["- **Колективен конституционен AI (2023)** – Anthropic и Collective Intelligence Project провеждат обществено допитване чрез платформата Polis, за да съставят принципите на един модел[^ccai]. Около половината от понятията и ценностите в публичната конституция съвпадат с тези във вътрешната конституция на компанията[^ccai-overlap]. Подробности: [[kolektiven-konstitutsionen-ai|Колективен конституционен AI]].\n- **Събрания за съгласуване в Тайван** – Министерството на цифровите въпроси си партнира с Collective Intelligence Project[^moda-cip], а през 2024 г. провежда делиберативно събрание за целостта на информацията със статистически представителни граждани от цял Тайван[^moda-sample].\n- **Habermas Machine (2024)** – модел на Google DeepMind, който обобщава мненията в група и предлага общи позиции. В експериментите участниците избират неговите формулировки пред тези на хора медиатори в 56% от случаите[^habermas]. Подробности: [[habermas-machine-ai-mediator|Habermas Machine: AI медиатор за групово съгласие]].\n- **Колективно съгласуване в OpenAI (2025)** – компанията проучва над 1000 души по света за това как да се държат моделите ѝ[^openai-survey]. Част от предложенията не са приети. Сред тях е по-голямата свобода за персонализирано политическо съдържание, отхвърлена заради риска от мащабно индивидуално политическо таргетиране[^openai-rejected]."]},{"id":"otvoreni-vaprosi","title":"Отворени въпроси","paragraphs":["- **Кой е „електоратът“?** Оценителите, наети от компаниите, не са представителна извадка на обществото. Дори при обществени допитвания остава въпросът кой подбира участниците и формулира въпросите.\n- **Стратегическо поведение.** Когато правилото за агрегиране е известно, участниците могат да го използват в своя полза[^misreport]. При системите медиатори съществува риск злонамерени участници да насочат резултата към предварително зададен дневен ред[^revel-risk].\n- **Прозрачност и отговорност.** Правилото за агрегиране рядко се оповестява, макар че от него зависи чие мнение тежи повече[^mishra-policy].\n- **Нова изследователска програма.** Обзор от 2026 г. посочва 18 отворени проблема в пресечната точка на социалния избор и машинното обучение, включително съгласуването на големите генеративни модели[^open-problems]."]},{"id":"vizhte-sashto","title":"Вижте също","paragraphs":["- [[deliberativna-demokratsia|Делиберативна демокрация]]\n- [[vtaiwan-tsifrova-demokratsia|vTaiwan: цифровата демокрация в Тайван]]\n- [[plurality-tehnologiya-za-demokratsiya|Plurality: технология за съвместно многообразие и демокрация]]\n- [[mazhoritarna-izbiratelna-sistema|Мажоритарна избирателна система]]\n- [[es-zakon-za-izkustven-intelekt|Законът на ЕС за изкуствен интелект]]\n- [[sashtnost-i-razvitie-na-ai-tehnologiyata|Същност и развитие на технологията на изкуствения интелект (2022-2026)]]"]}],"sources":[{"key":"sep-arrow","title":"Arrow's Theorem","url":"https://plato.stanford.edu/entries/arrows-theorem/","note":"","publisher":"Stanford Encyclopedia of Philosophy","author":"Michael Morreau","published_at":"2014-10-13","language":"en","retrieved_at":"2026-10-11"},{"key":"ouyang-2022","title":"Training language models to follow instructions with human feedback","url":"https://arxiv.org/abs/2203.02155","note":"","publisher":"arXiv","author":"Long Ouyang et al.","published_at":"2022-03-04","language":"en","retrieved_at":"2026-10-11"},{"key":"ge-2024","title":"Axioms for AI Alignment from Human Feedback","url":"https://arxiv.org/abs/2405.14758","note":"","publisher":"arXiv","author":"Luise Ge, Daniel Halpern, Evi Micha, Ariel D. Procaccia, Itai Shapira, Yevgeniy Vorobeychik, Junlin Wu","published_at":"2024-05-23","language":"en","retrieved_at":"2026-10-11"},{"key":"mishra-2023","title":"AI Alignment and Social Choice: Fundamental Limitations and Policy Implications","url":"https://arxiv.org/abs/2310.16048","note":"","publisher":"arXiv","author":"Abhilash Mishra","published_at":"2023-10-24","language":"en","retrieved_at":"2026-10-11"},{"key":"conitzer-2024","title":"Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback","url":"https://arxiv.org/abs/2404.10271","note":"","publisher":"arXiv","author":"Vincent Conitzer, Rachel Freedman, Jobst Heitzig, Wesley H. Holliday, Bob M. Jacobs, Nathan Lambert, Milan Mossé, Eric Pacuit, Stuart Russell, Hailey Schoelkopf, Emanuel Tewolde, William S. Zwicker","published_at":"2024-04-16","language":"en","retrieved_at":"2026-10-11"},{"key":"siththaranjan-2024","title":"Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF","url":"https://arxiv.org/abs/2312.08358","note":"","publisher":"arXiv","author":"Anand Siththaranjan, Cassidy Laidlaw, Dylan Hadfield-Menell","published_at":"2023-12-13","language":"en","retrieved_at":"2026-10-11"},{"key":"munos-nlhf","title":"Nash Learning from Human Feedback","url":"https://arxiv.org/abs/2312.00886","note":"","publisher":"arXiv","author":"Rémi Munos et al.","published_at":"2023-12-01","language":"en","retrieved_at":"2026-10-11"},{"key":"maura-rivero-2025","title":"Jackpot! Alignment as a Maximal Lottery","url":"https://arxiv.org/abs/2501.19266","note":"","publisher":"arXiv","author":"Roberto-Rafael Maura-Rivero, Marc Lanctot, Francesco Visin, Kate Larson","published_at":"2025-01-31","language":"en","retrieved_at":"2026-10-11"},{"key":"sorensen-2024","title":"A Roadmap to Pluralistic Alignment","url":"https://arxiv.org/abs/2402.05070","note":"","publisher":"arXiv (ICML 2024)","author":"Taylor Sorensen et al.","published_at":"2024-02-07","language":"en","retrieved_at":"2026-10-11"},{"key":"an-du-2026","title":"Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment","url":"https://arxiv.org/abs/2602.03003","note":"","publisher":"arXiv","author":"Zhiyu An, Wan Du","published_at":"2026-02-03","language":"en","retrieved_at":"2026-10-11"},{"key":"anthropic-ccai","title":"Collective Constitutional AI: Aligning a Language Model with Public Input","url":"https://www.anthropic.com/research/collective-constitutional-ai-aligning-a-language-model-with-public-input","note":"","publisher":"Anthropic","published_at":"2023-10-17","language":"en","retrieved_at":"2026-10-11"},{"key":"moda-alignment","title":"Alignment Assemblies","url":"https://moda.gov.tw/en/major-policies/alignment-assemblies/1453","note":"","publisher":"Ministry of Digital Affairs (Taiwan)","language":"en","retrieved_at":"2026-10-11"},{"key":"mit-tr-habermas","title":"MIT Technology Review — AI could help people find common ground during deliberations","url":"https://www.technologyreview.com/2024/10/17/1105810/ai-could-help-people-find-common-ground-during-deliberations/","note":"","publisher":"MIT Technology Review","published_at":"2024-10-17","language":"en","retrieved_at":"2026-10-11"},{"key":"openai-collective-2025","title":"Collective alignment: public input on our Model Spec","url":"https://openai.com/index/collective-alignment-aug-2025-updates","note":"","publisher":"OpenAI","published_at":"2025-08-27","language":"en","retrieved_at":"2026-10-11"},{"key":"revel-penigaud","title":"Revel & Pénigaud — AI-Enhanced Deliberative Democracy: risks and safeguards (arXiv 2503.05830)","url":"https://arxiv.org/pdf/2503.05830","note":"","publisher":"arXiv","language":"en","retrieved_at":"2026-10-11"}],"citations":[{"id":"conitzer-question","source_key":"conitzer-2024","locator":"","excerpt":"How can we aggregate the input into consistent data about","note":""},{"id":"implicit-choice","source_key":"an-du-2026","locator":"","excerpt":"many contemporary machine learning systems already implement social choice mechanisms ... often implicitly and without explicit normative scrutiny","note":""},{"id":"rlhf-rankings","source_key":"ouyang-2022","locator":"","excerpt":"which we use to further fine-tune this supervised model using reinforcement learning from human feedback","note":""},{"id":"rlhf-preferred","source_key":"ouyang-2022","locator":"","excerpt":"outputs from the 1.3B parameter InstructGPT model are preferred to outputs from the 175B GPT-3","note":""},{"id":"ge-aggregation","source_key":"ge-2024","locator":"","excerpt":"preference aggregation that, we argue, largely falls within the scope of social choice theory","note":""},{"id":"arrow-theorem","source_key":"sep-arrow","locator":"","excerpt":"Suppose there are more than two alternatives. Then no social welfare function f satisfies U, SO, WP, D, and I.","note":""},{"id":"arrow-nobel","source_key":"sep-arrow","locator":"","excerpt":"In 1972, he received the Nobel Prize in economics for his contributions.","note":""},{"id":"mishra-impossible","source_key":"mishra-2023","locator":"","excerpt":"there is no unique voting protocol to universally align AI systems using RLHF through democratic processes","note":""},{"id":"mishra-policy","source_key":"mishra-2023","locator":"","excerpt":"the need for mandating transparent voting rules to hold model builders accountable ... the need for model builders to focus on developing AI agents that are narrowly aligned to specific user groups","note":""},{"id":"conitzer-position","source_key":"conitzer-2024","locator":"","excerpt":"we argue that the field of social choice is well positioned to address these questions ... held in Berkeley, CA, USA in December 2023","note":""},{"id":"borda","source_key":"siththaranjan-2024","locator":"","excerpt":"implicitly aggregate over hidden contexts according to a well-known voting rule called Borda count","note":""},{"id":"misreport","source_key":"siththaranjan-2024","locator":"","excerpt":"annotators have an incentive to misreport their preferences in order to influence the learned model","note":""},{"id":"ge-btl","source_key":"ge-2024","locator":"","excerpt":"We demonstrate that both the Bradley-Terry-Luce Model and its broad generalizations fail to meet basic axioms.","note":""},{"id":"ge-linear","source_key":"ge-2024","locator":"","excerpt":"leads to a new paradigm that we call linear social choice","note":""},{"id":"dpl","source_key":"siththaranjan-2024","locator":"","excerpt":"significantly reduces subsequent jailbreak vulnerability","note":""},{"id":"nlhf","source_key":"munos-nlhf","locator":"","excerpt":"Our approach entails the initial learning of a preference model, which is conditioned on two inputs given a prompt ... the pursuit of a policy that consistently generates responses preferred over those generated by any competing policy","note":""},{"id":"max-lottery","source_key":"maura-rivero-2025","locator":"","excerpt":"we propose the use of a probabilistic Social Choice rule called maximal lotteries as a replacement for RLHF","note":""},{"id":"pluralism-three","source_key":"sorensen-2024","locator":"","excerpt":"We identify and formalize three possible ways to define and operationalize pluralism in AI systems","note":""},{"id":"pluralism-limits","source_key":"sorensen-2024","locator":"","excerpt":"current alignment techniques may be fundamentally limited for pluralistic AI ... standard alignment procedures might reduce distributional pluralism in models","note":""},{"id":"ccai","source_key":"anthropic-ccai","locator":"","excerpt":"Anthropic partnered with the Collective Intelligence Project to run a public input process using the Polis platform.","note":""},{"id":"ccai-overlap","source_key":"anthropic-ccai","locator":"","excerpt":"roughly 50% overlap in concepts and values","note":""},{"id":"moda-cip","source_key":"moda-alignment","locator":"","excerpt":"partnered with the international nongovernmental organization Collective Intelligence Project (CIP)","note":""},{"id":"moda-sample","source_key":"moda-alignment","locator":"","excerpt":"statistically representative citizens from all over Taiwan","note":""},{"id":"habermas","source_key":"mit-tr-habermas","locator":"","excerpt":"selected the AI-generated statements over human mediator statements 56% of the time","note":""},{"id":"openai-survey","source_key":"openai-collective-2025","locator":"","excerpt":"We surveyed over 1,000 people worldwide on how our models should behave","note":""},{"id":"openai-rejected","source_key":"openai-collective-2025","locator":"","excerpt":"We did not adopt this change, given the risks of large-scale individualized political targeting","note":""},{"id":"revel-risk","source_key":"revel-penigaud","locator":"","excerpt":"malicious actors hacking the system to steer outcomes toward predetermined agendas","note":""},{"id":"open-problems","source_key":"an-du-2026","locator":"","excerpt":"We conclude by identifying 18 open problems defining a new research agenda","note":""}],"status":"published","featured":false,"revision":1,"created_at":"2026-10-11T17:20:57.873Z","updated_at":"2026-10-11T17:20:57.873Z"}