# Оценяване и сравняване на системи с изкуствен интелект

Оценяването на системите с изкуствен интелект е измерването и сравняването на техните способности, надеждност, ефективност и цена при различни задачи. При съвременните езикови модели и автономни агенти то вече не се свежда до броя верни отговори на тест: един модел е силен в математическото разсъждение, друг — в програмирането, трети — в работата с инструменти или с дълги документи. Затова вместо „Кой ИИ е най-добър?“ все по-често се пита: „Какви задачи може тази система да изпълнява надеждно, при какви условия, за колко време и на каква цена?“

## Бенчмарк, класация и индекс

Три понятия често се смесват. Бенчмаркът е стандартизиран набор от задачи и критерии за измерване. Класацията (leaderboard) представя резултатите на много системи върху една или повече оценки. Композитният индекс събира резултатите от различни оценки в едно число, като дава тежест на всяка от тях. Така сравнението става лесно, но сложното понятие „способност на ИИ“ рискува да бъде сведено до една цифра.

## Защо една обща оценка не е достатъчна

Способностите на съвременните системи са многомерни: разсъждение, научно мислене, програмиране, работа с инструменти, дълъг контекст, извличане на информация, автономност, проверка, възстановяване след грешка, фактическа надеждност, скорост, цена и хардуерна ефективност. Затова моделът, който е първи в обща класация, не е непременно най-подходящият за конкретна задача.

## От единичен отговор към цялостна задача

По-старото оценяване следва схемата „въпрос → отговор → проверка на отговора“. При агентните системи процесът е „цел → търсене на информация → план → действие → проверка → корекция → ново действие → краен резултат“.

Една система може да решава правилно отделни задачи по програмиране, но да не успява надеждно да анализира голямо програмно хранилище, да открие причината за дефект, да промени правилните файлове, да пусне тестовете, да разпознае неуспешен тест, да поправи собствената си грешка и да провери, че не е повредила друга функционалност. Успехът на единичния отговор и надеждността на автономния процес са различни характеристики.

## Artificial Analysis Intelligence Index

Пример за съвременен композитен подход е индексът на Artificial Analysis. Версия 4.3.2 включва десет оценки[1] — агентни задачи, програмиране, научно разсъждение, знания, работа с документи, дълъг контекст и устойчивост срещу халюцинации. Индексът е претеглена средна от четири категории: агенти (30%), програмиране (20%), научно разсъждение (20%) и общи способности (30%)[2]. Във версия 4.3 делът на оценките с непубликувани въпроси или отговори расте от 40 на 45%[3], за да е по-трудно моделите да бъдат настройвани специално за известни тестове. Агентните способности вече са самостоятелна основна категория, а не странична характеристика на езиковия модел.

## METR и времевият хоризонт на задачите

Изследователската организация METR измерва т.нар. времеви хоризонт: продължителността на задача — според времето, което отнема на човешки специалист, — при която се очаква ИИ агентът да успее с дадена надеждност[4]. Петдесетпроцентният хоризонт е продължителността, при която агентът се очаква да успее в половината от случаите[5]; METR публикува и осемдесетпроцентен хоризонт, който изисква по-висока надеждност[6]. Това не измерва колко време работи самият ИИ — човешкото време служи като мярка за сложността на задачата.

## HELM и многомерното оценяване

Holistic Evaluation of Language Models (HELM) на Центъра за изследване на базовите модели към Станфордския университет (CRFM) следва друга философия. HELM Capabilities е подбран набор от сценарии за измерване на отделни способности на езиковите модели[7]; за всяка способност се избира по един сценарий от научната литература според това дали е наситен, колко е нов и колко е качествен[8]. Класацията е прозрачна до ниво отделна подкана (prompt) и резултатите могат да бъдат възпроизведени[9].

## Дългият контекст не е само размер на прозореца

Производителите посочват колко токена моделът може да приеме наведнъж, но поддръжката на дълъг вход не означава силни способности за работа с него[10]. HELM Long Context сравнява моделите в пет задачи с дълги текстове — въпроси и отговори, многостъпково свързване на сведения, избор между отговори, обобщаване и проследяване на дълъг разговор[11]. Дори в изчислително простата задача OpenAI-MRCR най-добрият резултат при първото издание е едва 0,256[12].

## Оценяване на цяла ИИ система

Новата тенденция е да се оценява не само моделът, а целият технологичен процес около него. MLPerf Inference v6.1 (септември 2026 г.) добавя тест за цялостен процес с извличане на информация (RAG), съставен от няколко отделни модела[13]: модел за вграждане превръща заявката във вектор, извличащ модул взема подходящи пасажи от векторна база данни, пренареждащ модел подрежда списъка и езиков модел съставя отговора[14]. Новият тест за агентна работа на крайни устройства (edge) отразява прехода от еднократни въпроси към многоходови задачи като агентното програмиране[15]. Обектът на измерване вече е система от взаимодействащи компоненти.

## Стохастичност и повторяемост

Генеративните модели са стохастични: една и съща задача не винаги води до еднакъв резултат, затова един успешен опит не доказва надеждност. Добрата методика включва многократни изпълнения, дял на успешните опити, доверителни интервали, фиксирани условия и точно описани версии на моделите и инструментите. Artificial Analysis например оценява по правило само първия опит на модела[16] и посочва, че 95-процентният доверителен интервал на индекса му е под ±1%[17].

## Замърсяване на бенчмарковете

Когато тестовите задачи са публични години наред, те могат да попаднат в обучаващите данни, публичните хранилища, техническите статии и примерите за оптимизация. Тогава високият резултат може отчасти да отразява познаване на конкретните задачи, а не способност за решаване на нов проблем. Затова класациите все по-често използват задържани (непубликувани) тестови набори — например Artificial Analysis за AutomationBench[18].

## Цена за успешно решена задача

Цената на ИИ услугите обикновено се дава за определен брой входни и изходни токени. По-практичен показател е цената за успешно завършена задача. При автономен агент към нея се добавят времето, използваните инструменти, изчислителният ресурс, броят опити, цената на проверката и човешката намеса.

## Локални модели

При локалните системи има допълнителни критерии: оперативна памет, памет на графичния процесор, изчислителна мощност, консумация на енергия, скорост в токени за секунда, ефект от квантизацията, реално използваем контекст, работа без интернет, поверителност и възможност за донастройка. Модел с по-нисък резултат в общ бенчмарк може да е по-подходящ за конкретна локална система.

## Профил на автономните агенти

За автономните агенти може да се използва отделен профил: разбиране на целта, извличане на нужната информация, планиране, избор на инструмент, действие, наблюдение на резултата, разпознаване на грешка, смяна на стратегията, проверка на крайния резултат и безопасно прекратяване или връщане назад. При такива системи възстановяването след грешка може да е толкова важно, колкото и първоначалното правилно решение.

## От „най-добър модел“ към model routing

Една от посоките на развитие е системите да използват не един, а няколко специализирани модела: малък и евтин за рутинна класификация, модел за търсене и извличане, мощен модел за сложни решения, модел за програмиране, отделен модел за проверка, мултимодален модел за изображения и локален модел за чувствителни данни. Система, която сама избира подходящия модел за всяка задача, използва т.нар. model routing. Тогава въпросът вече не е „Кой е най-добрият ИИ?“, а „Кой ИИ е най-подходящ за тази задача при конкретните ограничения?“

## Към карта на способностите

Буквените интернет класации от типа S, A, B, C са удобни за бърза ориентация, но скриват голяма част от информацията — обикновено не посочват методика, източници и дата. По-подходящо представяне е многомерна карта на способностите: разсъждение × програмиране × извличане × контекст × инструменти × автономност × проверка × възстановяване × надеждност × скорост × цена.

## Перспектива

Развитието от чатботове към разсъждаващи модели и автономни агенти, описано в статията Същност и развитие на технологията на изкуствения интелект (2022–2026), променя и самото понятие за оценяване. С нарастването на автономността все по-важно става не дали системата дава правилен единичен отговор, а дали стига до проверим краен резултат след дълга поредица от действия. Бенчмарковете постепенно преминават от оценяване на отговор през оценяване на модел към оценяване на автономна система — и практическата класификация на ИИ вероятно ще описва все повече границата на задачите, които една система изпълнява надеждно и икономически ефективно.

## Вижте също

- [Същност и развитие на технологията на изкуствения интелект (2022-2026)](https://wikib.online/article/sashtnost-i-razvitie-na-ai-tehnologiyata)
- [Рамката на NIST за управление на риска от изкуствен интелект](https://wikib.online/article/nist-ramka-za-risk-ot-ai-sasht)
- [Институт за безопасност на изкуствения интелект на Обединеното кралство](https://wikib.online/article/obedineno-kralstvo-institut-bezopasnost-ai)
- [Трансформацията на OpenAI от нестопанска в стопанска структура](https://wikib.online/article/openai-transformatsia-nestopanska-tsel)
- [AI енциклопедии](https://wikib.online/article/ai-entsiklopedii)
- [Изкуственият интелект в изборите и представителната демокрация](https://wikib.online/article/izkustveniyat-intelekt-v-izborite-i-predstavitelnata-demokratsiya)
- [Законът на Ню Йорк за ИИ-спътници (2025)](https://wikib.online/article/nyu-york-zakon-ai-sapatnitsi-2025)
- [Международната мрежа на институтите за безопасност на ИИ](https://wikib.online/article/mezhdunarodna-mrezha-instituti-bezopasnost-ai)
- [Швейцария тества електронно събиране на подписи за референдуми](https://wikib.online/article/shveytsaria-elektronno-sabirane-podpisi)
- [Изкуствен интелект и заплахата за честността на изборите и референдумите](https://wikib.online/article/ai-zaplaha-za-izbori-i-referendumi)

## Доказателства към твърденията

1. Announcing the Artificial Analysis Intelligence Index v4.3 — Artificial Analysis (07.09.2026) — Място: Оценки в индекса — https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-3

2. Intelligence Benchmarking Methodology — Artificial Analysis — Място: Методология — https://artificialanalysis.ai/methodology/intelligence-benchmarking

3. Announcing the Artificial Analysis Intelligence Index v4.3 — Artificial Analysis (07.09.2026) — Място: Частни тестове — https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-3

4. Task-Completion Time Horizons of Frontier AI Models — METR — Място: Определение — https://metr.org/time-horizons/

5. Task-Completion Time Horizons of Frontier AI Models — METR — Място: 50% хоризонт — https://metr.org/time-horizons/

6. Task-Completion Time Horizons of Frontier AI Models — METR — Място: 80% хоризонт — https://metr.org/time-horizons/

7. HELM Capabilities: Evaluating LMs Capability by Capability — Stanford CRFM (20.03.2025) — Място: Въведение — https://crfm.stanford.edu/2025/03/20/helm-capabilities.html

8. HELM Capabilities: Evaluating LMs Capability by Capability — Stanford CRFM (20.03.2025) — Място: Подбор на сценариите — https://crfm.stanford.edu/2025/03/20/helm-capabilities.html

9. HELM Capabilities: Evaluating LMs Capability by Capability — Stanford CRFM (20.03.2025) — Място: Прозрачност — https://crfm.stanford.edu/2025/03/20/helm-capabilities.html

10. HELM Long Context — Stanford CRFM (29.09.2025) — Място: Въведение — https://crfm.stanford.edu/2025/09/29/helm-long-context.html

11. HELM Long Context — Stanford CRFM (29.09.2025) — Място: Задачи — https://crfm.stanford.edu/2025/09/29/helm-long-context.html

12. HELM Long Context — Stanford CRFM (29.09.2025) — Място: Резултати — https://crfm.stanford.edu/2025/09/29/helm-long-context.html

13. MLCommons Sets Participation Record with New MLPerf Inference v6.1 Benchmark Results — MLCommons / GlobeNewswire (16.09.2026) — Място: End-to-End RAG — https://www.globenewswire.com/news-release/2026/09/16/3363348/0/en/mlcommons-sets-participation-record-with-new-mlperf-inference-v6-1-benchmark-results.html

14. MLCommons Sets Participation Record with New MLPerf Inference v6.1 Benchmark Results — MLCommons / GlobeNewswire (16.09.2026) — Място: End-to-End RAG — https://www.globenewswire.com/news-release/2026/09/16/3363348/0/en/mlcommons-sets-participation-record-with-new-mlperf-inference-v6-1-benchmark-results.html

15. MLCommons Sets Participation Record with New MLPerf Inference v6.1 Benchmark Results — MLCommons / GlobeNewswire (16.09.2026) — Място: Edge Agentic Inference — https://www.globenewswire.com/news-release/2026/09/16/3363348/0/en/mlcommons-sets-participation-record-with-new-mlperf-inference-v6-1-benchmark-results.html

16. Intelligence Benchmarking Methodology — Artificial Analysis — Място: Оценяване — https://artificialanalysis.ai/methodology/intelligence-benchmarking

17. Intelligence Benchmarking Methodology — Artificial Analysis — Място: Доверителен интервал — https://artificialanalysis.ai/methodology/intelligence-benchmarking

18. Announcing the Artificial Analysis Intelligence Index v4.3 — Artificial Analysis (07.09.2026) — Място: AutomationBench — https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-3

## Метаданни

- Каноничен URL: https://wikib.online/article/otsenyavane-i-sravnyavane-na-sistemi-s-izkustven-intelekt
- Лиценз: CC BY-SA 4.0 (https://creativecommons.org/licenses/by-sa/4.0/)
- Ревизия: 2
- Статус: published
- Език: bg
- JSON: https://wikib.online/api/public/articles/otsenyavane-i-sravnyavane-na-sistemi-s-izkustven-intelekt
