Benchmarky pro kódící asistenty: co vlastně měří SWE-bench a spol.
Každé oznámení nového modelu dnes doprovází lavina procent: „88,6 % na SWE-bench Verified“, „82,7 % na Terminal-Bench“. Jenže co ta čísla doopravdy znamenají? Proč tentýž model dostane na jedné variantě benchmarku o 25 procentních bodů méně než na druhé? A proč je 99 % na HumanEval dnes spíš důvod k nedůvěře než k nadšení? Provedeme vás světem benchmarků pro LLM ve vývoji softwaru — od jednořádkových funkcí po opravy skutečných GitHub issues — a hlavně vás naučíme jejich čísla správně číst.
Jak číst celé téma
Benchmark není jen číslo, ale scénář. Nejdřív se ptejte, jakou práci simuluje, potom jaký používá harness a až nakonec porovnávejte procenta na leaderboardu.
Tři generace benchmarků
Benchmarky pro kód se dají srovnat podle toho, jak velký kus reálné vývojářské práce simulují. Historicky se vyvíjely od nejmenšího k největšímu — a přesně v tom pořadí je modely postupně „přerůstaly“.
1. generace: funkce z docstringu
HumanEval (OpenAI, 2021) definoval žánr: 164 ručně psaných Python úloh, kde model dostane hlavičku funkce s docstringem a má doplnit tělo tak, aby prošly jednotkové testy. Podobně stavěný MBPP (Google, 2021) přidal ~1 000 jednodušších úloh. V roce 2021 na HumanEval nejlepší model (Codex) řešil ~29 % úloh, GPT-4 v roce 2023 ~67 % — dnes frontier modely překračují 95–99 % a benchmark je saturovaný: nerozliší dobrý model od výborného. Projekt EvalPlus navíc ukázal, že když se k úlohám dogenerují důkladnější testy (HumanEval+), skóre většiny modelů znatelně spadne — část „úspěchů“ byla jen povrchní shoda s chudými testy.
2. generace: soutěžní úlohy odolné kontaminaci
LiveCodeBench (2024) zaútočil na největší slabinu první generace: kontaminaci trénovacích dat. Úlohy sbírá průběžně z programátorských soutěží (LeetCode, AtCoder, Codeforces) a u každé eviduje datum zveřejnění — model se pak hodnotí jen na úlohách vydaných po jeho datu uzávěrky dat. Nemohl je tedy vidět v tréninku. Varianta LiveCodeBench Pro hodnotí modely Elo ratingem proti obtížnosti úloh jako šachisty.
3. generace: skutečné repozitáře a agentní práce
SWE-bench (Princeton, 2023) změnil měřítko: místo izolované funkce dostane model skutečné GitHub issue a celý repozitář (Django, scikit-learn, sympy…). Musí problém najít, opravit a projít testy projektu — bez agentní smyčky s nástroji (viz náš článek o agentech) to nejde. Na stejné myšlence staví Terminal-Bench (2025), který měří dlouhé úlohy v terminálu: nakonfiguruj server, oprav build, zprovozni pipeline. Tady se dnes odehrává skutečné porovnávání modelů.
| Benchmark | Rok | Co měří | Metrika | Stav v 2026 |
|---|---|---|---|---|
| HumanEval / MBPP | 2021 | doplnění funkce podle docstringu (Python) | pass@1 | saturovaný, historická reference |
| LiveCodeBench | 2024 | soutěžní úlohy zveřejněné po uzávěrce dat | pass@1 / Elo | respektovaná kontrola kontaminace |
| SWE-bench Verified | 2024 | oprava reálných GitHub issues (Python repa) | % vyřešených issues | zlatý standard, blíží se saturaci |
| SWE-bench Pro | 2025 | těžší issues, kontrola kontaminace, komerční repa | % vyřešených issues | nástupce Verified, daleko od saturace |
| Aider Polyglot | 2024 | editace kódu v 6 jazycích, správný formát diffů | % úloh se skrytými testy | respektovaný komunitní standard |
| Terminal-Bench 2.0 | 2025 | dlouhé úlohy v shellu, práce s nástroji, recovery | % dokončených úloh | nastupující standard pro agenty |
Jak číst metriky
- pass@k — pravděpodobnost, že alespoň jedno z k vygenerovaných řešení projde testy. Nejčastěji se reportuje pass@1 (první pokus). Pozor: pass@5 vypadá vždycky lépe; při srovnávání musí být k stejné.
- Resolve rate — podíl vyřešených issues na SWE-bench. „Vyřešeno“ znamená, že patch projde testy napsanými pro skutečnou opravu (fail-to-pass testy) a nerozbije zbytek test suite.
- Elo — relativní síla z párových soubojů. Používají ho arény, kde hlasují vývojáři (Copilot Arena, WebDev Arena), a LiveCodeBench Pro. Výhoda: neustále čerstvé úlohy a lidský soud; nevýhoda: měří i „líbivost“, ne jen správnost.
- Cena a počet kroků — u agentních benchmarků se stále častěji uvádí i cena běhu. Model s o 2 body vyšším skóre za trojnásobnou cenu není automaticky lepší volba.
Rodina SWE-bench: prestiž i zmatek
Když se dnes řekne „benchmark na kódování“, myslí se většinou SWE-bench — žádné jiné číslo se v oznámeních modelů necituje tak často. Jenže SWE-bench není jeden benchmark, je to rodina, a záměna variant je nejčastější způsob, jak se čtenář nechá zmást:
- SWE-bench (původní, 2023) — 2 294 issues z 12 populárních Python repozitářů. Ukázalo se ale, že část úloh je špatně zadaná nebo má nespolehlivé testy.
- SWE-bench Verified (2024) — OpenAI nechala všech 2 294 úloh projít lidskou anotací a vybrala 500 čistých: řešitelných ze zadání, se spolehlivými testy. Právě tohle je dnes citovaný standard.
- SWE-bench Pro (2025, Scale AI) — reakce na blížící se saturaci Verified: těžší, vícesouborové úlohy, část z komerčních (veřejně nedostupných) repozitářů, aktivní kontrola kontaminace.
- Multimodal, Multilingual, Live — varianty s obrázky v zadání (screenshoty bugů), dalšími jazyky mimo Python a průběžně přidávanými čerstvými issues.
Jak moc na variantě záleží, ukazuje srovnání stejných modelů na Verified a Pro — rozdíl je konzistentně kolem 25 procentních bodů:

Kdo je na špici (polovina roku 2026)
Pro představu o aktuálním stavu — výběr publikovaných skóre na SWE-bench Verified. Berte je jako snímek doby vzniku článku; žebříčky se mění každých pár měsíců:
| Model | SWE-bench Verified | Poznámka |
|---|---|---|
| Claude 5 (generace Mythos/Fable) | ~95 % | self-reported Anthropic, průměr z 5 běhů |
| Claude Opus 4.8 | 88,6 % | self-reported, systémová karta |
| Claude Sonnet 5 | 85,2 % | self-reported |
| GPT-5.3 Codex | 85,0 % | self-reported OpenAI |
| GPT-5.5 | 82,5 % | systémová karta |
| Gemini 3.1 Pro | 80,6 % | self-reported Google DeepMind |
| DeepSeek V4 Pro | 80,6 % | open-weights model |
| Kimi K2.6 | 80,2 % | open-weights model |
Dvě pozorování. Zaprvé, špička se namačkala do pásma 80–95 % — Verified přestává rozlišovat, přesně jako kdysi HumanEval. Zadruhé, open-weights modely (DeepSeek, Kimi, Qwen), které si můžete hostovat sami, dnes na Verified dosahují na paty komerční špičce — rozdíl se víc projeví na těžších benchmarcích typu Pro.
Vývoj nejlepšího publikovaného skóre ukazuje, jak rychle se benchmark vyčerpal:

Co ještě stojí za pozornost
Aider Polyglot: umí model editovat, ne jen psát?
Aider Polyglot (225 nejtěžších úloh z Exercism v Pythonu, JavaScriptu, Go, Rustu, C++ a Javě) měří něco, co jinde chybí: schopnost vracet korektní, aplikovatelné diffy proti skrytým testům. Právě editace existujícího kódu — ne psaní od nuly — je to, co kódící asistent dělá 90 % času. Leaderboard navíc uvádí i procento správně formátovaných editů a cenu běhu, což z něj dělá jeden z nejpraktičtějších veřejných žebříčků.
Terminal-Bench: agent v terminálu
Úlohy typu „zkompiluj projekt, oprav padající CI, nastav databázi“ vyžadují desítky kroků, práci s nástroji a zotavení z chyb. Terminal-Bench 2.0 je dnes nejcitovanější metrika pro podobně dlouhé agentní běhy — a skóre (špička kolem 70–83 %) ukazuje, že právě tady mají modely ještě velký prostor ke zlepšení.
Arény: hodnotí vývojáři, ne testy
LMArena (WebDev Arena) a Copilot Arena staví modely proti sobě v reálném použití a nechávají vývojáře hlasovat; výsledkem je Elo. Doplňují testové benchmarky o rozměr, který se automaticky měří špatně: čitelnost, styl a užitečnost výstupu.
Proč číslům nevěřit slepě
- Kontaminace — SWE-bench staví na veřejných repozitářích; opravy těch issues jsou na GitHubu, a tedy potenciálně v trénovacích datech. Proto vznikly LiveCodeBench (úlohy po uzávěrce) a SWE-bench Pro (soukromá repa, audit kontaminace).
- Harness rozhoduje — stejné váhy modelu dají podle agentního obalu (scaffold, nástroje, počet pokusů) výsledky lišící se klidně o 10–20 procentních bodů. Srovnatelná jsou jen čísla ze stejného harnessu.
- Self-reporting — většinu skóre publikují sami výrobci modelů. Nezávislé leaderboardy (Scale SEAL, vals.ai, Epoch AI) bývají střízlivější; rozdíl proti vendor slidu je běžně několik bodů.
- Goodhartův zákon — když se metrika stane cílem, přestává být dobrou metrikou. Labs optimalizují přímo na slavné benchmarky; přesně proto skóre na nových, neokoukaných sadách (SWE-bench Pro, čerstvé úlohy LiveCodeBench) padají o desítky bodů.
- Benchmark není váš workload — SWE-bench Verified je Python a opravy bugů; neříká nic o vašem C# monolitu, o frontendu ani o kvalitě architektonických rozhodnutí.
Jak s tím naložit v praxi
Veřejné benchmarky používejte jako hrubý filtr: model, který se pohybuje na špici SWE-bench Pro, Aider Polyglot i Terminal-Bench, je bezpečná první volba. Konečný verdikt ale patří vlastnímu evalu: vezměte 20–50 skutečných úloh z vaší codebase (opravené bugy, malé featury, refaktoringy), nechte je kandidáty vyřešit a vyhodnoťte úspěšnost, cenu a čas. Je to práce na pár dní a řekne vám víc než všechny leaderboardy dohromady — stejný princip vlastního měření, jaký doporučujeme u U-křivky i halucinací.
Chcete AI nástroje ve vývoji používat naplno?
V kurzu AI ve vývoji softwaru probíráme kódící asistenty, agentní nástroje i to, jak si jejich přínos změřit na vlastním projektu. A pro stavbu vlastních agentů je tu Programátor AI agentů.
Zdroje a další čtení
- Chen et al.: Evaluating Large Language Models Trained on Code (HumanEval) (2021)
- Jimenez et al.: SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (2023)
- OpenAI: Introducing SWE-bench Verified (2024)
- Scale AI: SWE-bench Pro — SEAL leaderboard
- Jain et al.: LiveCodeBench: Holistic and Contamination Free Evaluation (2024)
- Liu et al.: Is Your Code Generated by ChatGPT Really Correct? (EvalPlus) (2023)
- Aider Polyglot leaderboard
- Terminal-Bench
- swebench.com — oficiální leaderboardy rodiny SWE-bench