BlogAI ve vývoji
Umělá inteligenceProgramováníTestování

Benchmarky pro kódící asistenty: co vlastně měří SWE-bench a spol.

21. 4. 2026 · cca 17 minut čtení

Každé oznámení nového modelu dnes doprovází lavina procent: „88,6 % na SWE-bench Verified“, „82,7 % na Terminal-Bench“. Jenže co ta čísla doopravdy znamenají? Proč tentýž model dostane na jedné variantě benchmarku o 25 procentních bodů méně než na druhé? A proč je 99 % na HumanEval dnes spíš důvod k nedůvěře než k nadšení? Provedeme vás světem benchmarků pro LLM ve vývoji softwaru — od jednořádkových funkcí po opravy skutečných GitHub issues — a hlavně vás naučíme jejich čísla správně číst.

Programátor píšící kód na notebooku

Foto: Lukas, Pexels

Jak číst celé téma

Benchmark není jen číslo, ale scénář. Nejdřív se ptejte, jakou práci simuluje, potom jaký používá harness a až nakonec porovnávejte procenta na leaderboardu.

Tři generace benchmarků

Benchmarky pro kód se dají srovnat podle toho, jak velký kus reálné vývojářské práce simulují. Historicky se vyvíjely od nejmenšího k největšímu — a přesně v tom pořadí je modely postupně „přerůstaly“.

1. generace: funkce z docstringu

HumanEval (OpenAI, 2021) definoval žánr: 164 ručně psaných Python úloh, kde model dostane hlavičku funkce s docstringem a má doplnit tělo tak, aby prošly jednotkové testy. Podobně stavěný MBPP (Google, 2021) přidal ~1 000 jednodušších úloh. V roce 2021 na HumanEval nejlepší model (Codex) řešil ~29 % úloh, GPT-4 v roce 2023 ~67 % — dnes frontier modely překračují 95–99 % a benchmark je saturovaný: nerozliší dobrý model od výborného. Projekt EvalPlus navíc ukázal, že když se k úlohám dogenerují důkladnější testy (HumanEval+), skóre většiny modelů znatelně spadne — část „úspěchů“ byla jen povrchní shoda s chudými testy.

2. generace: soutěžní úlohy odolné kontaminaci

LiveCodeBench (2024) zaútočil na největší slabinu první generace: kontaminaci trénovacích dat. Úlohy sbírá průběžně z programátorských soutěží (LeetCode, AtCoder, Codeforces) a u každé eviduje datum zveřejnění — model se pak hodnotí jen na úlohách vydaných po jeho datu uzávěrky dat. Nemohl je tedy vidět v tréninku. Varianta LiveCodeBench Pro hodnotí modely Elo ratingem proti obtížnosti úloh jako šachisty.

3. generace: skutečné repozitáře a agentní práce

SWE-bench (Princeton, 2023) změnil měřítko: místo izolované funkce dostane model skutečné GitHub issue a celý repozitář (Django, scikit-learn, sympy…). Musí problém najít, opravit a projít testy projektu — bez agentní smyčky s nástroji (viz náš článek o agentech) to nejde. Na stejné myšlence staví Terminal-Bench (2025), který měří dlouhé úlohy v terminálu: nakonfiguruj server, oprav build, zprovozni pipeline. Tady se dnes odehrává skutečné porovnávání modelů.

Benchmark Rok Co měří Metrika Stav v 2026
HumanEval / MBPP 2021 doplnění funkce podle docstringu (Python) pass@1 saturovaný, historická reference
LiveCodeBench 2024 soutěžní úlohy zveřejněné po uzávěrce dat pass@1 / Elo respektovaná kontrola kontaminace
SWE-bench Verified 2024 oprava reálných GitHub issues (Python repa) % vyřešených issues zlatý standard, blíží se saturaci
SWE-bench Pro 2025 těžší issues, kontrola kontaminace, komerční repa % vyřešených issues nástupce Verified, daleko od saturace
Aider Polyglot 2024 editace kódu v 6 jazycích, správný formát diffů % úloh se skrytými testy respektovaný komunitní standard
Terminal-Bench 2.0 2025 dlouhé úlohy v shellu, práce s nástroji, recovery % dokončených úloh nastupující standard pro agenty

Jak číst metriky

  • pass@k — pravděpodobnost, že alespoň jedno z k vygenerovaných řešení projde testy. Nejčastěji se reportuje pass@1 (první pokus). Pozor: pass@5 vypadá vždycky lépe; při srovnávání musí být k stejné.
  • Resolve rate — podíl vyřešených issues na SWE-bench. „Vyřešeno“ znamená, že patch projde testy napsanými pro skutečnou opravu (fail-to-pass testy) a nerozbije zbytek test suite.
  • Elo — relativní síla z párových soubojů. Používají ho arény, kde hlasují vývojáři (Copilot Arena, WebDev Arena), a LiveCodeBench Pro. Výhoda: neustále čerstvé úlohy a lidský soud; nevýhoda: měří i „líbivost“, ne jen správnost.
  • Cena a počet kroků — u agentních benchmarků se stále častěji uvádí i cena běhu. Model s o 2 body vyšším skóre za trojnásobnou cenu není automaticky lepší volba.

Rodina SWE-bench: prestiž i zmatek

Když se dnes řekne „benchmark na kódování“, myslí se většinou SWE-bench — žádné jiné číslo se v oznámeních modelů necituje tak často. Jenže SWE-bench není jeden benchmark, je to rodina, a záměna variant je nejčastější způsob, jak se čtenář nechá zmást:

  • SWE-bench (původní, 2023) — 2 294 issues z 12 populárních Python repozitářů. Ukázalo se ale, že část úloh je špatně zadaná nebo má nespolehlivé testy.
  • SWE-bench Verified (2024) — OpenAI nechala všech 2 294 úloh projít lidskou anotací a vybrala 500 čistých: řešitelných ze zadání, se spolehlivými testy. Právě tohle je dnes citovaný standard.
  • SWE-bench Pro (2025, Scale AI) — reakce na blížící se saturaci Verified: těžší, vícesouborové úlohy, část z komerčních (veřejně nedostupných) repozitářů, aktivní kontrola kontaminace.
  • Multimodal, Multilingual, Live — varianty s obrázky v zadání (screenshoty bugů), dalšími jazyky mimo Python a průběžně přidávanými čerstvými issues.

Jak moc na variantě záleží, ukazuje srovnání stejných modelů na Verified a Pro — rozdíl je konzistentně kolem 25 procentních bodů:

Srovnání skóre modelů na SWE-bench Verified a SWE-bench Pro
Srovnání skóre modelů na SWE-bench Verified a SWE-bench Pro
Stěžejní poučka celého tématu: číslo bez uvedení varianty a harnessu nic neznamená.

Kdo je na špici (polovina roku 2026)

Pro představu o aktuálním stavu — výběr publikovaných skóre na SWE-bench Verified. Berte je jako snímek doby vzniku článku; žebříčky se mění každých pár měsíců:

Model SWE-bench Verified Poznámka
Claude 5 (generace Mythos/Fable) ~95 % self-reported Anthropic, průměr z 5 běhů
Claude Opus 4.8 88,6 % self-reported, systémová karta
Claude Sonnet 5 85,2 % self-reported
GPT-5.3 Codex 85,0 % self-reported OpenAI
GPT-5.5 82,5 % systémová karta
Gemini 3.1 Pro 80,6 % self-reported Google DeepMind
DeepSeek V4 Pro 80,6 % open-weights model
Kimi K2.6 80,2 % open-weights model

Dvě pozorování. Zaprvé, špička se namačkala do pásma 80–95 % — Verified přestává rozlišovat, přesně jako kdysi HumanEval. Zadruhé, open-weights modely (DeepSeek, Kimi, Qwen), které si můžete hostovat sami, dnes na Verified dosahují na paty komerční špičce — rozdíl se víc projeví na těžších benchmarcích typu Pro.

Vývoj nejlepšího publikovaného skóre ukazuje, jak rychle se benchmark vyčerpal:

Vývoj nejlepšího skóre na SWE-bench Verified v čase
Vývoj nejlepšího skóre na SWE-bench Verified v čase
Životní cyklus benchmarku v praxi: od zveřejnění k saturaci za zhruba dva roky. Proto vznikl SWE-bench Pro.

Co ještě stojí za pozornost

Aider Polyglot: umí model editovat, ne jen psát?

Aider Polyglot (225 nejtěžších úloh z Exercism v Pythonu, JavaScriptu, Go, Rustu, C++ a Javě) měří něco, co jinde chybí: schopnost vracet korektní, aplikovatelné diffy proti skrytým testům. Právě editace existujícího kódu — ne psaní od nuly — je to, co kódící asistent dělá 90 % času. Leaderboard navíc uvádí i procento správně formátovaných editů a cenu běhu, což z něj dělá jeden z nejpraktičtějších veřejných žebříčků.

Terminal-Bench: agent v terminálu

Úlohy typu „zkompiluj projekt, oprav padající CI, nastav databázi“ vyžadují desítky kroků, práci s nástroji a zotavení z chyb. Terminal-Bench 2.0 je dnes nejcitovanější metrika pro podobně dlouhé agentní běhy — a skóre (špička kolem 70–83 %) ukazuje, že právě tady mají modely ještě velký prostor ke zlepšení.

Arény: hodnotí vývojáři, ne testy

LMArena (WebDev Arena) a Copilot Arena staví modely proti sobě v reálném použití a nechávají vývojáře hlasovat; výsledkem je Elo. Doplňují testové benchmarky o rozměr, který se automaticky měří špatně: čitelnost, styl a užitečnost výstupu.

Dvě vývojářky diskutující nad kódem

Poslední benchmark je vždycky code review. Foto: Christina Morillo, Pexels

Proč číslům nevěřit slepě

  • Kontaminace — SWE-bench staví na veřejných repozitářích; opravy těch issues jsou na GitHubu, a tedy potenciálně v trénovacích datech. Proto vznikly LiveCodeBench (úlohy po uzávěrce) a SWE-bench Pro (soukromá repa, audit kontaminace).
  • Harness rozhoduje — stejné váhy modelu dají podle agentního obalu (scaffold, nástroje, počet pokusů) výsledky lišící se klidně o 10–20 procentních bodů. Srovnatelná jsou jen čísla ze stejného harnessu.
  • Self-reporting — většinu skóre publikují sami výrobci modelů. Nezávislé leaderboardy (Scale SEAL, vals.ai, Epoch AI) bývají střízlivější; rozdíl proti vendor slidu je běžně několik bodů.
  • Goodhartův zákon — když se metrika stane cílem, přestává být dobrou metrikou. Labs optimalizují přímo na slavné benchmarky; přesně proto skóre na nových, neokoukaných sadách (SWE-bench Pro, čerstvé úlohy LiveCodeBench) padají o desítky bodů.
  • Benchmark není váš workload — SWE-bench Verified je Python a opravy bugů; neříká nic o vašem C# monolitu, o frontendu ani o kvalitě architektonických rozhodnutí.

Jak s tím naložit v praxi

Veřejné benchmarky používejte jako hrubý filtr: model, který se pohybuje na špici SWE-bench Pro, Aider Polyglot i Terminal-Bench, je bezpečná první volba. Konečný verdikt ale patří vlastnímu evalu: vezměte 20–50 skutečných úloh z vaší codebase (opravené bugy, malé featury, refaktoringy), nechte je kandidáty vyřešit a vyhodnoťte úspěšnost, cenu a čas. Je to práce na pár dní a řekne vám víc než všechny leaderboardy dohromady — stejný princip vlastního měření, jaký doporučujeme u U-křivky i halucinací.

Chcete AI nástroje ve vývoji používat naplno?

V kurzu AI ve vývoji softwaru probíráme kódící asistenty, agentní nástroje i to, jak si jejich přínos změřit na vlastním projektu. A pro stavbu vlastních agentů je tu Programátor AI agentů.

← Zpět na blog