Lokale LLM- & Agent-Benchmarks — gemessen, nicht behauptet.
Modelle bauen gegeneinander dieselbe Aufgabe — aufgezeichnet, mit Zeit, Tokens und Kosten.
Keine Inference-Runs im aktuellen Filter.
| Model | Quant | Harness | Hardware | Family | Suite | Agent | Kern-Metrik | Report |
|---|---|---|---|---|---|---|---|---|
| Lade catalog.json… | ||||||||