1 · Mismas pruebas para todos
Hay 7 suites (escritura, código, frontend, agentic, reasoning, instruction, roleplay) con ~30 tests entre todas. Cada prueba lleva su prompt y su rúbrica de evaluación. Cualquier modelo nuevo se enfrenta al mismo set.
Lab · Local LLM Arena
Mismas pruebas, mismos prompts, juez local. Cada modelo de Ollama pasa por 7 categorías (escritura, código, frontend, agente, razonamiento, instrucciones, roleplay) y se puntúa de 1 a 10. Resultados reproducibles, sin nube.
Es un GMK (local) fanless con SoC AMD Strix Halo: CPU e iGPU comparten un pool de 128 GB de memoria unificada (96 GB reservados para la iGPU). Eso permite cargar modelos de 30 B+ en cuantización Q4 enteramente en VRAM, sin partir entre RAM y GPU. Todos los modelos del ranking corren en exactamente esta misma máquina.
Hay 7 suites (escritura, código, frontend, agentic, reasoning, instruction, roleplay) con ~30 tests entre todas. Cada prueba lleva su prompt y su rúbrica de evaluación. Cualquier modelo nuevo se enfrenta al mismo set.
Lo que se puede verificar a máquina (sintaxis Python, JSON parseable, HTML válido, contiene función X) se ejecuta como chequeo automático. El resto lo puntúa otro modelo local que actúa de juez con la rúbrica delante.
Modelos en Ollama. Juez en Ollama. Sin APIs cloud. Cada ejecución guarda el prompt exacto, la respuesta del modelo, los tokens/s y el veredicto del juez. Re-ejecutable.
Un solo comando lo enfrenta a toda la suite y publica los resultados aquí. Los modelos antiguos siguen comparables.