Los benchmarks públicos de IA se parecen a las pruebas de consumo de coches en laboratorio: no tienen nada que ver con tu conducción real. Hugging Face o LMSYS evalúan modelos con tareas genéricas, pero tú no resuelves exámenes de matemáticas, procesas facturas o redactas respuestas a clientes. Para un autónomo o una pyme, elegir un modelo basándose en esos rankings es tirar dinero. La solución es un benchmark personalizado: pruebas con tus propios datos que miden lo que de verdad importa: calidad, coste por tarea y latencia. Y si el ahorro lo justifica, puedes ir un paso más allá y ejecutar modelos open source en local para reducir la factura a cero.
En este artículo te enseño un método claro para comparar modelos con datos reales usando Optima, una herramienta gratuita, y luego evaluar si te conviene pasarte a local con CORS Chat. Sin humo, con números.
¿Por qué los benchmarks genéricos no sirven para tu negocio?
Los benchmarks públicos miden capacidades generales: razonamiento, conocimiento enciclopédico, código. Pero tu trabajo diario es específico: extraer datos de facturas, resumir correos, clasificar tickets de soporte. Un modelo puede ser un crack en exámenes y mediocre en tu flujo. Además, los rankings no consideran el coste por tarea. GPT-4 puede tener mejor precisión, pero si un modelo pequeño es 10 veces más barato con una calidad aceptable, la decisión económica es obvia.
La única forma de saber qué modelo te conviene es probarlos con tus datos. Y para eso necesitas un benchmark personalizado.
¿Cómo crear tu propio benchmark con Optima paso a paso?
Optima, de Artificial Analysis, es una plataforma que te permite subir tus propios datos, definir tu tarea y comparar docenas de modelos por calidad, coste y latencia. Es gratuita y no requiere código. El proceso es sencillo:
- Crea una cuenta en Optima (gratis).
- Sube tu conjunto de datos: un CSV o JSON con ejemplos de entrada y salida esperada. Por ejemplo, para facturas: la imagen o texto de la factura y los campos extraídos correctos.
- Define tu tarea: Optima te guía para especificar qué debe hacer el modelo (extracción, resumen, clasificación).
- Selecciona modelos: elige entre los disponibles (GPT-4, Claude, modelos open source como Llama, Mistral, Qwen, etc.).
- Ejecuta el benchmark: Optima envía tus datos a cada modelo y evalúa los resultados con métricas automáticas (exactitud, similitud) y te muestra el coste por tarea y la latencia.
En menos de una hora tienes una comparativa real de tu caso de uso. Y lo mejor: los resultados son tuyos, no de un laboratorio.
Interpretar resultados: coste por tarea, no solo calidad
Cuando veas los resultados, no te fijes solo en la precisión. El coste por tarea es el dato clave. Imagina un autónomo que procesa 1.000 facturas al mes. Con GPT-4, cada extracción cuesta 0,01 €. Con un modelo pequeño como Llama 3 8B, cuesta 0,001 €. Si la precisión del pequeño es del 95% frente al 98% del grande, el ahorro mensual es de 9 € frente a 1 € de errores (asumiendo revisión manual). La decisión es clara.
Aquí tienes un ejemplo real de comparativa (datos simulados, pero realistas):
| Modelo | Precisión | Coste por tarea | Latencia media | Coste mensual (1.000 tareas) |
|---|---|---|---|---|
| GPT-4 | 98% | 0,01 € | 2,5 s | 10 € |
| Claude 3 Haiku | 96% | 0,003 € | 1,8 s | 3 € |
| Llama 3 8B (API) | 95% | 0,001 € | 1,2 s | 1 € |
| Qwen 3.8 27B (local)Recomendado | 94% | 0 € | 4 s (depende del hardware) | 0 € |
Como ves, el coste puede variar en un factor 10 sin sacrificar demasiada calidad. Optima te da estos números para tu caso concreto, no promedios.
Alternativa local: CORS Chat para probar modelos open source
Si después del benchmark ves que un modelo open source se acerca a la calidad que necesitas, puedes ejecutarlo en tu propio ordenador y eliminar los costes de API. Aquí entra CORS Chat, una herramienta creada por Simon Willison que facilita probar modelos locales desde el navegador. Combinada con LM Studio (una aplicación para descargar y ejecutar modelos open source), puedes tener un chat privado y sin coste por uso.
Los requisitos técnicos mínimos son accesibles: 8 GB de RAM y una GPU opcional (aunque con CPU funcionará, más lento). Modelos como Qwen 3.8 27B (cuantizado) corren bien en un portátil moderno. Eso sí, hay límites: la velocidad es menor que una API (puedes esperar 4-10 segundos por tarea), y la configuración requiere algo de paciencia. Pero para tareas no críticas en tiempo real, el ahorro es total.
¿Cuándo merece la pena API vs local?
La decisión depende de tres factores: volumen, latencia y presupuesto.
- API (OpenAI, Anthropic, etc.): ideal si necesitas baja latencia, no quieres gestionar infraestructura y tu volumen es bajo o medio. El coste por tarea es pequeño, pero suma.
- Local (LM Studio + CORS Chat): ideal si tu volumen es alto (miles de tareas al mes), manejas datos sensibles que no quieres enviar a terceros, o quieres coste marginal cero. El precio es tu tiempo de configuración y hardware.
Un híbrido funciona bien: usa API para tareas urgentes y local para procesamiento por lotes nocturno. Con Optima puedes estimar el umbral de volumen donde local se amortiza.
Preguntas frecuentes
¿Es difícil configurar un modelo local?
No con LM Studio: descargas el modelo, lo cargas y ya tienes un servidor local compatible con OpenAI. CORS Chat solo añade una capa para probarlo desde el navegador sin problemas de CORS. En 30 minutos puedes estar funcionando.
¿Puedo usar Optima si no sé programar?
Sí, Optima está diseñada para usuarios no técnicos. Subes un CSV, defines la tarea con lenguaje natural y la plataforma se encarga del resto.
¿Qué modelos open source son buenos para empezar?
Para tareas de extracción y resumen, Qwen 3.8 27B y Llama 3 8B son excelentes opciones. En Optima puedes probarlos antes de descargarlos.
Conclusión: tu benchmark, tu decisión
No elijas un modelo de IA por lo que dice un ranking. Crea tu propio benchmark con Optima, mira el coste por tarea y decide con números. Si el volumen lo justifica, da el salto a local con CORS Chat y LM Studio. El ahorro puede ser de cientos de euros al año. Y lo mejor: el método es gratis y te lleva una tarde. Empieza hoy con tus datos reales.


