Compara GPT, Claude, Qwen y Gemini con la misma pregunta
Abrir varias pestañas no compara bien los modelos de IA. Pon a GPT, Claude, Qwen y Gemini bajo las mismas reglas, con primeras respuestas selladas.
El problema de las pestañas lado a lado
La forma habitual de comparar modelos es pegar la misma pregunta en varias pestañas de chat y leer las respuestas. Algo te dice, pero menos de lo que parece. Cada respuesta es un primer borrador que nadie cuestionó. No distingues una opinión firme de una conjetura, y nunca sabes qué diría un modelo ante el mejor argumento de otro.
Las mismas reglas para todos los modelos
En El Consejo cada escaño recibe las mismas instrucciones, el mismo límite de palabras y el mismo reloj. La página redacta las instrucciones, así que no tienes que mantener cuatro mensajes sincronizados.
- Las aperturas selladas te dan la primera respuesta independiente de cada modelo. Ningún miembro ve la apertura de otro antes de escribir la suya.
- Las rondas de debate muestran cómo maneja cada modelo el desacuerdo: qué concede, qué defiende y si su argumento mejora o solo se alarga.
- La votación final deja a cada miembro por escrito: un lado, una puntuación de 0 a 10 y su postura en una frase.
Una comparación justa en cinco pasos
- Haz una pregunta que lleve dentro una decisión. «¿Cuál de estos dos diseños construimos?» compara mejor los modelos que «háblame de estos diseños».
- Sienta a cada modelo una vez y sin rol. Los roles sirven para poner a prueba una idea. Para comparar los modelos, deja que cada uno hable por sí mismo.
- Mantén las aperturas selladas. Sin sellar, el segundo en hablar ya leyó al primero, y lo que comparas es una respuesta con una réplica.
- Usa una extensión fija. Un límite de palabras impide que un modelo parezca más completo solo por escribir más.
- Escribe tú la moción. Así todos votan sobre tus palabras, no sobre un resumen que redactó uno de ellos.
Para una comparación rápida, pon las rondas de debate en cero y desactiva las declaraciones de cierre. Te quedan las aperturas selladas, la votación final y la declaración de la presidencia. Añade rondas cuando quieras ver cómo aguantan las respuestas cuando se las cuestiona.
Cómo leer la comparación
Después de la votación, la página muestra la puntuación de cada miembro como un punto sobre una línea de 0 a 10. Puntos agrupados significan que los modelos terminaron cerca. Puntos en extremos opuestos significan que no, y la lista de abajo te dice qué sostiene cada uno.
En el acta, mira el apartado «Qué cambió». Un modelo que cambió de postura por una razón que explica te ha dicho más que uno que solo se repitió. También uno que se mantuvo y dijo exactamente por qué.
Dos advertencias. La primera la imprime la página con cada resultado.
- El acuerdo no es una prueba. Modelos entrenados con textos parecidos pueden compartir el mismo punto ciego.
- Un modelo puede equivocarse con toda seguridad. El debate te muestra el razonamiento. Comprobar los hechos sigue siendo cosa tuya.
Comparar dos modelos del mismo proveedor
Dos escaños pueden usar la misma cuenta con modelos distintos. Sienta el modelo pequeño de un proveedor y el grande, hazles la misma pregunta y verás si el grande cambia el resultado o solo el precio.
Qué modelos, y cuánto cuesta usarlos
Un escaño se conecta con una clave de API de OpenAI, Anthropic, Alibaba Model Studio (Qwen), Google AI Studio (Gemini), DeepSeek u OpenRouter, o con un modelo que corre en tu propio equipo. El uso lo cobra el proveedor, en tu propia cuenta.
Si solo tienes suscripciones de chat, sienta a los modelos a mano. La página redacta cada mensaje, tú lo pegas en ChatGPT, Claude o Qwen Chat y pegas de vuelta la respuesta. Es más lento, y funciona con cualquier modelo que tenga una caja de chat. Hay una guía para debatir a mano, sin clave de API.
Tus claves y tus sesiones se quedan en tu navegador.
Sienta a tus modelos o lee cómo funciona un debate moderado entre IA.
Más guías
- Cómo hacer que varios modelos de IA debatan entre sí
- Cómo saber si los modelos de IA de verdad están de acuerdo
- Cómo pedir una segunda opinión sobre una respuesta de IA
- Haz que ChatGPT y Claude debatan sin clave de API
- Dale a cada IA un rol a partir de un libro o un informe
- Un consejo de LLM que funciona en tu navegador
Actualizada el