El Consejo

Todas las guías

Compara GPT, Claude, Qwen y Gemini con la misma pregunta

Abrir varias pestañas no compara bien los modelos de IA. Pon a GPT, Claude, Qwen y Gemini bajo las mismas reglas, con primeras respuestas selladas.

El problema de las pestañas lado a lado

La forma habitual de comparar modelos es pegar la misma pregunta en varias pestañas de chat y leer las respuestas. Algo te dice, pero menos de lo que parece. Cada respuesta es un primer borrador que nadie cuestionó. No distingues una opinión firme de una conjetura, y nunca sabes qué diría un modelo ante el mejor argumento de otro.

Las mismas reglas para todos los modelos

En El Consejo cada escaño recibe las mismas instrucciones, el mismo límite de palabras y el mismo reloj. La página redacta las instrucciones, así que no tienes que mantener cuatro mensajes sincronizados.

Una comparación justa en cinco pasos

  1. Haz una pregunta que lleve dentro una decisión. «¿Cuál de estos dos diseños construimos?» compara mejor los modelos que «háblame de estos diseños».
  2. Sienta a cada modelo una vez y sin rol. Los roles sirven para poner a prueba una idea. Para comparar los modelos, deja que cada uno hable por sí mismo.
  3. Mantén las aperturas selladas. Sin sellar, el segundo en hablar ya leyó al primero, y lo que comparas es una respuesta con una réplica.
  4. Usa una extensión fija. Un límite de palabras impide que un modelo parezca más completo solo por escribir más.
  5. Escribe tú la moción. Así todos votan sobre tus palabras, no sobre un resumen que redactó uno de ellos.

Para una comparación rápida, pon las rondas de debate en cero y desactiva las declaraciones de cierre. Te quedan las aperturas selladas, la votación final y la declaración de la presidencia. Añade rondas cuando quieras ver cómo aguantan las respuestas cuando se las cuestiona.

Cómo leer la comparación

Después de la votación, la página muestra la puntuación de cada miembro como un punto sobre una línea de 0 a 10. Puntos agrupados significan que los modelos terminaron cerca. Puntos en extremos opuestos significan que no, y la lista de abajo te dice qué sostiene cada uno.

En el acta, mira el apartado «Qué cambió». Un modelo que cambió de postura por una razón que explica te ha dicho más que uno que solo se repitió. También uno que se mantuvo y dijo exactamente por qué.

Dos advertencias. La primera la imprime la página con cada resultado.

Comparar dos modelos del mismo proveedor

Dos escaños pueden usar la misma cuenta con modelos distintos. Sienta el modelo pequeño de un proveedor y el grande, hazles la misma pregunta y verás si el grande cambia el resultado o solo el precio.

Qué modelos, y cuánto cuesta usarlos

Un escaño se conecta con una clave de API de OpenAI, Anthropic, Alibaba Model Studio (Qwen), Google AI Studio (Gemini), DeepSeek u OpenRouter, o con un modelo que corre en tu propio equipo. El uso lo cobra el proveedor, en tu propia cuenta.

Si solo tienes suscripciones de chat, sienta a los modelos a mano. La página redacta cada mensaje, tú lo pegas en ChatGPT, Claude o Qwen Chat y pegas de vuelta la respuesta. Es más lento, y funciona con cualquier modelo que tenga una caja de chat. Hay una guía para debatir a mano, sin clave de API.

Tus claves y tus sesiones se quedan en tu navegador.

Sienta a tus modelos o lee cómo funciona un debate moderado entre IA.

Abrir el consejo

Actualizada el