Gemini 3.7 Flash vs GPT-5.6 Sol vs Claude Fable 5: no esperaba este resultado

Quería hacer una comparación práctica entre tres de los modelos que más uso y que más me gustan: Gemini 3.7 Flash, GPT-5.6 Sol y Claude Fable 5. No un benchmark científico, no una tabla llena de números aislados, sino una prueba real de esas que importan cuando uno quiere crear una app con inteligencia artificial.

El reto fue simple de explicar, aunque no tan simple de construir: crear una simulación 3D interactiva de la Tierra usando Three.js, permitir rotarla libremente y mostrar la posición de la Estación Espacial Internacional, la ISS, en tiempo real mediante una API.

La gracia estaba en usar exactamente la misma idea para todos y dejar el prompt bastante abierto. Así podía ver no solamente si la aplicación funcionaba, sino también cómo interpretaba cada modelo la tarea, qué decisiones tomaba por iniciativa propia, qué tan pulido era el resultado y cuánta creatividad añadía sin que se lo pidiera.

Tabla de contenidos

🌍 El reto: una Tierra 3D con la ISS en tiempo real

El prompt pedía una aplicación interactiva hecha con Three.js, una librería muy útil para crear experiencias 3D en la web. La Tierra debía poder rotarse, tener un aspecto visual atractivo y mostrar la ubicación actual de la Estación Espacial Internacional.

Para conseguir la posición de la ISS, bastaba con hacer una llamada a una API. Esa respuesta entrega datos como la latitud, la longitud, la velocidad y otros parámetros relacionados con la estación. Es información suficiente para transformar coordenadas geográficas en una ubicación visible sobre una esfera 3D.

El desafío, entonces, no era solo dibujar un planeta. Cada modelo tenía que resolver varias cosas al mismo tiempo:

  • Construir una escena 3D funcional con Three.js.
  • Representar la Tierra y permitir interacción con zoom y rotación.
  • Consultar una API externa con datos actualizados de la ISS.
  • Convertir latitud y longitud en una posición coherente sobre el globo.
  • Actualizar la posición de la estación periódicamente.
  • Diseñar una interfaz que permitiera entender la información sin perderse.

Esto hace que sea una prueba interesante para el vibe coding. Una petición relativamente corta puede obligar a un modelo a mezclar frontend, visualización 3D, datos externos, lógica matemática, interacción y diseño de producto. Ahí es donde empiezan a aparecer diferencias reales.

🧪 Qué evalué y por qué no medí solo velocidad

Gemini 3.7 Flash es claramente rápido. De hecho, ese factor puede hacer que la comparación parezca un poco injusta, porque la velocidad depende tanto del modelo como de la plataforma desde la cual se ejecuta. Pero la velocidad no era la única variable importante aquí.

Lo que más me interesaba evaluar era la calidad final de una app creada a partir de una indicación amplia. Para eso me fijé especialmente en cinco puntos:

  1. Cumplimiento del prompt: que la Tierra fuera 3D, rotatoria, interactiva y conectada con datos de la ISS.
  2. Funcionamiento en vivo: que la posición de la estación se actualizara correctamente a partir de la API.
  3. Calidad visual: iluminación, textura de la Tierra, nubes, trayectorias, elementos orbitales y claridad del marcador de la ISS.
  4. Experiencia de uso: controles útiles, telemetría legible, zoom, seguimiento y modo de pantalla completa.
  5. Creatividad: extras útiles agregados sin que fueran pedidos literalmente.

Después de generar la primera versión, añadí una mejora igual para todos: un modo que iluminara toda la Tierra independientemente de la posición del Sol. Es útil porque, cuando una parte del planeta está de noche, se puede perder mucha información visual. Si la meta es inspeccionar continentes y posición orbital, poder iluminar el globo completo es un detalle bastante importante.

Este segundo pedido también sirvió para evaluar cómo cada modelo entendía una modificación puntual sobre una aplicación que ya existía.

⚙️ La plataforma también influye

Para simplificar el proceso, las pruebas se realizaron en Emergent, una plataforma que suele tener disponibles modelos de frontera apenas aparecen. Es cómoda para comparar alternativas en un mismo lugar, sin tener que cambiar de entorno a cada momento.

Ahora bien, si ya sabes que trabajarás principalmente con un modelo específico, probablemente tiene más sentido utilizar su propio entorno. Para GPT-5.6 Sol, la opción natural sería ChatGPT Codex. Para Claude, Claude Code. Y para Gemini, su entorno correspondiente, como Anti Gravity.

El harness importa. Puede afectar la rapidez, el acceso a herramientas, la forma de ejecutar cambios, la previsualización y hasta el flujo con el que se construye una app. Por eso esta comparación debe entenderse como lo que es: una prueba práctica de resultados, no una verdad definitiva sobre la capacidad absoluta de cada modelo.

Si buscas una base más guiada para convertir ideas en productos, también puedes encontrar prompts profesionales para crear tu app. Un buen prompt no reemplaza la capacidad del modelo, pero sí ayuda muchísimo a obtener una primera versión más sólida.

⚡ Gemini 3.7 Flash: creatividad y una sorpresa muy agradable

Gemini 3.7 Flash fue el modelo nuevo de la prueba y, sinceramente, desde que apareció lo he usado bastante. No lo ponía necesariamente como favorito frente a los otros dos, pero el resultado fue muy bueno.

La aplicación generada por Gemini incluyó un globo terrestre 3D con una interfaz bastante completa. La ISS aparecía sobre el planeta y los datos se actualizaban aproximadamente cada tres segundos. Además, se podía activar un modo de seguimiento para que la cámara acompañara a la estación mientras avanzaba por su recorrido.

Lo interesante fue que Gemini no se limitó a mostrar la ubicación. Añadió información adicional que no había sido solicitada de forma explícita, incluyendo datos de la tripulación de la estación, nacionalidades de astronautas y tiempo que llevan en órbita.

Ese tipo de iniciativa es muy valiosa cuando estás creando productos. No se trata de agregar cosas porque sí, sino de detectar qué información puede mejorar la experiencia. En este caso, convertir una simple posición sobre el mapa en una pequeña experiencia de exploración espacial hizo que la app se sintiera mucho más completa.

Gemini también agregó un mapa 2D en proyección terrestre. Fue el único de los tres modelos principales que incluyó algo así. Puede que la forma de los continentes no fuera milimétricamente precisa, pero como complemento resultó útil: permite ubicar rápidamente la ISS en un plano mientras el globo 3D permanece como visual principal.

La solución de iluminación global también fue clara. Al activarla, la Tierra podía verse completamente iluminada, facilitando la lectura de los continentes incluso cuando la iluminación natural de la escena dejaba gran parte del planeta en oscuridad.

Gemini entregó una app con mucha información, una buena representación de la estación y varios detalles creativos. Para un modelo que no se supone que compite directamente con los modelos más grandes de frontera, fue una sorpresa bastante positiva.

Lo que más destacó de Gemini

  • Actualización de datos de la ISS aproximadamente cada tres segundos.
  • Modo de seguimiento de la estación.
  • Información adicional sobre la tripulación.
  • Mapa 2D adicional para ubicar rápidamente la posición.
  • Una representación visual de la ISS más atractiva que la de GPT-5.6 Sol.
  • Buena iniciativa para extender el producto más allá de lo pedido.

✨ Claude Fable 5: el resultado más pulido

Claude Fable 5 generó una propuesta muy fuerte. La Tierra se veía especialmente pulida y realista, con una presentación visual que daba la sensación de ser una aplicación más terminada.

La interacción también estaba bien resuelta: se podía manipular el planeta, acercarse con zoom, explorar zonas específicas y activar el seguimiento de la ISS. La telemetría se mantenía visible y mostraba datos como la actualización, la velocidad orbital y otros parámetros de la estación.

Claude incorporó un botón para resolver el tema de las áreas oscuras del planeta. Eso era justo lo que buscaba con la segunda iteración: conservar la estética de iluminación realista, pero tener la opción de inspeccionar el globo completo cuando fuera necesario.

También agregó nubes que podían ocultarse. Es un detalle pequeño, pero bueno. A veces las nubes hacen que la Tierra se vea mucho mejor; otras veces pueden tapar zonas que necesitas observar. Dar ese control es una decisión de interfaz inteligente.

Al comparar los resultados, la sensación general fue que Claude logró el mejor balance entre funcionalidad, realismo y refinamiento. La app se veía más cuidada. No era solo una demo que cumplía técnicamente, sino un resultado que parecía bastante cercano a una experiencia lista para seguir puliendo.

La estación representada por Claude no era perfecta, pero estaba mejor integrada visualmente que la de GPT-5.6 Sol. El resultado general, especialmente en el planeta, la trayectoria y la sensación de profundidad, fue el que más me gustó.

Lo que más destacó de Claude

  • La apariencia visual más pulida de los tres resultados principales.
  • Un planeta con sensación más realista.
  • Controles de zoom, rotación y seguimiento.
  • Telemetría visible de forma constante.
  • Trayectoria orbital y opción para ocultar nubes.
  • Una solución funcional al problema de las zonas oscuras.

🎯 GPT-5.6 Sol: sólido, minimalista y un poco menos convincente

Uso GPT-5.6 Sol todos los días con Codex, así que entré a esta parte esperando bastante. El modelo consiguió una aplicación funcional, visualmente correcta y con detalles como iluminación realista, trayectoria y nubes que rotaban. En ningún caso fue un mal resultado.

Pero, comparado con Gemini y Claude, su propuesta se sintió más minimalista. Incluía menos información en pantalla y tenía una representación de la ISS que fue, para mí, el punto más débil: visualmente parecía casi un rectángulo. Funciona, sí. Pero no quedaba particularmente bonita.

La iluminación del planeta estaba bien lograda y las nubes rotando aportaban bastante a la sensación de movimiento. La aplicación no se veía mal, para nada. Simplemente, al ponerla lado a lado con las otras, daba una impresión más simple y menos completa.

Eso es importante porque una app puede cumplir todos los requisitos funcionales y, aun así, no ser la alternativa que más convence a nivel de producto. La diferencia entre “funciona” y “me encanta usarlo” suele estar en detalles como la jerarquía visual, la representación de objetos, los controles disponibles y la información extra que aparece cuando hace falta.

GPT-5.6 Sol quedó bastante parejo con los otros, pero no fue el que más me gustó para este caso concreto. Esto no significa que sea peor modelo en términos generales. Significa que, para esta tarea puntual, la propuesta final no tuvo el mismo nivel de creatividad y pulido que las otras dos.

🏆 Mi orden final entre los tres modelos principales

Después de revisar el resultado funcional, la estética, la telemetría, los controles y los extras agregados, mi orden para esta prueba fue el siguiente:

  1. Claude Fable 5
  2. Gemini 3.7 Flash
  3. GPT-5.6 Sol

Claude Fable 5 se llevó el primer lugar porque fue el resultado más pulido y el que más se sintió como una experiencia terminada. Gemini 3.7 Flash quedó muy cerca, sorprendiendo con extras creativos como el mapa 2D, la información de tripulación y una representación de la ISS particularmente buena. GPT-5.6 Sol cumplió correctamente, pero su enfoque más minimalista y su estación menos atractiva lo dejaron tercero.

Lo importante es que los tres lograron crear una versión funcional. Todos construyeron una Tierra 3D, usaron datos actualizados, ubicaron la ISS y respondieron al ajuste de iluminación global. Las diferencias no fueron gigantescas. De hecho, estuvieron bastante parejos.

💡 El gran aprendizaje: no siempre necesitas el modelo de frontera

Como bonus, también probé Kimi K3 y Qwen 3.8 Max. La idea era comprobar qué podía pasar con modelos que quizá están un poco más atrás en la conversación habitual sobre modelos de frontera.

Qwen 3.8 Max entregó una versión mucho más sencilla. Incluso lo hizo en un archivo HTML bastante largo, pero lo esencial estaba: una Tierra, una estación y una ubicación actualizada en vivo. No llegó a la parte del modo de iluminación global, pero cumplió con el núcleo del reto.

Kimi K3 también fue capaz de generar una solución funcional. Esto demuestra algo que me parece importante: muchos modelos actuales están bastante capacitados para construir este tipo de experiencias.

Por supuesto, los resultados pueden variar en diseño, autonomía, calidad visual y detalles técnicos. Pero si tu proyecto no necesita necesariamente la máxima capacidad disponible, vale la pena pensar en el precio y en la relación costo beneficio.

No tienes que usar siempre el modelo más caro o el supuesto ganador absoluto. Para muchas tareas, un modelo más económico puede ser suficiente. Lo que importa es entender qué nivel de calidad necesitas, cuántas iteraciones tendrás que hacer y qué tan importante es el acabado de la primera versión.

🛠️ Cómo usar esta comparación para crear mejores apps con IA

Esta prueba deja varias lecciones prácticas para cualquiera que esté creando aplicaciones con inteligencia artificial.

1. Un prompt amplio sirve para medir iniciativa

Cuando das instrucciones demasiado específicas, el modelo tiene menos espacio para mostrar criterio propio. En cambio, una petición amplia puede revelar qué tan bien entiende el objetivo del producto y qué mejoras propone sin que tengas que detallarlas una por una.

Gemini, por ejemplo, añadió el mapa 2D y datos de tripulación. No eran requisitos explícitos, pero tenían sentido dentro de una app de seguimiento de la ISS.

2. La primera versión no tiene que ser la final

La petición de iluminar toda la Tierra llegó después de la primera generación. Ese es un flujo muy realista: construyes una base, detectas una limitación y pides cambios concretos.

La calidad de un modelo también se nota en cómo modifica lo que ya creó. No basta con generar una buena demo inicial. Debe poder mejorar la app sin romper su funcionamiento.

3. La estética y la experiencia importan tanto como la lógica

Todos lograron conectar la API y mover la estación. Sin embargo, el resultado no se sintió igual en los tres casos. La calidad de las nubes, la luz, el marcador de la ISS, la telemetría y los controles cambian mucho la percepción de una aplicación.

Cuando creas una web, un dashboard o una herramienta interna, no te quedes solamente con “funciona”. Pregunta también:

  • ¿La información importante se entiende rápido?
  • ¿Los controles realmente ayudan?
  • ¿El diseño tiene coherencia?
  • ¿Hay detalles que mejoren la exploración?
  • ¿La app entrega algo útil más allá del mínimo pedido?

4. El entorno de desarrollo debe ajustarse a tu flujo

Una plataforma como Emergent es muy útil si quieres probar varios modelos rápidamente. Pero si ya encontraste el modelo que encaja con tu forma de trabajar, su entorno nativo puede darte una experiencia más directa.

Lo mejor no es necesariamente usar una sola herramienta para todo. Lo mejor es elegir el modelo y el harness que te permitan llegar al resultado que necesitas con menos fricción.

🚀 Recursos para pasar de la idea a una app real

Crear una simulación como esta sirve para aprender, pero también demuestra lo lejos que puede llegar una idea bien planteada. Con la combinación adecuada de modelo, prompt y plataforma, puedes prototipar dashboards, experiencias interactivas, webs, herramientas internas y productos completos.

🧭 Una prueba práctica, no un veredicto absoluto

El resultado de esta comparación fue claro para mí: Claude Fable 5 entregó el acabado más pulido, Gemini 3.7 Flash fue una sorpresa enorme por su creatividad y GPT-5.6 Sol cumplió muy bien, aunque en este reto quedó un poco más atrás a nivel de propuesta final.

Pero no hay que convertir esto en una guerra de modelos. El mismo modelo puede rendir diferente según el tipo de tarea, la plataforma, el prompt, el acceso a herramientas y la cantidad de iteraciones. Además, Kimi K3 y Qwen 3.8 Max dejaron claro que hay alternativas capaces de resolver bastante bien tareas que hace poco parecían mucho más complejas.

La conclusión más útil es sencilla: prueba, compara y decide según el tipo de producto que estás construyendo. Si una herramienta te permite convertir una idea amplia en una aplicación funcional con visualización 3D, datos en vivo y controles interactivos, ya tienes muchísimo terreno avanzado.

Para esta simulación de la Tierra y la ISS, Claude Fable 5 fue mi favorito. Pero Gemini 3.7 Flash estuvo peligrosamente cerca.

Aviso: este artículo puede incluir enlaces promocionales. Si realizas una compra, puedo recibir una comisión sin costo adicional para ti.

Hazte más capaz con IA

Ideas, herramientas y aprendizajes prácticos para crear, automatizar y detectar nuevas oportunidades.

Al suscribirte, aceptas recibir mis emails. Puedes darte de baja cuando quieras.