Pedirle a Gemini “no inventes datos” no cambia una sola línea de su entrenamiento.
Lo que sí cambia el resultado es un prompt para que la IA no invente datos que la obligue a mostrar de dónde sacó cada afirmación, con fuente y cita, antes de que la aceptes.
Esa es toda la diferencia: confiar en una promesa versus exigir evidencia. Y la investigación técnica más reciente explica exactamente por qué la promesa no funciona.
Por qué pedirle a la IA que no invente no cambia nada en el modelo
En septiembre de 2025, OpenAI publicó junto con Georgia Tech la explicación técnica más clara que existe sobre el tema.
Su hallazgo: los modelos alucinan porque los exámenes con los que se les evalúa premian adivinar por encima de admitir incertidumbre.
En un ejemplo del propio paper, un modelo más “certero” en apariencia tuvo solo 1% de abstenciones — pero 75% de tasa de error.
Otro, entrenado para dudar más, se abstuvo el 52% de las veces y erró solo 26%. El más confiado no era el más preciso.
Era el más peligroso disfrazado de seguro — como los vendedores de enciclopedias que tocaban puerta por puerta en los ochenta.
Nunca decían “no sé”. Cerraban la venta con la misma seguridad tuvieras o no tuvieras la respuesta correcta enfrente.

¿Qué tan grave es el problema en los modelos que ya usas?
No es un caso aislado ni exagerado.
Un estudio de la European Broadcasting Union y la BBC, publicado por Reuters el 21 de octubre de 2025, evaluó 3,000 respuestas en 14 idiomas.
El resultado: 81% tuvo algún problema. 45% tuvo un problema significativo.
Gemini presentó 72% de errores graves de atribución de fuentes — muy por encima del resto de los asistentes evaluados.
Esto ya no es “a veces se equivoca”. Es que la mayoría de las respuestas necesitan revisión, no confianza ciega.

El prompt que obliga a la IA a mostrar su evidencia
La solución no es un prompt más estricto en tono. Es un prompt más estricto en estructura.
En vez de “no inventes información”, la instrucción correcta define tres cosas: qué fuentes acepta, qué hace cuando no sabe, cómo muestra la evidencia.
Esa última instrucción mueve la aguja. Le da permiso explícito al modelo para no adivinar — justo lo que los benchmarks actuales le prohíben implícitamente.
Aquí está completo, listo para pegar en cualquier chat:
Antes de responder, busca y verifica la información. Usa solo fuentes confiables y enlazables, priorizando fuentes primarias sobre blogs o agregadores.
Coloca una cita o enlace después de cada afirmación factual importante: cifras, fechas, nombres, cargos o resultados.
Si una afirmación no puede verificarse, escribe exactamente: “No encontré evidencia verificable suficiente para afirmarlo.”
No completes datos faltantes ni supongas fechas, cifras o nombres. Si las fuentes se contradicen, muéstralo.
Al final, incluye una tabla con: afirmación, fuente, fecha de la fuente y nivel de confianza.
Pégalo una vez al inicio de la conversación y queda activo para todo lo que le pidas después — no hay que repetirlo en cada mensaje.
Una regla adicional, no negociable: nunca copies una cita sin abrirla. Es la misma lógica detrás de los prompts que uso todos los días para que la IA no invente nada: entre más acotada la instrucción, menos espacio le dejas a la máquina para rellenar huecos con humo.
La demanda de Starbuck contra Google, resuelta el 24 de julio de 2026 según documenta Reason, avanzó a juicio precisamente por esto.
Google no pudo demostrar que sus advertencias de “puede cometer errores” fueran suficientemente visibles. Un aviso genérico no es un escudo legal si nadie puede probar que se mostró a tiempo.
¿Cuándo sí puedes confiar en una respuesta sin verificarla?
No todo uso de IA necesita el mismo nivel de sospecha. El riesgo depende de para qué la vas a usar.
| Uso | Riesgo | Qué exigir |
|---|---|---|
| Lluvia de ideas, borradores, estructuras | Bajo | Ninguna verificación extra |
| Resumir un documento que tú diste | Medio | Que cite solo ese documento |
| Datos, fechas, cifras, noticias | Alto | Fuentes, enlaces, verificación manual |
| Decisiones legales, financieras, de salud | Muy alto | Fuente oficial + revisión humana |
Aquí entra la objeción más común: “¿no estoy exagerando? La IA normalmente acierta.”
Los números de la EBU/BBC dicen lo contrario: 81% de las respuestas tuvo algún error. La excepción no es el fallo — es el acierto sin revisión.
Qué pasa cuando nadie revisa lo que la IA entregó
Ningún modelo garantiza cero invención. Ni Gemini, ni ChatGPT, ni ningún otro mainstream.
Eso lo confirma la propia investigación de OpenAI. Por eso la revisión humana sigue sin ser negociable.
Si el reporte lo firmas tú, la pregunta no es si la IA se equivocó.
Es si alguien lo hubiera notado antes de que saliera de tu bandeja.
Ese es exactamente el criterio que trabajamos en el análisis semanal — suscríbete aquí si quieres tenerlo antes de que la próxima decisión dependa de un dato que nadie verificó.
Supervisado por Santiago González y Musi.


