Gemini 3 deep think: Google actualiza su modo de razonamiento para la ciencia, la investigación y la ingeniería

Gemini 3 Deep Think: Google actualiza su modo de razonamiento para la ciencia, la investigación y la ingeniería

Google ha lanzado una importante actualización de Gemini 3 Deep Think, su modo de razonamiento más especializado, diseñado para abordar problemas que escapan a los enfoques de tipo «chatbot»: datos incompletos, restricciones imprecisas y múltiples soluciones plausibles; en resumen, la realidad de laboratorios y equipos de ingeniería.

Los cambios en esta versión abarcan tanto la promesa (una herramienta más útil en flujos de trabajo científicos concretos) como la estrategia de distribución: Deep Think ahora está disponible en la aplicación Gemini para los suscriptores de Google AI Ultra y, por primera vez, llega a la API de Gemini a través de un programa de acceso anticipado.

Una IA diseñada para problemas «sucios»

Google recalca que Deep Think ha sido «perfeccionado» en colaboración con científicos e investigadores para abordar desafíos donde no hay guardias claros ni respuestas únicas, y donde los datos son «desordenados» o incompletos. La idea es combinar el conocimiento científico con la utilidad de la ingeniería para generar salidas accionables.

Para demostrar su eficacia, Google destaca tres casos de uso de testers iniciales:

  • Revisión matemática: la matemática Lisa Carbone (Rutgers) utilizó Deep Think para revisar un documento técnico; el modelo habría detectado una sutileza lógica que se había pasado por alto en la revisión humana.
  • Ciencia de materiales: el Wang Lab (Duke) lo habría utilizado para optimizar métodos de crecimiento cristalino, con una «receta» que permitía obtener películas finas de más de 100 μm.
  • Diseño industrial/componentes: Anupam Pathak (Google Platforms & Devices) lo habría probado para acelerar el diseño de componentes físicos.

gemini 3 deep think evals charts scaled

Scores que sirven de vitrina: matemáticas, código… y olimpiadas

Google también posiciona a Deep Think en la carrera por los benchmarks «duros» — aquellos diseñados para medir una forma de razonamiento robusto:

  • Humanity’s Last Exam: 48,4% (sin herramientas)
  • ARC-AGI-2: 84,6% (puntuación verificada por la ARC Prize Foundation)
  • Codeforces: Elo 3455
  • Olimpiadas Internacionales de Matemáticas 2025: rendimiento «nivel medalla de oro»

gemini 3 deep think evals table

El artículo indica que el modelo también ha progresado en campos científicos: resultados «nivel medalla de oro» en las partes escritas de las Olimpiadas Internacionales de Física y Química 2025, y 50,5% en el CMT-Benchmark en física teórica avanzada.

Detrás de «Deep Think», una idea más amplia: el agente de investigación

El punto más interesante —y el más «DeepMind»— puede estar en otro lugar: Google describe cómo Deep Think ya alimenta enfoques agenticos en matemáticas, incluido un agente interno llamado Aletheia. Este agente combina generación, verificación en lenguaje natural e iteraciones (revisión/intento), y puede incluso «admitir el fracaso» para evitar perder tiempo insistiendo.

Esto es un fuerte indicio: Google no está vendiendo solo un modelo más inteligente, sino un método de trabajo (generar → verificar → corregir) que se adapta a las exigencias del razonamiento científico.

El «premium» se traslada hacia la inferencia

Con Deep Think, Google impulsa una lógica cada vez más visible en la IA de consumo: la diferenciación no se basa únicamente en «el modelo», sino en el modo (razonamiento profundo, más costoso) y en la integración (API, flujos de trabajo, agentes). Por eso el acceso es restringido: Ultra por un lado, «acceso anticipado» por otro.

Subyacente, esta también es una comunicación dirigida a empresas y al ámbito de la investigación: si Deep Think es realmente efectivo en tareas ambiguas y “sucias”, se convierte menos en una herramienta de demostración y más en un componente de productividad — siempre que disponga de los límites (trazabilidad, validación, reproducibilidad) que exigen estos entornos.


Scroll al inicio