El Allen Institute for AI (Ai2) ha presentado Olmo 3.1, una nueva versión de su familia de modelos de lenguaje abiertos que amplía de forma significativa el entrenamiento mediante reinforcement learning (aprendizaje por refuerzo). El objetivo principal de esta actualización es mejorar las capacidades de razonamiento, especialmente en tareas complejas como matemáticas, lógica, programación y seguimiento de instrucciones.
Olmo 3.1 no es un modelo completamente nuevo, sino una extensión directa del entrenamiento de Olmo 3, lanzado anteriormente por Ai2 como parte de su apuesta por modelos de IA totalmente abiertos y transparentes. En esta ocasión, los investigadores decidieron continuar el proceso de aprendizaje por refuerzo durante varias semanas adicionales, lo que ha permitido obtener mejoras medibles en múltiples benchmarks especializados.
Uno de los aspectos más relevantes del anuncio es que Ai2 ha prolongado el entrenamiento del modelo Olmo 3.1 Think 32B durante aproximadamente 21 días adicionales, utilizando más de 200 GPUs. Este proceso se llevó a cabo sobre un conjunto de datos específico de razonamiento, conocido como Dolci-Think-RL, diseñado para reforzar la capacidad del modelo de resolver problemas paso a paso y mantener coherencia lógica en contextos complejos.
Gracias a esta extensión del entrenamiento, Olmo 3.1 ha mostrado mejores resultados en pruebas de razonamiento matemático y lógico, como AIME, ZebraLogic, IFEval e IFBench. Según Ai2, estas mejoras no se deben a cambios arquitectónicos, sino a una optimización más profunda del aprendizaje por refuerzo, lo que refuerza la idea de que el rendimiento puede escalar significativamente con métodos de entrenamiento bien ajustados.
La familia Olmo 3.1 incluye varias variantes orientadas a distintos usos. Por un lado, Olmo 3.1 Think 32B está enfocado en razonamiento avanzado y resolución de problemas complejos. Por otro, Olmo 3.1 Instruct 32B ha sido afinado para ofrecer mejores respuestas en conversaciones, instrucciones multivuelta y uso de herramientas, lo que lo hace más adecuado para asistentes y aplicaciones prácticas.
En comparativas publicadas por Ai2 y analistas independientes, Olmo 3.1 logra rendimientos similares o superiores a otros modelos abiertos populares, como Qwen 3 32B o Gemma 27B, especialmente en tareas de razonamiento estructurado. Esto posiciona a Olmo como una de las alternativas abiertas más competitivas frente a modelos propietarios, en un contexto donde la eficiencia y la transparencia ganan cada vez más peso.
Otro punto clave del lanzamiento es el compromiso continuo de Ai2 con el open source real. A diferencia de otros proyectos que solo publican los pesos finales, Olmo 3.1 incluye acceso a datos de entrenamiento, código, documentación técnica y herramientas de análisis, como OlmoTrace. Esta herramienta permite examinar cómo distintas fases del entrenamiento influyen en el comportamiento del modelo, facilitando auditorías y experimentación por parte de investigadores y empresas.
Con Olmo 3.1, Ai2 refuerza su mensaje de que el avance en inteligencia artificial no depende únicamente de modelos cerrados y costosos. El proyecto demuestra que extender y refinar el aprendizaje por refuerzo puede producir mejoras sustanciales en razonamiento, manteniendo al mismo tiempo principios de apertura, reproducibilidad y control.





