OpenAI ha presentado o1-mini, un modelo de lenguaje especializado diseñado meticulosamente para un razonamiento rentable, que se destaca particularmente en los dominios de Ciencia, Tecnología, Ingeniería y Matemáticas (STEM), con un marcado énfasis en las matemáticas y la codificación. Este modelo logra una hazaña notable al casi igualar el desempeño de su contraparte más grande, OpenAI o1, en puntos de referencia de evaluación rigurosos como el Examen de Matemáticas por Invitación Estadounidense (AIME) y Codeforces.
La llegada de o1-mini promete revolucionar las aplicaciones que exigen capacidades de razonamiento robustas sin la necesidad de un amplio conocimiento general del mundo. Su diseño optimizado se traduce en una solución más rápida y significativamente más rentable, preparada para redefinir el panorama de las aplicaciones de IA centradas en STEM.

Un salto hacia el razonamiento accesible
OpenAI o1-mini ya está disponible para usuarios de API de nivel 5, lo que marca el comienzo de una nueva era de asequibilidad con una reducción del 80 % en comparación con el modelo OpenAI o1-preview. Además, los usuarios de Chat Plus, Team, Enterprise y Edu pueden aprovechar o1-mini sin problemas como una alternativa atractiva a o1-preview, disfrutando de las ventajas de mayores límites de velocidad y menor latencia.
Razonamiento pionero optimizado para STEM
Los modelos de lenguaje de gran tamaño como o1 suelen entrenarse previamente con conjuntos de datos de texto colosales, lo que les otorga un amplio conocimiento del mundo. Sin embargo, esta amplitud se produce a costa de un gasto computacional y tiempos de inferencia más lentos. En marcado contraste, o1-mini adopta un enfoque más centrado al estar específicamente optimizado para el razonamiento STEM durante su fase de preentrenamiento. Al someterse al mismo proceso de aprendizaje por refuerzo (RL) de alto rendimiento que su contraparte más grande, o1-mini logra un rendimiento comparable en una variedad de tareas de razonamiento cruciales al tiempo que mantiene un perfil de costo significativamente más favorable.
Las evaluaciones comparativas destacan la destreza de o1-mini en tareas de inteligencia y razonamiento, donde se sitúa a la par de o1-preview y o1. Sin embargo, es importante reconocer que el desempeño de o1-mini en tareas que requieren conocimientos factuales no relacionados con STEM no es tan bueno, lo que resalta su naturaleza especializada.
Descifrando las métricas de rendimiento
Matemáticas
o1-mini demuestra su ventaja competitiva en la exigente competencia de matemáticas de la escuela secundaria AIME, obteniendo una puntuación de 70.0%, rivalizando de cerca con la puntuación de o1 de 74.4%. Este logro es particularmente notable considerando el costo de inferencia significativamente menor de o1-mini. Cabe destacar que o1-mini supera a o1-preview, que obtuvo una puntuación de 44.6%. Para poner esto en perspectiva, la puntuación de o1-mini, equivalente a responder correctamente aproximadamente 11 de 15 preguntas, lo posiciona entre los 500 mejores estudiantes de secundaria de EE. UU.
Codificación
o1-mini continúa con su impresionante racha en el ámbito de la codificación, logrando una calificación Elo de 1650 en el sitio web de competencia de Codeforces. Esta calificación lo coloca muy cerca del Elo de o1 de 1673 y supera el de o1-preview de 1258. Una puntuación Elo tan formidable significa que las capacidades de codificación de o1-mini están a la par con el percentil superior 86 de programadores que compiten activamente en la plataforma Codeforces. Además, o1-mini demuestra competencia en el punto de referencia de codificación HumanEval y en los desafíos de captura de bandera (CTF) de ciberseguridad de nivel secundario.
las disciplinas de STEM
La especialización de o1-mini se destaca en los puntos de referencia académicos que exigen razonamiento, como el conjunto de datos de preguntas y respuestas de propósito general (GPQA) para ciencias y el conjunto de datos MATH-500. En estas evaluaciones, o1-mini supera el desempeño de GPT-4oSin embargo, debido a su enfoque deliberado en STEM, el desempeño de o1-mini en tareas como el benchmark Massive Multitask Language Understanding (MMLU) y ciertos aspectos de GPQA está por detrás de modelos con un conocimiento mundial más amplio, como GPT-4o y o1-preview.
Evaluación de las preferencias humanas
Se recurrió a evaluadores humanos para comparar las respuestas de o1-mini con las de GPT-4o en preguntas desafiantes y abiertas en diversos dominios. La metodología reflejó la comparación anterior entre o1-preview y GPT-4o. En consonancia con o1-preview, o1-mini obtuvo preferencia sobre GPT-4o en dominios que dependían en gran medida del razonamiento. Sin embargo, en dominios centrados en el lenguaje, GPT-4o mantuvo su ventaja.
Velocidad del modelo
La eficiencia computacional de o1-mini se traduce en ganancias de velocidad tangibles. Un ejemplo concreto mostró una pregunta de razonamiento de palabras en la que tanto o1-mini como o1-preview proporcionaron respuestas correctas, mientras que GPT-4o falló. Sorprendentemente, o1-mini llegó a la solución aproximadamente entre 3 y 5 veces más rápido que o1-preview.
Priorizando la seguridad
OpenAI mantiene su compromiso inquebrantable con la seguridad al entrenar a o1-mini utilizando las mismas técnicas de alineación y seguridad empleadas para o1-preview. El modelo demuestra una notable robustez de jailbreak un 59 % mayor en una versión interna del conjunto de datos StrongREJECT en comparación con GPT-4o. Antes de la implementación, OpenAI realizó evaluaciones de riesgo de seguridad meticulosas para o1-mini, adhiriéndose al mismo enfoque riguroso de preparación, equipos rojos externos y evaluaciones de seguridad que o1-preview. Los resultados completos de estas evaluaciones están disponibles públicamente en la tarjeta del sistema que lo acompaña.
Reconociendo limitaciones y direcciones futuras
Si bien o1-mini se destaca en el razonamiento STEM, su naturaleza especializada da como resultado un conocimiento factual sobre temas no STEM, como fechas, biografías y trivialidades, comparable a los LLM más pequeños como GPT-4o mini. OpenAI está comprometido activamente a abordar estas limitaciones en futuras iteraciones del modelo. Además, están explorando vías para extender las capacidades de o1-mini a otras modalidades y dominios especializados más allá de STEM.
Conclusión
OpenAI o1-mini representa un paso importante hacia la democratización del acceso a potentes capacidades de razonamiento. Su relación coste-eficiencia, junto con un rendimiento excepcional en los dominios STEM, lo posiciona como una herramienta invaluable para una amplia gama de aplicaciones. Si bien reconoce sus limitaciones actuales, la dedicación de OpenAI a la mejora y expansión continuas promete un futuro brillante para o1-mini y su potencial para remodelar el panorama de la IA.