Abrís LinkedIn y parece que tu empresa ya llega tarde. En los últimos días hubo novedades para crear imágenes y programar; hoy llegaron GPT-6 Sol y Luna y Claude Opus 5.5. El 29 de septiembre OpenAI tiene su DevDay. Apenas terminás de entender qué hace una herramienta, ya aparece otra que reclama atención.

Y vos seguís con una empresa que dirigir. Con cada anuncio vuelve la misma duda: «¿Hay algo importante que podríamos estar aprovechando y todavía no vimos?». Es una pregunta razonable. Lo difícil es que responderla exige seguir lanzamientos, entender sus límites y traducir todo eso a procesos, personas y sistemas concretos. Seguirle el ritmo a la IA empieza a parecer otro trabajo.

En 42N, ese trabajo es parte del nuestro. Usamos Codex, Claude Code y otras herramientas todos los días, y seguimos de cerca sus cambios. Por eso vale la pena mirar esta semana con algo más de detalle: detrás de los nombres nuevos hay movimientos reales en precio y capacidad, pero también diferencias que un anuncio no alcanza a mostrar.

Tres lanzamientos, decisiones distintas

OpenAI bajó el precio de uso de GPT-6 Sol y Luna frente a sus versiones GPT-5.6. En la API, Sol pasó de USD 4 a USD 2 por millón de tokens de entrada y de USD 20 a USD 10 por millón de salida. Luna bajó de USD 0,20 a USD 0,10 en entrada y de USD 1,20 a USD 0,50 en salida. Si una empresa procesa mucho volumen, esa diferencia puede cambiar qué tareas conviene automatizar. Pero el precio por token es solo una parte del costo: también cuentan la cantidad de intentos, la revisión humana y la integración con el trabajo existente.

La evaluación independiente de Artificial Analysis ayuda a poner esa baja en contexto. En su índice general, una tarea con Sol al máximo esfuerzo pasó de costar USD 1,99 con GPT-5.6 a USD 1,06 con GPT-6; con Luna, de USD 0,18 a USD 0,07. Los puntajes generales se mantuvieron cerca de los anteriores. En pruebas de agentes de programación, Sol mejoró dos puntos, mientras Luna retrocedió dos. Son señales útiles para elegir qué probar, no una garantía de que el mismo cambio mejore todos los procesos.

Hay otro dato que importa para el uso cotidiano: ambos modelos dieron menos respuestas inventadas en una prueba de conocimiento de Artificial Analysis. En Sol, la tasa bajó del 92% al 60%, pero también respondió menos preguntas y su precisión en esa evaluación cayó del 59% al 54%. Es decir, parte de la mejora viene de reconocer con más frecuencia cuándo no responder. Para una empresa, esa conducta puede ser valiosa; hay que medirla junto con las respuestas correctas, los errores y el trabajo que queda para quien revisa.

Anthropic hizo un movimiento diferente con Claude Opus 5.5. Bajó su tarifa un 20% frente a Opus 5, a USD 4 por millón de tokens de entrada y USD 20 por millón de salida; las lecturas de caché pasaron de USD 0,50 a USD 0,20. Artificial Analysis lo ubicó primero en su Intelligence Index, con 58 puntos al máximo esfuerzo, y destacó sus resultados en tareas profesionales resueltas por agentes. En Terminal-Bench 4.0, una prueba de trabajo en terminal, quedó al nivel de GPT-6 Astra. Eso no significa que sea la mejor elección para cualquier tarea, pero sí que merece atención cuando la calidad de un entregable complejo pesa más que el costo de una respuesta aislada.

El matiz está en cuánto trabajo hace el modelo para llegar a ese resultado. En esas pruebas, Opus 5.5 produjo alrededor de 119.000 tokens de salida por tarea frente a 73.000 de Opus 5. Aunque la tarifa por token bajó, el costo por tarea quedó cerca del anterior. Es un buen ejemplo de por qué conviene probar un flujo completo antes de decidir por una tabla de precios o por el primer puesto en un ranking.

La semana no terminó en esos tres modelos

Los lanzamientos también se están moviendo fuera de los asistentes de texto. Qwen-Image-2.1 publicó pesos para generar imágenes localmente, algo que puede interesar cuando importa dónde se procesan los archivos. No alcanza con descargarlo para usarlo en una empresa: su licencia requiere un acuerdo separado para uso comercial. En paralelo aparecieron Grok 4.7, nuevos modelos MiMo de Xiaomi y Jev de TypeSafe, orientado a decisiones estructuradas más que a conversar. Son caminos distintos que avanzan al mismo tiempo.

La semana próxima traerá el DevDay de OpenAI. Todavía no sabemos qué anunciarán y sería apresurado diseñar una estrategia alrededor de rumores. Lo que sí sabemos es que, si cada lanzamiento dispara una evaluación completa desde cero, la empresa queda atrapada en una actualización permanente.

Seguir el ritmo, sin cargarlo sobre tu equipo

La pregunta útil no es «¿cómo usamos todos estos modelos?», sino «¿cuáles podrían cambiar algo en nuestro trabajo?». Para responderla hay que conocer las herramientas, entender el proceso de la empresa y comprobar resultados con casos propios. A veces una mejora de precio vuelve viable una automatización que antes no cerraba. Otras veces el nuevo modelo no compensa el esfuerzo de cambiar. Esa diferencia se descubre trabajando sobre el problema concreto.

En 42N podemos acompañarte en ese recorrido: entender qué merece atención ahora, qué puede esperar y cómo implementar lo que sirva con tus sistemas y tu equipo. Puede empezar con una conversación, una prueba acotada o una revisión de lo que ya están usando. No necesitás llegar con un proyecto armado ni con el nombre de un modelo elegido.

Si esta semana te dejó pensando «¿y mi empresa?», escribinos a 42N. Contanos qué te gustaría explorar y lo vemos juntos.

Fuentes para profundizar

Volver al índice