Los recientes avances sugieren que los modelos de IA están dando pasos agigantados hacia la comprensión del mundo físico. Un experimento con tres sistemas avanzados puso a prueba su capacidad para manejar un coche real, revelando resultados sorprendentes sobre la adaptación inmediata de estas tecnologías sin entrenamiento específico previo.
Tres ingenieros de la startup Axiom decidieron poner a prueba las capacidades de los modelos de inteligencia artificial más avanzados del momento en una tarea inesperada: conducir un vehículo real. Conectaron GPT-6 Astra de OpenAI, Claude y Grok a un Toyota Corolla 2024 equipado con cámaras y una interfaz que permitía a los modelos controlar la dirección asistida. El objetivo era llegar hasta un drive-thru de In-N-Out Burger sin intervención humana directa, solo con un conductor de seguridad listo para frenar en caso de emergencia.
De los tres modelos evaluados, únicamente GPT-6 Astra logró completar la prueba con éxito, conduciendo el automóvil de forma lenta pero segura hasta la ventanilla del restaurante. Este experimento demuestra que los modelos de lenguaje, diseñados originalmente para generar texto y código, están comenzando a adquirir una comprensión rudimentaria del mundo físico. La hazaña sugiere que la inteligencia artificial general podría estar más cerca de lo que se pensaba, aunque los propios investigadores advierten sobre los riesgos de poner modelos de propósito general al mando de vehículos en movimiento.
El proyecto pone de manifiesto una frontera emergente en el desarrollo de la IA: el razonamiento físico. Mientras empresas como Waymo y Tesla dependen de algoritmos específicamente entrenados para la conducción autónoma, este experimento muestra que los modelos de lenguaje pueden adaptarse sobre la marcha a tareas del mundo real sin entrenamiento previo. Investigadores de startups como Elorian AI y Scale AI están desarrollando nuevos puntos de referencia para medir la capacidad de los modelos de comprender escenas físicas, un paso crucial para aplicaciones futuras en robótica doméstica y sistemas autónomos.
El desafío de conducir un vehículo real
La prueba realizada por ingenieros de Axiom no fue trivial. Conectar sistemas diseñados para procesar lenguaje natural a la dirección asistida de un Toyota Corolla 2024 requirió una interfaz compleja. El objetivo era llegar a un drive-thru de In-N-Out Burger sin intervención humana directa, lo cual expone las limitaciones actuales de estos sistemas en entornos dinámicos y reales.
Aunque solo GPT-6 Astra completó la tarea, el hecho de que otros modelos fallaran destaca la inconsistencia en el razonamiento espacial. Esto implica que, si bien la inteligencia artificial general podría estar más cerca, aún existen riesgos significativos al poner modelos de propósito general al mando de vehículos en movimiento.
Razonamiento físico frente a algoritmos específicos
Este experimento marca una frontera emergente en el desarrollo tecnológico. Mientras empresas como Waymo y Tesla dependen de algoritmos específicamente entrenados para la conducción autónoma, los modelos de lenguaje demostraron poder adaptarse sobre la marcha. Esta capacidad de aprendizaje cero-shot es crucial para aplicaciones futuras en robótica doméstica y sistemas autónomos.
Investigadores de startups como Elorian AI y Scale AI están desarrollando nuevos puntos de referencia para medir esta comprensión de escenas físicas. La diferencia radica en que los modelos tradicionales necesitan millones de horas de datos de conducción, mientras que los grandes modelos de lenguaje intentan inferir reglas físicas básicas desde su conocimiento textual.
Implicaciones para la seguridad vial
La hazaña sugiere que la inteligencia artificial está adquiriendo una comprensión rudimentaria del mundo físico, pero los propios investigadores advierten cautela. Conducir lentamente hasta una ventanilla es muy diferente a navegar tráfico urbano complejo. Los fallos de los otros dos modelos evaluados subrayan la necesidad de validación rigurosa antes de cualquier implementación comercial.
Para el usuario final, esto significa que la conducción totalmente autónoma basada en modelos de lenguaje aún está lejos de ser segura para uso diario. Sin embargo, el progreso indica que la convergencia entre procesamiento de lenguaje y percepción visual acelerará el desarrollo de asistentes de conducción más intuitivos y versátiles en el futuro cercano.












