La tecnología avanza hacia una dirección inesperada donde un pequeño LLM puede rivalizar con gigantes. PrismML demuestra que la eficiencia no sacrifica el rendimiento, permitiendo ejecutar modelos de razonamiento avanzados directamente en tu dispositivo. Esta innovación redefine nuestra interacción diaria con la inteligencia artificial, eliminando barreras de hardware y conectividad para usuarios comunes.
PrismML espera que su pequeño LLM cambie la forma en que todos usamos la IA
Si labPrismML de IA aún no está en tu radar, debería estarlo, no porque haya recaudado grandes cantidades de dinero (aún no lo ha hecho, solo una ronda inicial de $ 22.25 millones), sino debido a las mentes técnicas involucradas y la tecnología potencialmente cambiante en la industria que está desarrollando.
PrismML apuesta a que los modelos de lenguaje grandes, capaces, de alto rendimiento y razonados, de hecho, no tienen que ser grandes.
Está haciendo que los modelos de razonamiento sean tan pequeños que puedan caber en PC y teléfonos inteligentes. (Incluso se rumorea que está en conversaciones con Apple, aunque el CEO Babak Hassibi se negó a comentar sobre eso a TechCrunch).
El jueves, PrismML lanzó Bonsai 2 27B, el último de una familia de modelos, que comprime Qwen3.8 27B, un modelo de código abierto ampliamente utilizado de Alibaba, hasta 5.9 GB. Eso es lo suficientemente pequeño como para caber en un PC y, posiblemente, en un teléfono inteligente de gama alta. Es una reducción de 9x a 10x en la memoria en comparación con el original.
PrismML fue fundada por un grupo de investigadores de Caltech y está dirigida por Hassibi, profesor de Caltech y experto en tecnologías de compresión. La startup también cuenta con Ion Stoica como asesor. Stoica es cofundadora de Databricks (y otras compañías) y directora del famoso Sky Computing Lab de Berkeley, que ha creado muchas tecnologías y nuevas empresas, de LettatoSGLang.
Fuente: TechCrunch
El impacto de un pequeño LLM en la privacidad y accesibilidad
La capacidad de ejecutar modelos complejos localmente transforma la experiencia del usuario al eliminar la dependencia de servidores externos. Cuando un pequeño LLM opera directamente en un teléfono inteligente o PC, los datos sensibles nunca abandonan el dispositivo, garantizando una privacidad robusta que las soluciones en la nube no siempre pueden ofrecer.
Además, esta descentralización técnica reduce la latencia y permite el uso de la inteligencia artificial en entornos sin conexión a internet. Para profesionales y usuarios cotidianos, esto significa tener acceso a herramientas de razonamiento avanzado en cualquier momento y lugar, democratizando el poder computacional que antes estaba reservado para corporaciones tecnológicas.
Tecnología de compresión detrás de PrismML
El éxito de esta startup radica en su enfoque académico riguroso, liderado por expertos en tecnologías de compresión de Caltech. Al comprimir modelos existentes como Qwen3.8 27B hasta reducirlos drásticamente en tamaño, PrismML logra mantener capacidades de alto rendimiento sin requerir recursos de hardware desproporcionados.
Esta metodología no solo optimiza el almacenamiento, sino también el consumo energético. Un modelo reducido consume menos batería y genera menos calor, lo cual es crítico para la viabilidad de la IA generativa en dispositivos móviles compactos. La asesoría de figuras como Ion Stoica refuerza la credibilidad técnica de este enfoque disruptivo.
Futuro de la IA local y conversaciones con Apple
Los rumores sobre posibles alianzas con gigantes como Apple sugieren que la industria reconoce el valor estratégico de integrar estos modelos eficientes en ecosistemas cerrados y masivos. Si bien el CEO Babak Hassibi mantiene discreción, la tendencia indica un movimiento claro hacia la integración nativa de IA en sistemas operativos.
Para el lector, esto anticipa un cambio en cómo interactuamos con asistentes virtuales y aplicaciones creativas. En lugar de depender exclusivamente de servicios suscritos, veremos funciones de inteligencia artificial embebidas en nuestros dispositivos, ofreciendo respuestas instantáneas y personalizadas sin comprometer la seguridad ni la velocidad de procesamiento.













