Kog está profundizando para extraer más inferencia de las GPUs
La startup francesa Kog apuesta a que hay mucha más potencia para exprimir de las GPU convencionales. Su promesa de desbloquear nuevas capacidades en hardware existente atrajo muchos proyectos.
La carrera por inferencia de IA más rápida está en marcha, y los mercados dieron una cálida bienvenida a Cerebras y sus chips especialmente diseñados en su debut de OPI en mayo. Pero la startup francesa Kog está apostando a que hay mucha más potencia para exprimir de las GPU convencionales.
La startup llegó a la portada de Hacker News en mayo con una vista previa de tecnología destinada a probar que "la decodificación de solicitud única extremadamente rápida es posible en las GPU de centro de datos estándar que las empresas ya poseen", como las GPU AMD MI300X y Nvidia H200 que utilizó para su demostración.
Oportunidad de mercado
Algunos estaban decepcionados de escuchar que esto no se extendía a las GPU en nuestras laptops, pero otros vieron el potencial. Con la velocidad de inferencia y los costos siendo ahora un cuello de botella crítico, la promesa de Kog de desbloquear nuevas capacidades en hardware existente con optimización de software atrajo más que solo observadores. "Tuvimos 200 pistas comerciales tangibles", le dijo el CEO Gaël Delalleau a TechCrunch.
Con base en retroalimentación temprana, el fundador único espera que la ingeniería de software sea el primer caso de uso. Los usuarios veteranos de Claude Code saben bien que a veces tienen que esperar horas para obtener resultados. Anthropic mismo entiende que la velocidad vale dinero, y cobra un múltiple de precio por el Modo Rápido de Claude.
Kog espera apuntar a clientes desalentados por esos retrasos, generalmente porque dependen de flujos de trabajo de IA para tareas profesionales. Pero la startup también tiene socios de diseño que permiten a los usuarios generar juegos y aplicaciones con un prompt, y para quienes un resultado más rápido gracias al Motor de Inferencia Kog (KIE) significaría más ingresos, dijo Delalleau.
Desafíos técnicos
La empresa se da cuenta de que este mercado aún no es completamente maduro. Mientras observaba la demanda, Kog aprendió que sus prospectos clientes no están preparados para ajustar modelos pequeños. "Y es por eso que desde el lanzamiento, hemos estado completamente enfocados en acelerar el desarrollo de modelos más grandes para satisfacer la demanda que hemos visto".
Esto deja a Kog con un gran salto que hacer para cumplir con su promesa de "30x inferencia de LLM más rápida". Su demostración mostró impresionantes 3.000 tokens por solicitud por segundo (TPS), pero con un modelo pequeño construido a propósito con solo alrededor de 2 mil millones de parámetros, el Laneformer 2B ahora de código abierto.
Contradictorio a los escépticos, Delalleau confía en que el mismo enfoque puede funcionar igual de bien con LLM, cuyo tamaño puede ser un desafío para los chips de inferencia.
Fuente: TechCrunch
