Kog busca exprimir más inferencia de las GPUs
La startup francesa Kog está optimizando el software para acelerar la inferencia de IA en GPUs estándar, promoviendo lograr inferencias 30 veces más rápidas.
La carrera por inferencia de IA más rápida está en marcha, y los mercados dieron una cálida bienvenida a Cerebras y sus chips de propósito específico en su salida a bolsa en mayo. Pero la startup francesa Kog está apostando a que hay mucha más potencia para exprimir de las GPUs convencionales.
La startup llegó a la primera página de Hacker News en mayo con una vista previa de tecnología destinada a probar que "decodificación de solicitud única extremadamente rápida es posible en las GPUs de centro de datos estándar que las empresas ya poseen", como las GPUs AMD MI300X y Nvidia H200 que utilizó para su demostración.
Limitaciones actuales y oportunidades
Algunos se decepcionaron al saber que esto no se extendía a las GPUs en nuestras laptops, pero otros vieron el potencial. Con la velocidad de inferencia y los costos siendo ahora un cuello de botella crítico, la promesa de Kog de desbloquear nuevas capacidades en hardware existente con optimización de software atrajo más que espectadores. "Teníamos 200 leads de negocios tangibles", le dijo al TechCrunch el CEO Gaël Delalleau.
Basándose en comentarios tempranos, el fundador único espera que la ingeniería de software sea el primer caso de uso. Los usuarios veteranos de Claude Code están bien conscientes de que a veces tienen que esperar horas para obtener resultados. Anthropic mismo entiende que la velocidad vale dinero, y cobra un múltiplo de precio por el Modo Rápido de Claude.
Enfoque estratégico de Kog
Kog espera apuntar a clientes rechazados por esos retrasos, usualmente porque dependen de flujos de trabajo de IA para tareas profesionales. Pero la startup también tiene socios de diseño que permiten a los usuarios generar juegos y aplicaciones con un prompt, y para quienes un resultado más rápido gracias al Motor de Inferencia Kog (KIE) significaría más ingresos, dijo Delalleau.
La empresa se da cuenta de que este mercado aún no está completamente maduro. Mientras observa la demanda, Kog aprendió que sus clientes prospectivos no están preparados para ajustar modelos pequeños. "Y es por eso que desde el lanzamiento, hemos estado completamente enfocados en acelerar el desarrollo de modelos más grandes para satisfacer la demanda que hemos visto."
Desafío técnico y futuro
Esto deja a Kog con un salto enorme para hacer para entregar su promesa de "inferencia de LLM 30 veces más rápida". Su demostración mostró un impresionante 3,000 tokens por segundo (TPS) por solicitud, pero con un modelo pequeño de propósito construido con solo alrededor de 2 mil millones de parámetros, el ahora código abierto Laneformer 2B.
Contradicting skeptics, Delalleau está confiado en que el mismo enfoque puede funcionar igual de bien con LLMs, cuyo tamaño puede ser un desafío para chips de inferencia.
Fuente: TechCrunch
