Kog quer extrair mais inferência de GPUs com software
A francesa Kog alcançou 3.000 tokens por segundo em GPUs de datacenter comuns e aposta em software para acelerar LLMs grandes sem trocar de hardware. A meta: inferência de IA 30 vezes mais rápida para agentes e ferramentas profissionais.
