estudio de casoPlataforma de inferencia GPU autoalojada — MoE de 36B, voz IA y un farm de 70 GPUs
Un stack de IA completamente autoalojado: un modelo MoE de 36B servido de forma concurrente con embeddings, ASR y TTS en una sola GPU de 24 GB — escalado después a un farm de 70 GPUs en 10 nodos que un estado de reloj VBIOS defectuoso casi tumba.






