Aller au contenu
Fide Systems
Partenaires
En exploitation Fondée en 2022

Meridian Compute

Service de modèles à faible latence sur des accélérateurs hétérogènes.

Secteur
Infrastructure d’inférence
Siège
Austin, Texas
Partenaire depuis
2023
Équipe
41

Aperçu

Meridian exploite un tissu de service qui répartit les charges d’inférence sur des parcs hétérogènes — GPU de génération courante, cartes de génération précédente encore sous contrat de location, accélérateurs dédiés — sans que l’application appelante sache, ni ait à savoir, lequel a répondu.

Pourquoi cela existe

La plupart des équipes achètent de la capacité d’inférence comme elles achetaient des serveurs en 2009 : un fournisseur, un type d’instance, une capacité dimensionnée pour le pic. Il en résulte un parc mal utilisé à l’heure médiane et insuffisant en pointe. Pendant ce temps, le matériel se renouvelle plus vite qu’aucun cycle d’achat ne peut l’absorber.

Meridian traite le parc comme un seul ensemble adressable. Les requêtes sont routées selon la latence et le coût par jeton observés en temps réel plutôt que par affectation statique, et les modèles sont recompilés pour chaque cible, de sorte que le silicium ancien reste économiquement utile bien au-delà du point où un déploiement mono-fournisseur l’aurait mis au rebut.

Pourquoi nous nous associons

C’est la couche sur laquelle finit par tourner l’essentiel de ce que nous soutenons, et elle gagne en valeur à mesure que l’offre d’accélérateurs se fragmente, non l’inverse. Le coût de changement pour un client qui a basculé son trafic de production sur le tissu est élevé, et il croît avec chaque modèle ajouté.

Priorités actuelles

  • Latence de pointe déterministe en charge multi-locataire
  • Décodage spéculatif entre paires de matériels non identiques
  • Engagements de capacité régionale pour les clients soumis à des obligations de résidence des données