Chat et inférence des LLM
Propulsez vos chatbots, copilotes et API grâce à des performances GPU à faible latence, disponibles 24h/24 et 7j/7. Utilisez Ollama et Open WebUI, ou intégrez votre propre modèle avec vLLM ou LangChain.
GPU recommandé:
L40S
Servez des modèles allant jusqu'à 30 milliards de paramètres.
Lancez Ollama en un clic
Tarification horaire simple