Chat et LLM inférence
Alimentez les chatbots, les copilotes et les API avec des performances GPU à faible latence, disponibles 24 heures sur 24. Utilisez Ollama et Open WebUI, ou apportez votre propre modèle avec vLLM ou LangChain.
GPU recommandé:
L40S
Servir des modèles jusqu'à 30B paramètres
Lancez Ollama en un clic
Tarif horaire simple