Chat e inferência LLM
Alimenta chatbots, copilots e APIs com desempenho de GPU de baixa latência, disponível 24 horas por dia. Use Ollama e Open WebUI, ou traga seu próprio modelo com vLLM ou LangChain.
GPU recomendado:
L40S
Servir modelos até 30B parâmetros
Lançar Ollama em um clique
Preço por hora simples