Chat e inferencia LLM
Puedes usar Ollama y Open WebUI, o traer tu propio modelo con vLLM o LangChain, y podrás disfrutar de una amplia gama de aplicaciones de bajo rendimiento en GPU.
GPU recomendada:
L40S
Sirve modelos de hasta 30B parámetros
Lanza Ollama en un clic
Precios por hora simples