Model Spend Arena2ND ED.
inference-host · 2026-10-03

Featherless AI

Official site ↗ · 🇸🇬 Singapore

inference-host

Serves: open-weight models only (40k+ pulled from Hugging Face) — DeepSeek V4 Pro/Flash, GLM 5.3, Qwen3, Kimi K3, Llama
Billing unit: suscripcion mensual por concurrencia, Y desde 2026 tambien por token (plan Developer)
Converts to tokens: partial
Verifiable pre-pay: partial
Pricing / discount: flat rate — "unlimited tokens" within a concurrency budget, not a per-token discount

CORREGIDO 2026-09-13: la ficha decia que no hay precio por token que comparar, y ya lo hay — el plan Developer son $50/mes en creditos, 'billed per token', hasta 256K de contexto. Quedan Chat a $25/mes (4 unidades de concurrencia, 32K, tokens ilimitados), Developer, y Business a medida con GPU dedicadas. El plan Agent de $100/$200 ya no aparece. Anuncian 40.000+ modelos y destacan GLM 5.3 (753B) y Kimi K3 (2780B). 2026-09-24: sus precios por token si son publicos, en api.featherless.ai/v1/models, y de ahi salen ya los ref_prices: GLM-5.3 $1,40/$4,40, GLM-5.3-Flash $0,15/$0,50, Kimi K3 $3/$15, DeepSeek V4.1 Flash $0,30/$1,20, Qwen3.8-27B $0,40/$3. Developer trae 100 unidades de concurrencia y un entorno de agente. Contradiccion suya: su pagina de modelos dice 50.433 y la de precios 40.000+. 2026-10-02: precios y planes identicos, ref_prices reconfirmados uno a uno contra su API. Los creditos no caducan. Su contradiccion de recuento se mueve: la pagina de modelos dice 50.963 y la de precios sigue en 40.000+.