Databricks Model Serving Cost

Databricks Model Serving charges for the compute used to serve model requests. The cost depends on the endpoint configuration, request volume, model size, and serving duration.

An endpoint can consume resources while it is provisioned, and each request adds work. A low request volume with a continuously provisioned endpoint can have a different cost profile from a busy endpoint that scales with demand.

Track requests, response latency, instance or compute usage, and DBUs together. Compare serving cost with the latency and availability requirement. Databricks documents Model Serving.