Skip to main content
NVIDIA
Explore
Models
Skills
Blueprints
GPUs
Docs
ForumsSupport
Terms of Use
Privacy Policy
Your Privacy Choices
Contact

Copyright © 2026 NVIDIA Corporation

Models

Deploy and scale models on your GPU infrastructure of choice with NVIDIA NIM inference microservices

Optimized by NVIDIALaunch from Hugging FaceBeta

Filters (1)

Use Case
Inference Providers
Publisher
NIM Container GPUs
Labels (1)
7 models
NVIDIA
DownloadableFree Endpoint

cosmos3-nano-reasoner

Vision language model that excels in understanding the physical world using structured reasoning on videos or images.
video understanding
autonomous vehiclesindustrialPhysical AIvision language modelreasoningroboticssmart citiesSynthetic Data Generation
Items per page
of 1 pages
2K API calls in the last 30 days
Last updated on June 1, 2026
Stepfun-ai
DownloadableFree Endpoint

step-3.7-flash

A sparse MoE multimodal reasoning model good for enterprise, agentic and coding tasks.
Coding
VisionAgents
7M API calls in the last 30 days
Last updated on May 29, 2026
NVIDIA
DownloadableFree Endpoint

ising-calibration-1-35b-a3b

Open VLM for quantum computer calibration chart understanding across a range of qubit modalities.
Quantum
reasoningVision Language Modelcalibration
442K API calls in the last 30 days
Last updated on April 14, 2026
NVIDIA
Downloadable

cosmos-reason2-8b

Vision language model that excels in understanding the physical world using structured reasoning on videos or images.
video understanding
autonomous vehiclesindustrialPhysical AIvision language modelreasoningroboticssmart citiesSynthetic Data Generation
191K API calls in the last 30 days
Last updated on December 27, 2025
NVIDIA
DownloadableFree Endpoint

nemotron-nano-12b-v2-vl

Nemotron Nano 12B v2 VL enables multi-image and video understanding, along with visual Q&A and summarization capabilities.
language generation
vision assistantvisual question answeringImage-to-Text
5M API calls in the last 30 days
Last updated on October 28, 2025
Meta
Deprecation in 7dFree Endpoint

llama-4-maverick-17b-128e-instruct

A general purpose multimodal, multilingual 128 MoE model with 17B parameters.
language generation
vision assistantvisual question answeringImage-to-Text
16M API calls in the last 30 days
Last updated on July 17, 2025
Google
Free Endpoint

paligemma

Vision language model adept at comprehending text and visual inputs to produce informative responses
image
cvVision AssistantvlmVisual Question Answeringcomputer visionLanguage GenerationvideoImage-to-Text
12K API calls in the last 30 days
Last updated on August 26, 2024