CosmicAC Logo

Recommended model parameters

Recommended model master values for each supported Managed Inference model.

CosmicAC recommends these values for each supported model's model master. For the vLLM models, each inference_param_overrides.env row sets a vllm serve option. See vLLM serving options.

Qwen3-VL-235B-A22B-Thinking-FP8

FieldValue
job_typeINFERENCE_VLLM
base_os_imageUbuntu 22.04 + CUDA 13.0
disk_gb500
cuda_driver_versionCUDA 13.0
model_nameQwen/Qwen3-VL-235B-A22B-Thinking-FP8
runtime_imagevllm/vllm-openai:v0.15.1
data_typeAuto
quantisationnull
tensor_parallel8
per_replica_gpu_count8
gpu_memory_utilisation0.9
max_model_length131072
max_concurrent_sequences64
reasoning_parserdeepseek_r1
multimodaltrue
replica1
require_auth_headertrue
min["base_os_image"]
max["gpu_memory_utilisation"]
inference_param_overrides.root_disk_size_gb500
inference_param_overrides.env.TRUST_REMOTE_CODEtrue
inference_param_overrides.env.SWAP_SPACE0
inference_param_overrides.env.ENABLE_EXPERT_PARALLELtrue
inference_param_overrides.env.ENFORCE_EAGERfalse

Qwen3.5-122B-A10B

FieldValue
job_typeINFERENCE_VLLM
base_os_imageUbuntu 22.04 + CUDA 13.0
disk_gb500
cuda_driver_versionCUDA 13.0
model_nameQwen/Qwen3.5-122B-A10B
runtime_imagevllm/vllm-openai:v0.17.1
data_typeAuto
quantisationFP8
tensor_parallel8
per_replica_gpu_count8
gpu_memory_utilisation0.9
max_model_length32768
max_concurrent_sequences32
reasoning_parserdeepseek_r1
multimodaltrue
replica1
require_auth_headertrue
min["base_os_image"]
max["gpu_memory_utilisation"]
inference_param_overrides.root_disk_size_gb500
inference_param_overrides.env.TRUST_REMOTE_CODEtrue
inference_param_overrides.env.SWAP_SPACE0
inference_param_overrides.env.ENABLE_EXPERT_PARALLELtrue
inference_param_overrides.env.ENFORCE_EAGERfalse

MiniMax M2.5

FieldValue
job_typeINFERENCE_VLLM
base_os_imageUbuntu 22.04 + CUDA 13.0
disk_gb500
cuda_driver_versionCUDA 13.0
model_nameMiniMaxAI/MiniMax-M2.5
runtime_imagevllm/vllm-openai:v0.15.1
data_typeAuto
quantisationnull
tensor_parallel4
per_replica_gpu_count4
gpu_memory_utilisation0.85
max_model_length27000
max_concurrent_sequences256
reasoning_parserdeepseek_r1
multimodaltrue
replica1
require_auth_headertrue
min["base_os_image"]
max["gpu_memory_utilisation"]
inference_param_overrides.root_disk_size_gb500
inference_param_overrides.env.TRUST_REMOTE_CODEtrue
inference_param_overrides.env.SWAP_SPACE0
inference_param_overrides.env.ENABLE_EXPERT_PARALLELtrue
inference_param_overrides.env.ENFORCE_EAGERfalse

Qwen2-VL-2B-Instruct

FieldValue
job_typeINFERENCE_VLLM
base_os_imageUbuntu 22.04 + CUDA 13.0
disk_gb150
cuda_driver_versionCUDA 13.0
ssh_public_keynull
model_nameQwen/Qwen2-VL-2B-Instruct
runtime_imagevllm/vllm-openai:v0.15.1
data_typeAuto
quantisationnull
tensor_parallel1
gpu_memory_utilisation0.9
max_model_length32768
max_concurrent_sequences64
reasoning_parserdefault
multimodaltrue
replica1
per_replica_gpu_count1
require_auth_headertrue
inference_param_overrides.root_disk_size_gb150
inference_param_overrides.env.TRUST_REMOTE_CODEtrue
inference_param_overrides.env.SWAP_SPACE0
inference_param_overrides.env.ENFORCE_EAGERfalse
min["base_os_image"]
max["gpu_memory_utilisation"]

Parakeet

The Parakeet model master stores a different set of fields. Parakeet Managed Inference Job configuration defines each one. For the inference_param_overrides.env rows, see Parakeet server settings.

FieldValue
job_typeINFERENCE_PARAKEET
model_namenvidia/parakeet-tdt-0.6b-v3
require_auth_headerfalse
chunk_duration30
chunk_overlap5
max_file_size_mb1024
disk_gb250
replica1
inference_param_overrides.root_disk_size_gb150
inference_param_overrides.env.MODEL_SOURCEhuggingface
inference_param_overrides.env.HF_HOME/mnt/external-disk/huggingface
inference_param_overrides.env.NEMO_CACHE_DIR/mnt/external-disk/nemo
inference_param_overrides.env.HOST0.0.0.0
inference_param_overrides.env.INFERENCE_BACKENDparakeet
inference_param_overrides.env.PORT8777
inference_param_overrides.env.PARAKEET_STARTUP_TIMEOUT_MS600000

What's next

On this page