Skip to main content

vLLM Engine Schema

Engine version: 0.19.1
Discovered at: 2026-07-03T16:25:37+02:00
Discovery method: dataclasses.fields(EngineArgs) + msgspec.json.schema(SamplingParams) + config/*.py declarative-constraint overlay
Schema version: 1.0.0

Summary: 185 engine parameters, 35 sampling parameters.

Discovery limitations

  • sampling_params - constraints (e.g. temperature>=0, top_p in (0,1]) live in imperative _verify_args() and are not introspectable from field metadata
  • engine_params - per-field descriptions unavailable (vLLM EngineArgs has only a class docstring)

Engine Parameters

FieldTypeDefaultDescription
modelstrQwen/Qwen3-0.6B
enable_return_routed_expertsboolfalse
model_weightsstr""
served_model_name`strlist[str]None`
tokenizer`strNone`-
hf_config_path`strNone`-
runnerstrauto
convertstrauto
skip_tokenizer_initboolfalse
enable_prompt_embedsboolfalse
tokenizer_mode`Literal['auto', 'hf', 'slow', 'mistral', 'deepseek_v32']str`auto
trust_remote_codeboolfalse
allowed_local_media_pathstr""
allowed_media_domains`list[str]None`-
download_dir`strNone`-
safetensors_load_strategy`strNone`-
load_format`strAny`auto
config_formatstrauto
dtypestrauto
kv_cache_dtypestrauto
seedint0
max_model_lenint-
cudagraph_capture_sizes`list[int]None`-
max_cudagraph_capture_size`intNone`-
distributed_executor_backend`strLiteral['ray', 'mp', 'uni', 'external_launcher']type[Any]
pipeline_parallel_sizeint1
master_addrstr127.0.0.1
master_portint29501
nnodesint1
node_rankint0
distributed_timeout_seconds`intNone`-
tensor_parallel_sizeint1
prefill_context_parallel_sizeint1
decode_context_parallel_sizeint1
dcp_comm_backendstrag_rs
dcp_kv_cache_interleave_sizeint1
cp_kv_cache_interleave_sizeint1
data_parallel_sizeint1
data_parallel_rank`intNone`-
data_parallel_start_rank`intNone`-
data_parallel_size_local`intNone`-
data_parallel_address`strNone`-
data_parallel_rpc_port`intNone`-
data_parallel_hybrid_lbboolfalse
data_parallel_external_lbboolfalse
data_parallel_backendstrmp
enable_expert_parallelboolfalse
enable_ep_weight_filterboolfalse
moe_backendstrauto
all2all_backendstrallgather_reducescatter
enable_elastic_epboolfalse
enable_dboboolfalse
ubatch_sizeint0
dbo_decode_token_thresholdint32
dbo_prefill_token_thresholdint512
disable_nccl_for_dp_synchronization`boolNone`-
eplb_config--
enable_eplbboolfalse
expert_placement_strategystrlinear
_api_process_countint1
_api_process_rankint0
max_parallel_loading_workers`intNone`-
block_size`intNone`-
enable_prefix_caching`boolNone`-
prefix_caching_hash_algostrsha256
disable_sliding_windowboolfalse
disable_cascade_attnbooltrue
offload_backendstrauto
cpu_offload_gbfloat0
cpu_offload_paramsset[str][]
offload_group_sizeint0
offload_num_in_groupint1
offload_prefetch_stepint1
offload_paramsset[str][]
gpu_memory_utilizationfloat0.9
kv_cache_memory_bytes`intNone`-
max_num_batched_tokens`intNone`-
max_num_partial_prefillsint1
max_long_partial_prefillsint1
long_prefill_token_thresholdint0
max_num_seqs`intNone`-
max_logprobsint20
logprobs_modestrraw_logprobs
disable_log_statsboolfalse
aggregate_engine_loggingboolfalse
revision`strNone`-
code_revision`strNone`-
hf_token`boolstrNone`
hf_overrides`dict[str, Any]Callable[[typing.Any], Any]`{}
tokenizer_revision`strNone`-
quantization`AnystrNone`
allow_deprecated_quantizationboolfalse
enforce_eagerboolfalse
disable_custom_all_reduceboolfalse
language_model_onlyboolfalse
limit_mm_per_prompt`dict[str, intdict[str, int]]`{}
enable_mm_embedsboolfalse
interleave_mm_stringsboolfalse
media_io_kwargsdict[str, dict[str, Any]]{}
mm_processor_kwargs`dict[str, Any]None`-
mm_processor_cache_gbfloat4
mm_processor_cache_typestrlru
mm_shm_cache_max_object_size_mbint128
mm_encoder_onlyboolfalse
mm_encoder_tp_modestrweights
mm_encoder_attn_backend`AttentionBackendEnumstrNone`
io_processor_plugin`strNone`-
renderer_num_workersint1
skip_mm_profilingboolfalse
video_pruning_rate`floatNone`-
mm_tensor_ipcstrdirect_rpc
enable_loraboolfalse
max_lorasint1
max_lora_rankint16
default_mm_loras`dict[str, str]None`-
fully_sharded_lorasboolfalse
max_cpu_loras`intNone`-
lora_dtype`strdtypeNone`
lora_target_modules`list[str]None`-
enable_tower_connector_loraboolfalse
specialize_active_loraboolfalse
ray_workers_use_nsightboolfalse
num_gpu_blocks_override`intNone`-
model_loader_extra_configdict{}
ignore_patterns`strlist[str]`["original/**/*"]
enable_chunked_prefill`boolNone`-
disable_chunked_mm_inputboolfalse
scheduler_reserve_full_islbooltrue
disable_hybrid_kv_cache_manager`boolNone`-
structured_outputs_config--
reasoning_parserstr""
reasoning_parser_plugin`strNone`-
speculative_config--
show_hidden_metrics_for_version`strNone`-
otlp_traces_endpoint`strNone`-
collect_detailed_traces`list[Literal['model', 'worker', 'all']]None`-
kv_cache_metricsboolfalse
kv_cache_metrics_samplefloat0.01
cudagraph_metricsboolfalse
enable_layerwise_nvtx_tracingboolfalse
enable_mfu_metricsboolfalse
enable_logging_iteration_detailsboolfalse
enable_mm_processor_statsboolfalse
scheduling_policystrfcfs
scheduler_cls`strtype[object]None`
pooler_config--
compilation_config--
attention_config--
kernel_config--
enable_flashinfer_autotunebool-
worker_clsstrauto
worker_extension_clsstr""
profiler_config--
kv_transfer_config--
kv_events_config--
ec_transfer_config--
reasoning_config--
generation_configstrauto
enable_sleep_modeboolfalse
override_generation_configdict[str, Any]{}
model_implstrauto
override_attention_dtype`strNone`-
attention_backend`AttentionBackendEnumNone`-
calculate_kv_scalesboolfalse
kv_cache_dtype_skip_layerslist[str][]
mamba_cache_dtypestrauto
mamba_ssm_cache_dtypestrauto
mamba_block_size`intNone`-
mamba_cache_modestrnone
additional_configdict[str, Any]{}
use_tqdm_on_loadbooltrue
pt_load_map_location`strdict[str, str]`cpu
logits_processors`list[strtype[LogitsProcessor]]None`
async_scheduling`boolNone`-
stream_intervalint1
kv_sharing_fast_prefillboolfalse
optimization_levelOptimizationLevel2
performance_modestrbalanced
kv_offloading_size`floatNone`-
kv_offloading_backendstrnative
tokens_onlyboolfalse
shutdown_timeoutint0
weight_transfer_config--
fail_on_environ_validationboolfalse
gdn_prefill_backendstr-

Sampling Parameters

FieldTypeDefaultDescription
ninteger1
presence_penaltynumber0.0
frequency_penaltynumber0.0
repetition_penaltynumber1.0
temperaturenumber1.0
top_pnumber1.0
top_kinteger0
min_pnumber0.0
seed`intNone`-
stop`strlist[str]None`
stop_token_ids`list[int]None`-
ignore_eosbooleanfalse
max_tokens`intNone`16
min_tokensinteger0
logprobs`intNone`-
prompt_logprobs`intNone`-
flat_logprobsbooleanfalse
detokenizebooleantrue
skip_special_tokensbooleantrue
spaces_between_special_tokensbooleantrue
include_stop_str_in_outputbooleanfalse
output_kindRequestOutputKind0
skip_clonebooleanfalse
output_text_buffer_lengthinteger0
_eos_token_id`intNone`-
_all_stop_token_idsarray[]
structured_outputs`StructuredOutputsParamsNone`-
logit_bias`dict[int, float]None`-
allowed_token_ids`list[int]None`-
extra_args`dict[str, Any]None`-
bad_words`list[str]None`-
_bad_words_token_ids`list[list[int]]None`-
skip_reading_prefix_cache`boolNone`-
thinking_token_budget`intNone`-
repetition_detection`RepetitionDetectionParamsNone`-