Skip to main content

TensorRT-LLM Parameter Curation

Engine version: 1.2.1
Discovered at: 2026-07-13 00:00:00+00:00
Discovery method: TorchLlmArgs+TrtLlmArgs.model_json_schema() union with per-field backends + dataclasses.fields(SamplingParams)

Summary: 20/143 parameters curated (95 engine + 48 sampling discovered)

Engine Parameters

FieldTypeDefaultCurated?
allreduce_strategystring | NoneAUTO-
attention_dp_configAttentionDpConfig | Nonenull-
attn_backendstringTRTLLM-
backendstring | Nonenullyes
batch_wait_max_tokens_rationumber0-
batch_wait_timeout_itersinteger0-
batch_wait_timeout_msnumber0-
batched_logits_processorOptional[tensorrt_llm.sampling_params.BatchedLogitsProcessor]null-
batching_typeBatchingType | Nonenull-
build_configBuildConfig | Nonenull-
cache_transceiver_configCacheTransceiverConfig | Nonenull-
calib_configCalibConfig | Nonenull-
checkpoint_formatstring | Nonenull-
checkpoint_loaderOptional[tensorrt_llm._torch.models.checkpoints.BaseCheckpointLoader]null-
context_parallel_sizeinteger1-
cp_configobject | Nonenull-
cuda_graph_configCudaGraphConfig | Nonenull-
custom_tokenizerstring | Nonenull-
decoding_configOptional[tensorrt_llm.llmapi.llm_args.DecodingConfig]null-
disable_flashinfer_samplingbooleanFalse-
disable_overlap_schedulerbooleanFalse-
dtypestringautoyes
embedding_parallel_modestringSHARDING_ALONG_VOCAB-
enable_attention_dpbooleanFalse-
enable_autotunerbooleanTrue-
enable_build_cacheUnion[tensorrt_llm.llmapi.build_cache.BuildCacheConfig, bool]False-
enable_chunked_prefillbooleanFalse-
enable_iter_perf_statsbooleanFalse-
enable_iter_req_statsbooleanFalse-
enable_layerwise_nvtx_markerbooleanFalse-
enable_lm_head_tp_in_adpbooleanFalse-
enable_lorabooleanFalse-
enable_min_latencybooleanFalse-
enable_prompt_adapterbooleanFalse-
enable_sleepbooleanFalse-
enable_tqdmbooleanFalse-
env_overridesobject | Nonenull-
extended_runtime_perf_knob_configExtendedRuntimePerfKnobConfig | Nonenull-
fail_fast_on_attention_window_too_largebooleanFalse-
fast_buildbooleanFalseyes
force_dynamic_quantizationbooleanFalse-
garbage_collection_gen0_thresholdinteger20000-
gather_generation_logitsbooleanFalse-
gpus_per_nodeinteger | Nonenull-
guided_decoding_backendstring | Nonenull-
iter_stats_max_iterationsinteger | Nonenull-
kv_cache_configKvCacheConfignullyes
kv_connector_configKvCacheConnectorConfig | Nonenull-
load_formatLiteral['auto', 'dummy']auto-
lora_configLoraConfig | Nonenull-
max_batch_sizeinteger | Nonenullyes
max_beam_widthinteger | Nonenull-
max_input_leninteger | Nonenullyes
max_num_tokensinteger | None8192yes
max_prompt_adapter_tokeninteger0-
max_seq_leninteger | Nonenullyes
max_stats_leninteger1000-
mm_encoder_onlybooleanFalse-
modelstringnull-
moe_cluster_parallel_sizeinteger | Nonenull-
moe_configMoeConfignull-
moe_expert_parallel_sizeinteger | Nonenull-
moe_tensor_parallel_sizeinteger | Nonenull-
normalize_log_probsbooleanFalse-
num_postprocess_workersinteger0-
nvfp4_gemm_configNvfp4GemmConfignull-
orchestrator_typestring | Nonenull-
otlp_traces_endpointstring | Nonenull-
peft_cache_configPeftCacheConfig | Nonenull-
perf_metrics_max_requestsinteger0-
pipeline_parallel_sizeinteger1yes
postprocess_tokenizer_dirstring | Nonenull-
pp_partitionarray | Nonenull-
print_iter_logbooleanFalse-
quant_configQuantConfig | Nonenullyes
ray_placement_configRayPlacementConfig | Nonenull-
ray_worker_extension_clsstring | Nonenull-
reasoning_parserstring | Nonenull-
request_stats_max_iterationsinteger | Nonenull-
return_perf_metricsbooleanFalse-
revisionstring | Nonenull-
sampler_force_async_workerbooleanFalse-
sampler_typestring | SamplerTypeauto-
scheduler_configSchedulerConfignullyes
skip_tokenizer_initbooleanFalse-
sparse_attention_configRocketSparseAttentionConfig | DeepSeekSparseAttentionConfig | SkipSoftmaxAttentionConfig | Nonenull-
speculative_configDraftTargetDecodingConfig | EagleDecodingConfig | LookaheadDecodingConfig | MedusaDecodingConfig | MTPDecodingConfig | NGramDecodingConfig | UserProvidedDecodingConfig | SaveHiddenStatesDecodingConfig | AutoDecodingConfig | Nonenull-
stream_intervalinteger1-
tensor_parallel_sizeinteger1yes
tokenizerstring | Nonenull-
tokenizer_modeLiteral['auto', 'slow']auto-
tokenizer_revisionstring | Nonenull-
torch_compile_configTorchCompileConfig | Nonenull-
trust_remote_codebooleanFalse-
workspacestring | Nonenull-

Sampling Parameters

FieldTypeDefaultCurated?
add_special_tokensboolTrue-
additional_model_outputslist[str] | Nonenull-
apply_batched_logits_processorboolFalse-
badstr | list[str] | Nonenull-
bad_token_idslist[int] | Nonenull-
beam_search_diversity_ratefloat | Nonenull-
beam_width_arraylist[int] | Nonenull-
best_ofint | Nonenull-
detokenizeboolTrue-
early_stoppingint | Nonenull-
embedding_biasTensor | Nonenull-
end_idint | Nonenull-
exclude_input_from_outputboolTrue-
frequency_penaltyfloat | Nonenull-
guided_decodingGuidedDecodingParams | Nonenull-
ignore_eosboolFalseyes
include_stop_str_in_outputboolFalse-
length_penaltyfloat | Nonenull-
logits_processorLogitsProcessor | list[LogitsProcessor] | Nonenull-
logprobsint | Nonenull-
lookahead_configLookaheadDecodingConfig | Nonenull-
max_tokensint32-
min_pfloat | Nonenullyes
min_tokensint | Nonenullyes
nint1yes
no_repeat_ngram_sizeint | Nonenull-
pad_idint | Nonenull-
presence_penaltyfloat | Nonenull-
prompt_ignore_lengthint | Nonenull-
prompt_logprobsint | Nonenull-
repetition_penaltyfloat | Nonenullyes
return_context_logitsboolFalse-
return_encoder_outputboolFalse-
return_generation_logitsboolFalse-
return_perf_metricsboolFalse-
seedint | Nonenull-
skip_special_tokensboolTrue-
spaces_between_special_tokensboolTrue-
stopstr | list[str] | Nonenull-
stop_token_idslist[int] | Nonenull-
temperaturefloat | Nonenullyes
top_kint | Nonenullyes
top_pfloat | Nonenullyes
top_p_decayfloat | Nonenull-
top_p_minfloat | Nonenull-
top_p_reset_idsint | Nonenull-
truncate_prompt_tokensint | Nonenull-
use_beam_searchboolFalse-