@basetenlabs/client - v0.2.0
    Preparing search index...

    Interface ModelTRTLLMRuntimeConfiguration

    interface ModelTRTLLMRuntimeConfiguration {
        batch_scheduler_policy?: ModelTRTLLMBatchSchedulerPolicy;
        enable_chunked_context?: boolean;
        kv_cache_free_gpu_mem_fraction?: number;
        kv_cache_host_memory_bytes?: number | null;
        lora_cache_gpu_memory_fraction?: number | null;
        lora_cache_host_memory_bytes?: number | null;
        lora_cache_max_adapter_size?: number | null;
        lora_cache_optimal_adapter_size?: number | null;
        request_default_max_tokens?: number | null;
        served_model_name?: string | null;
        total_token_limit?: number;
        webserver_default_route?:
            | "/predict"
            | "/v1/embeddings"
            | "/rerank"
            | "/predict_tokens"
            | null;
        [k: string]: unknown;
    }

    Indexable

    • [k: string]: unknown
    Index
    batch_scheduler_policy?: ModelTRTLLMBatchSchedulerPolicy
    enable_chunked_context?: boolean
    kv_cache_free_gpu_mem_fraction?: number
    kv_cache_host_memory_bytes?: number | null
    lora_cache_gpu_memory_fraction?: number | null
    lora_cache_host_memory_bytes?: number | null
    lora_cache_max_adapter_size?: number | null
    lora_cache_optimal_adapter_size?: number | null
    request_default_max_tokens?: number | null
    served_model_name?: string | null
    total_token_limit?: number
    webserver_default_route?:
        | "/predict"
        | "/v1/embeddings"
        | "/rerank"
        | "/predict_tokens"
        | null