2026-01-01から1年間の記事一覧

vLLMにReasoning Budget(推論トークン上限)を追加

Qwen3.5 は Reasoning 有り無しを選べ、VLM も兼ねるとても賢いモデルなのだが、とにかく Reasoning が長く、現実的な応答時間を考えると nothink で使わざるを得なかった。 最近 llama.cpp に reasoning-budget 機能が入り、vLLM にも期待されるが、 issue …