Qwen3.5 は Reasoning 有り無しを選べ、VLM も兼ねるとても賢いモデルなのだが、とにかく Reasoning が長く、現実的な応答時間を考えると nothink で使わざるを得なかった。 最近 llama.cpp に reasoning-budget 機能が入り、vLLM にも期待されるが、 issue …
引用をストックしました
引用するにはまずログインしてください
引用をストックできませんでした。再度お試しください
限定公開記事のため引用できません。