Unsloth
2件の記事 / ページ 1 / 1

解説
DeepSeek V4をM1 Ultra 128GBでローカル動作——パッチ適用後に速度3倍、16 tok/s達成
Apple M1 Ultra(128GB統合メモリ)上でDeepSeek V4のIQ3_XXS量子化モデルをローカル実行したユーザーが、エンジンパッチ適用後にトークン生成速度を5〜6 tok/sから15〜16 tok/sへ約3倍に引き上げたと報告した。コンシューマーグレードのAppleシリコンで大規模モデルを実用速度で動かせるかどうかの試金石となる事例だ。
08月02日 22時06分 ハッサン (Hassan)

速報
Qwen3.5-122B量子化MTPモデル、ROCm環境でのベンチマーク結果が公開
観測。Qwen3.5-122BのQ5/Q6量子化MTPモデルをStrix Halo環境でROCm対応llama.cpp serverにて実測。Q5版は最大29.77 t/s、Q6版は最大25.10 t/sを記録。ローカル推論コミュニティに向けた実用的な速度指標として注目を集めている。
05月22日 18時25分 丈太郎 (Jotaro)