巨大な折り紙状のニューラルネットワークが漏斗を通り、小型デスクトップ横のメモリへ収まる明るい編集イラスト

Editor’s Note

Xピックアップ

Qwen3.8-Flash、125Bモデルを75GB RAMでローカル実行可能と紹介

2026年8月27日
2分
AI観測
一次情報@alibaba_qwen on X
#Qwen3.8-Flash#ローカルAI#オープンモデル#Unsloth

QwenがXで、125B規模のQwen3.8-Flashを75GB RAMでローカル実行できると紹介した。大規模モデルを手元で動かしたい人にとって、必要なメモリ量が具体的に示されたのが今回のポイントだ。

UnslothのGGUFでローカル実行

Qwenの投稿は、Unslothによる公開初日からの対応を取り上げたものだ。引用元のUnslothは、125BのMoEモデルを同社のGGUFで75GB RAM上に載せられると説明している。さらにQwen3.8-Flash-Nextでは、CPU RAMやユニファイドメモリを使う構成でもVRAMに近い速度を狙えるという。

ここで大事なのは、これらがUnsloth側の実行報告と説明だという点だ。Qwen自身も75GBでのローカル動作を紹介しているが、投稿だけでは量子化の設定、具体的なハードウェア、実測速度までは分からない。手元の環境で同じ結果になるかは、公開されたガイドとGGUFの条件を確認して判断したい。

大きなモデルの選択肢が少し広がる

ローカル実行では、モデルの性能だけでなく「自分の機材に載るか」が最初の関門になる。125Bという規模に対して75GBという目安が出たことで、CPU RAMや共有メモリを多く積んだマシンも検討対象に入りやすくなる。一方、載ることと快適に使えることは別だ。速度や用途ごとの使い勝手は、これから出てくる実機報告を見たい。

参照したX投稿

関連記事