一つ前のトピックでローカル LLM の話題を出したが、試していなかった。結論としては、自分の PC 環境(RYZEN AI MAX+ 395、Radeon 8060S、RAM 128GB。RAM 64GB 分を GPU 用に割り当て)では厳しかった。Ollama で Ryzen AI MAX+ 395 の Radeon 8060S を ROCm(Radeon Open Compute、AMD GPU 向けの計算基盤)経由で利用した。Ollama 自体はローカル LLM を動かすサーバーで、モデルを保存・読込して、GPU を使って推論結果を回答する。チャットとコード相談は Ollama の対話画面を使い、ファイルを読み書きする用途では OpenCode から Ollama に接続した。

用途と速度の良い塩梅を目指すために、モデルを使い分けている。Compaction を抑えるために、128K(131,072トークン)を扱えるようにした。その代わり、メモリ使用量が増える。正直、以下のモデルでは、どの用途でも自分が求める品質には届かなかった。

  • 通常チャット:Qwen3 8B
  • ファイル編集:gpt-oss 20B
  • コード相談:Qwen3-Coder 30B

ローカル LLM を動かすには PC が貧弱なので、かなり受け答えが遅い。試した感じでは、Claude が登場する前の LLM という感じだ。突破力がないし、融通の利かない受け答えやタスク実行をする。実装をまるっと任せられるレベルではない。性能向上を求めて Qwen3.5 35B(性能良いモデル)を試したが、音信不通になり、指示を無視し始めた。モデル交換で回答品質を上げたいが、ハードスペック不足でそれができない現状。

最適なモデルを探すのがそれなりに面倒なので、軽量モデルの登場か、PC 買い替え時期を待つことにする。次は RAM 容量が128 GB では足りないかもしれない。