PoC #13 — Plamo-2-translate (PFN 日本特化 LLM + WebGPU + AWQ-INT4) v1
Preferred Networks の日本特化 8B LLM (Plamo-2) を翻訳特化 fine-tune し AWQ-INT4 量子化した yufuin/plamo-2-translate-AWQ-INT4-ONNX-WEBGPU を実行。PoC #7/#8 で阻まれた JS Heap 1GB / MatMulNBits 全てを WebGPU + 独自ヘルパー経由で回避する本命候補。
📚 PoC #13 の狙い: これまでの全障壁 (F13/F14/F17/F19/F20) を別経路で全部回避できるか実機検証。
F5 (実装前確認・✅ 完了):
- yufuin/plamo-2-translate-AWQ-INT4-ONNX-WEBGPU 公式配布
- ヘルパーモジュール
plamo2_onnx_for_webgpu_module.mjs (857行) を同梱配信 (HF Hub CORS 制限回避)
- API:
AutoTokenizer + AutoModel + attachPlamo2GenerateFastPath + buildPlamo2TranslationPrompt
- WebGPU 必須 (WASM 経路は CPU メモリ不足で使用不可・公式明記)
- WebGPU bufferSize 1GB 以上必須 (Pixel 8a 4GB なので余裕)
- 動作確認: Chrome / Firefox 146 (Firefox 147/148 は計算崩壊)
- 🟡 PLaMo Community License + 「Built with PLaMo」明示必須 (商用可否は要確認・Q-PLAMO-LIC)
⚠ F1/F6/F19/F20 リスク (楽観煽らない):
- 🟡 「全障壁を回避できる」は仮説・実機検証で初めて確認
- 🟡 [1, 8] sequence 制約 (Scan 8 step 固定展開) はヘルパー側で自動処理されるはず・実証必要
- 🟡 推論時間: 8B モデル相当の重さの可能性 (AWQ-INT4 で軽量化されているが要実測)
- 🟡 出力 decode 時に
<|plamo:op|> 特殊トークン処理が必要
- 🟡 Plamo-2 ヘルパーは transformers.js v4.0.0-next.4 を前提に設計 → v4.0.1 で動く保証なし
Built with PLaMo (PoC #13 / diary-shadow / 2026-05-25)