日本語を鍛えたら英語も伸びた?「Swallow 70B」の意外な結果
- 公開
- 正式公開 2024-10-08(v0.2 は 2024-11-11、v0.3 は 2024-12)
- 作り手
- Swallow LLM team(チーム)
- 対応
- Hugging Face(モデル配布)・NVIDIA NIM(Instruct v0.1)
- 言語
- 日本語・英語
- 価格
- 記載なし(Llama 3.1 ライセンスのもとで研究・商用利用可)
どんなアプリか
Llama 3.1 Swallow は、Meta の Llama 3.1 をもとに、英語の能力を保ちながら日本語の能力を強化した大規模言語モデルで、8B と 70B のモデルがあります。開発したのは、東京科学大学情報理工学院の岡崎研究室・横田研究室と、産業技術総合研究所の研究チームです。
Llama 3.1 の 8B と 70B のベースモデルに、語彙を増やさずに継続事前学習をかけたものがベースモデルです。それに教師ありファインチューニングをかけた対話向けの指示チューニングモデル(Instruct)もあります。重みは Hugging Face で公開されており、Instruct v0.1 の 8B と 70B は NVIDIA NIM のサービスとしても同時に公開されました。
学習には、Common Crawl のアーカイブから日本語のページを抜き出した日本語ウェブコーパス「Swallow Corpus Version 2」を使っています。さらに、学術分野の Wikipedia 記事に近い「教育的」なテキストを分類器で選び出し、一般教養の問題に強くなるよう工夫しています。
日本語を学習させても英語の能力が落ちにくいよう、学習データの配合も調整しています。英語の理解・生成タスクの平均スコアは、継続事前学習の前と比べて 8B では 0.6 ポイントの低下にとどまり、70B では逆に 1.4 ポイント上がりました。
開発チームによる評価では、8B Instruct v0.3 の日本語 MT-Bench の平均スコアは 0.6424 で、13B 以下の日本語 LLM の中で上位に入っています。70B のベースモデルの日本語理解・生成タスクの平均スコアは 0.5932 で、Qwen-2.5 72B の 0.6232 を下回りました。
Swallowプロジェクトでは、幅広い用途で利用できるように、また必要に応じて応用に特化したファインチューニングを行いやすいように、特定のタスクを性能を上げるのではなく、汎用性の高い大規模言語モデルを目指しています。
Swallow チーム、Llama 3.1 Swallow 公式サイト「性能」
これまでの更新
2024-10-08 に、8B と 70B のベースモデルと Instruct の v0.1 を公開しました。2024-11-11 には 8B の v0.2 とその Instruct 版を公開し、日本語とプログラムコードの学習データの品質を改善して、日本語と英語の配合比率を見直しました。
2024-12-23 に 8B Instruct v0.3 を公開しました。新しいデータで指示チューニングをやり直して日本語のマルチターン対話の能力を改善し、日本語 MT-Bench の平均スコアは v0.2 から 8.4 ポイント上がりました。2024-12-30 には同じデータで指示チューニングした 70B Instruct v0.3 を公開しています。
同じ分野のアプリ
| 名前 | 型 | 仕掛け | 対応 | 料金 |
|---|---|---|---|---|
| Llama 3.1 Swallow(8B / 70B) | 継続事前学習 | Llama 3.1 の英語の能力を保ちながら日本語を強化 | Hugging Face / NVIDIA NIM | 記載なし(Llama 3.1 ライセンス) |
| Qwen2.5 Bakeneko 32B/DeepSeek R1 Distill Bakeneko/QwQ Bakeneko | 継続事前学習 | Qwen2.5-32B に日本語継続事前学習をかけ、指示チューニング版・蒸留マージ版・推論版をそろえる | Hugging Face | 無料(Apache-2.0) |
| Lightblue/DeepSeek-R1-Distill-Qwen-7B-Japanese | 推論型 | DeepSeek-R1 の蒸留モデル(Qwen 7B)に日本語の追加学習 | Hugging Face(モデル配布) | 無料公開 |
| LLM-jp-3 MoE(8x1.8B / 8x13B) | MoE | 学習データまで公開する LLM-jp-3 シリーズの Mixture of Experts 版 | Hugging Face | 無料(Apache-2.0) |
| PLaMo 2 1B / 8B | SSM 採用 | Transformer に加えて状態空間モデル(Samba 系)を採用した小型版 | Hugging Face | 1B は Apache-2.0、8B は PLaMo community license |
入れる前に
ライセンスは Meta の Llama 3.1 ライセンスを引き継いでいます。指示チューニング済みの Instruct モデルを使う場合は、それに加えて Gemma 利用規約の利用制限にも反しないことが条件です。この範囲であれば、研究にも商業目的にも使えます。
公式サイトでは、これらのモデルは「より性能の高いモデルが開発・公開されている」旧型として扱われています。Instruct を使う場合、開発チームは 8B では v0.3 を勧めています。70B は、ABCI 2.0 の運用が 2024年10月末に止まった影響で、新しいバージョンを作れない状況が続いていると説明されています。
開発チームが出している日本語 MT-Bench のスコアは、採点に使う GPT-4 のバージョンが違うため、外部のリーダーボードより低く出ることが確認されています。ただし、モデル同士の順位はほとんど変わらないと説明されています。