ドメイン特化型マルチモーダル生成 AI の学習プロセス

Опубликовано: 11 Июль 2026
на канале: Google Cloud Japan
695
13

生成 AI の中でも Transformer をベースとした大規模言語モデル(LLM)は私達の予想を大きく超える能力を獲得し、ビジネスでも使われるようになってきました。
それに伴ってテキストだけを扱う LLM だけでなく、LLM を拡張した映像も同時に扱える Vision language mode(VLM)の需要がますます増加しています。
本セッションでは、弊社が開発した Heron という VLM を学習するライブラリを GCP 環境でどのように開発してきたかを紹介します。
Heron は様々な画像エンコーダや大規模言語モデル、日本語データセットを組み合わせて分散学習を行うことができ、
基盤モデルの作成からドメイン特化のファイン チューニングまで簡単に行うことができます。
GCP をフル活用した学習環境の構築から学習テクニックに加え、どのように学習データを収集して管理したのか、
どのように評価セットを構築してモデルの性能を評価したのかなど、VLM の活用に向けたより実践的な方法を紹介します。
映像も一緒に扱えるマルチモーダルな LLM、VLM に興味のある方であれば誰でも参考にしていただけるような内容になるかと思います。

スピーカー:
Turing株式会社 山口 祐 氏

Google Cloud Next Tokyo ’24 ウェブサイト:
https://cloudonair.withgoogle.com/eve...

Google Cloud Japan 公式 YouTube チャンネル:
   / googlecloudjapan  

Google Cloud Japan 公式 X:
https://x.com/googlecloud_jp

#GoogleCloudNext