ゆるラジオindex 編集部より
AIの開発現場は、想像よりずっと泥臭い場所でした。
大規模言語モデルシリーズの第3回です。学習に使うデータをどう集め、どう掃除しているのかを開発者に聞きます。
子守りという言葉が出てきたあたりから、AIが妙に人間くさくなります。
この回の内容
- 0:00データ王に俺はなる!!!
- 1:02コモン・クロールは海賊王の上位互換
- 5:30データの泥を取り除く
- 16:58大規模言語モデルの子守りは大変
- 20:54大規模言語モデルにも学校教育が必要
- 25:23泥臭い努力が大きなものを生む
- 29:51一番恥ずかしい思いをしたのはどっち?
この回に出てくる言葉
番組でくり返し語られる言葉です。押すと、その語が話題になった回が並びます。
この回で紹介された本・参考文献
- 大規模言語モデル入門
- 大規模言語モデル開発における日本語 Web 文書のフィルタリング手法の検証榎本 et al., 言語処理学会 2024
- ONE PIECE
- ichikara-instruction LLMのための日本語インストラクションデータの作成
- ゲンロン戦記
