技能継承AIのデータ収集設計——音声・動画・テキストの使い分け
「動画を撮ったら、あとはAIが学習してくれる」——こう考えていませんか。
たとえば、こんなケースを考えてみてほしい。20年のキャリアを持つ熟練溶接工が定年退職する前に、工場長はスマートフォンで全作業を撮影した。計50時間分の映像データをAIに学習させたが、新人の溶接品質はなかなか上がらない。後からわかったのは、熟練工が「なぜその角度で溶接するのか」「このわずかな焦げ臭いは止め時のサインだ」という判断の根拠を、一度も口にしていなかったことだった。
AIに技能を継承させるとき、動画は「何をしているか」は記録できても、「なぜそうするのか」は記録できない。この違いを理解しないまま設計したデータ収集は、AI技能継承プロジェクトがつまずく原因になりやすい。
本記事では、音声・動画・テキストという3つのモダリティ(データの種類。音声・映像・文字など、AIに与える情報の形式のこと)をどう組み合わせるかという「収集設計」の全手順を、中小製造業でも実践できる形で解説する。
先に前提をはっきりさせておきたい。中小製造業が実際に取り組むのは、自社でAIモデルを学習させることではなく、生成AIに参照させるナレッジを整えること(RAG:社内文書をAIに検索・参照させる仕組み)である場合が多い。本記事の手順も、そちらを前提にしている。モデルを一から学習させるならデータ量が桁違いに必要になるが、参照させるだけなら「判断が言語化されて検索できる状態」まで持っていけば足りる。

熟練技術者の知識を次世代へ:データ収集設計が技能継承の成否を左右する
なぜ「動画だけ」では技能が継承できないのか
動画が記録できるのは「外から見える動作」だけだ。溶接の角度・速度・力加減といった物理的な動きは映像で確認できる。しかし技能の本質は、動作の背後にある「判断」にある。
熟練工が暗黙のうちに行っている判断は、主に3つの層に分かれる。
- 感覚判断:「このときの音は正常だ」「少し焦げ臭いのは素材の違いだ」という五感を使った判断
- 文脈判断:「この工程は前工程のミスを補正している」という工程間の関係性の理解
- 例外処理:「今日の湿度では設定を変えるべき」という環境変化への対応
これらはほとんど、動画に映らない。だから動画だけを与えたAIは「標準的な動作」を再現できても、「なぜその動作なのか」という文脈を持てない。
3つのモダリティで「行動」「判断」「基準」を分けて記録することが、AI技能継承の設計原則になる。
音声・動画・テキストの役割分担
それぞれのモダリティが何を記録するのかを明確にしてから収集に入ることが、設計の第一歩だ。
動画が担う役割:「行動の記録」
| 記録対象 | 具体例 |
|---|---|
| 作業動作 | 工具の持ち方、力の方向、操作スピード |
| 作業順序 | 工程の前後関係、どのタイミングで確認するか |
| 非言語情報 | 視線の向き、手の止め方、体の構え |
動画は「標準作業の記録」と「例外対応の記録」の2種類を別々に撮影する。例外対応(素材の硬さが違うとき、工具が摩耗したとき)は必ず熟練工に意識して再現してもらう。
音声が担う役割:「判断の記録」
| 記録対象 | 具体例 |
|---|---|
| 作業中のナレーション | 「今この抵抗感があるからあと2回転で止める」 |
| 判断根拠の口述 | 「音が変わったのは刃が当たったサイン」 |
| 注意点の説明 | 「ここで急がないと素材が冷えて硬くなる」 |
音声記録で最も重要なのは「なぜ」を口述させることだ。動画を撮りながら同時に音声でナレーションを入れる方法(シンクロナレーション)が最も密度が高い。
テキストが担う役割:「基準の記録」
| 記録対象 | 具体例 |
|---|---|
| 合否判断の数値基準 | 「表面粗さRa0.8以下で合格」 |
| チェックシート | 各工程で確認すべき項目と許容値 |
| 例外対応マニュアル | 異常が起きたときの判断フロー |
テキストは熟練工が「当たり前すぎて言わない」基準を引き出す作業でもある。「何を見て良し悪しを判断しているか」を聞き出し、数値や条件として言語化する。

3つのモダリティの役割分担:それぞれが異なる層の知識を記録する
現場で実践できるデータ収集の設計手順
以下の6ステップで設計を進める。
ステップ1:継承対象の絞り込み(所要時間:1〜2日)
「熟練工が持つ技能をすべて記録しよう」とすると失敗しやすい。まず「どの工程のどの判断が、現在の品質問題・歩留まり低下・若手育成の遅れに最も直結しているか」を特定する。最初の対象は2工程に絞る。
ステップ2:収集フォーマットの設計(所要時間:0.5〜1日)
各工程について、「何をどのモダリティで記録するか」の対応表を事前に作る。準備なしに撮影を始めると、動画には映っているが音声で判断根拠が入っていない、テキストには書かれているが動画と紐づいていない、という断片的なデータになる。
ステップ3:パイロット収集(所要時間:半日)
1工程を試験的に収集し、「この音声だと判断根拠が聞き取れない」「この角度だと操作が見えない」といった問題を先に発見する。パイロットなしで全量収集すると、後で使えないデータが大量に残る。
ステップ4:本収集(所要時間:工程数×0.5〜1日)
シンクロナレーション形式(作業しながら音声で実況解説)を基本とする。撮影者が熟練工の横で「なぜ今止めましたか?」「この音は何のサインですか?」と問いかけながら撮影すると、口述の質が大きく上がる。
ステップ5:テキスト構造化(所要時間:工程数×1〜2時間)
収集した音声・動画から抽出した判断基準をテキスト化する。この作業は熟練工本人に確認させながら行う。「AIが正しく解釈できる形」に直すのが目的であり、マニュアルを作るのとは異なる。
ステップ6:ナレッジデータの品質チェック(所要時間:0.5日)
3つのモダリティが「同じ判断場面」を記録しているかを確認する。バラバラに存在するだけでは不十分で、「この動画のこのフレームで、この音声の判断が発生し、このテキストの基準が適用された」という紐づけができていることを確認する。
技能継承AIの先行事例:力を入れているのは「判断の翻訳」
技能継承AIの先行事例を見ると、うまくいっているところが手間をかけているのは撮影ではない。判断を機械が扱える形に翻訳する工程だ。
**アルム株式会社(石川県)**は、CAD図面をCAM指示(機械が動くための加工指示)に変換する工程を自動化するAIソフト「ARUMCODE」を提供し、サブスクリプション型のクラウドサービス「ARUM Factory365」経由で国内200社超が自社のマシニングセンタに組み込んでいる。学習させたのは、部品の材料・形状・切削パターン・工具といった要素が互いにどう関係するかを収めたデータベースで、約400万件の切削条件をアルゴリズムの形にまとめた。2025年5月には杉野機械と共同開発したマシニングセンタ「TTMC Type F」を発売し、ARUMCODEと組み合わせて図面から完成品までの12工程を自動化、熟練者でなくても操作できる状態にしている。
注目すべきは、この会社が熟練者の作業を動画で撮って学習させたのではないという点だ。ソフトウェア開発を率いるゼネラルマネージャー自身が精密部品設計の出身で、独り立ちするまでに7年かかった判断を持っている。その役割を彼は「職人の勘を、それを数値に落とし込むプログラマーに向けて翻訳すること」と表現する。つまり力を入れているのは、本記事のステップ5(テキスト構造化)に当たる工程だ。
音声の使い方も示唆的だ。会話型AIインターフェース「KAYA」は次期機「TTMC Origin」向けに試作中で、Azure AI SpeechとAzure OpenAIで構築され、工具交換や加工物の位置替えを自然言語で手順案内する。音声は収集側ではなく、できあがった知識を使う側に置かれている(出典:Microsoft Source Asia、2026年3月)。
一方、音声・映像を「判断の記録」に変換する流れを構成として公開している例もある。AWSジャパンが公開した技能継承ソリューションは、ベテランがリモートから映像と音声で若手を支援し、その通話をAmazon Transcribeで文字起こし、Amazon Bedrockで要約してナレッジに追加する。次に同じ事象が起きたときは、蓄積されたそのテキストを検索して回答に使う。サンプルコードもGitHubで公開された(2024年11月。リポジトリは2026年4月にアーカイブ済みで、現在は参照用)。
ここでも音声は「撮って終わり」ではない。文字起こし→要約→検索できるテキスト、というところまでが一つの流れとして設計されている。収集設計を考えるときは、この「変換の出口」まで含めて描いておきたい。
よくある失敗パターンと対処法
失敗パターン1:「全部記録しよう」で量が多すぎる
熟練工の全作業を撮影した結果、50時間分の動画が手元に残り、誰も整理できない状態になる。対処:継承対象を絞り込んでから収集に入る(ステップ1を先に行う)。
失敗パターン2:音声が「何をしているか」の解説で終わる
「今、工具を当てています」「速度を下げました」という実況は、動画で見えている内容を言い直しているだけで、AIには新しい情報がない。対処:「なぜ」を問いかけながら撮影するか、撮影後に別途インタビューセッションを設ける。
失敗パターン3:テキストデータが既存マニュアルのコピー
「既存の作業手順書をそのままAIに参照させれば足りる」と思いがちだが、既存マニュアルは「標準手順の説明」であり「判断の根拠」ではない。対処:熟練工に「この手順書に書いていないが実際にやっていること」を追加で聞き出すインタビューをセットで行う。
失敗パターン4:モダリティ間の紐づけがない
音声・動画・テキストをそれぞれ収集したが、「どの音声がどの動画のどのフレームに対応するか」がわからない状態では、AIは「その場面でどの判断が働いたか」を結びつけられない。対処:収集フォーマット設計時に「紐づけ方法」を決めておく(タイムスタンプの記録、シーンIDの付与など)。

実際の収集セッション:熟練工の横で「なぜ」を問いかけながら撮影する
まとめ:最初の1週間でやるべきこと
AI技能継承プロジェクトがつまずく大きな原因は、「動画を撮れば継承できる」という思い込みではなく、「何を記録すれば継承できるか」を設計せずに動き出すことだ。
まず最初の1週間でやるべきことは3つだ。
- 継承したい技能を2工程に絞り込む(「全部継承」は後でいい)
- その2工程で「音声・動画・テキストのうち何を記録するか」の対応表を作る(A4一枚で十分)
- 熟練工に「なぜ」を問いかけるパイロット撮影を0.5日実施する
設計なしに動画撮影を始めてしまうと、後から「この映像からはAIが学べない」とわかっても、熟練工がすでに退職している可能性がある。
技能継承に使える時間は、熟練工が現役でいる間だけだ。収集設計に2日かけることは、2年分のやり直しを防ぐことになる。
「これ、AIでできない?」
業務の流れに落とし込みます。
相談内容をもとに、
AIで支援できそうな工程と、
人が確認すべきポイントを整理します。
まずは、分かる範囲で構いません。