Waymo、AIプロジェクトはモデル性能ではなく評価の成熟度で準備完了を判断
At Waymo, an AI project isn't ready until its evals are — not when the model performs well
記事のポイント
📰ニュース
Waymoは、AIプロジェクトの準備完了をモデルの性能ではなく、評価(evals)の成熟度で判断する「評価中心開発」を採用しています。
🔍注目ポイント
AIの安全性と信頼性を確保するため、評価を開発プロセスの核とし、継続的なテストと検証を重視する独自の開発手法を確立しています。
🔮これからどうなる
AIを導入する企業は、Waymoの手法を参考にすることで、より安全で信頼性の高いAIシステムを構築し、顧客の安全やビジネスリスクを低減できます。
Waymoは、自動運転車という高いリスクを伴うAIを扱うため、評価を単なる最終チェックではなく、開発の初期段階から組み込んでいます。
これにより、2億2千万マイル以上の完全自動運転を達成し、人間のドライバーと比較して重大な衝突事故による負傷を17分の1に減らしました。
評価はモデルトレーニング中から展開後まで継続され、実際のビジネス成果と結びつけて行われます。
これにより、2億2千万マイル以上の完全自動運転を達成し、人間のドライバーと比較して重大な衝突事故による負傷を17分の1に減らしました。
評価はモデルトレーニング中から展開後まで継続され、実際のビジネス成果と結びつけて行われます。
自動運転のような高リスクなAIでは、評価の重要性が改めて示されましたね。この「評価中心開発」は、私たちの生活に関わるAIプロダクトの信頼性を高める上で非常に参考になりそうです。