ハーバード・ビジネス・スクール・オンラインが指南する、データサイエンスとAIについてプロフェッショナルが知るべきこと
明確なビジネス目標、データ品質、シンプルなモデル、慎重な検証、現実的なコスト、人間の判断が、最新技術を追いかけることよりも重要である理由を学びます。ハーバード・ビジネス・スクール教授のIavor Bojinov氏とデータサイエンス実践者Abid Ali Awan氏の知見を融合。
データサイエンスと人工知能(AI)は、データサイエンティストだけのものではありません。専門家であれば誰でも、これらのテクノロジーの能力、限界、評価方法を理解することで恩恵を受けることができます。本記事は、ハーバード・ビジネス・スクール教授Iavor Bojinov氏のインタビューと、データサイエンス実践者Abid Ali Awan氏の経験を基に、専門家向けの実用的なデータサイエンス・AIリテラシーガイドを提供します。
まず、解決すべきビジネス上の問題を明確にします。AIを使うこと自体が目的になってはいけません。例えば、「AIで顧客分析をしたい」ではなく、「離脱しそうな顧客を特定し、サポートチームが連絡を取れるようにする」という具体的な目標を設定します。これにより、モデルを測定可能な結果と実際のアクションに結びつけることができます。Bojinov氏は、AIは意思決定へのインプットとして扱うべきであり、判断の代替品ではないと強調します。専門家はその能力と限界を理解し、推奨事項を検証し、より良いビジネス成果に焦点を当てるべきです。
次に、データの品質を重視します。モデルを訓練する前に、探索的データ分析を行います。欠損値、重複レコード、異常値、潜在的なバイアスをチェックします。たとえモデルの精度が95%でも、顧客離脱が5%しかない場合に全員が残ると予測するモデルは実質的に無価値です。専門家は、指標が実際のビジネス目標を反映しているかどうかを問うべきであり、見栄えの良いスコアだけに頼るべきではありません。データ準備には、欠損値の処理、フォーマットの修正、重複の削除、カテゴリの変換、有用な特徴の選択、訓練データと評価データの分離が含まれます。データを改善することは、単純なアルゴリズムをより複雑なモデルに置き換えるよりも大きな利益をもたらすことがよくあります。
モデル選択では、「シンプルで効果的なもの」を選びます。顧客記録や取引データのような構造化データには、回帰モデルや決定木の方が適していることがよくあります。大規模言語モデル(LLM)は、文書の要約、情報抽出、ドラフト生成、顧客フィードバック分析などの言語関連タスクに役立ちますが、予測、分類、表形式データについては、従来の機械学習の方が適切な場合があります。モデルを選択する前に、予測パフォーマンス、トレーニングと推論のコスト、速度、スケーラビリティ、説明可能性、メンテナンス要件、誤予測のコストを比較します。わずかに精度が高いモデルでも、はるかに高価だったり、説明が難しかったり、メンテナンスが困難だったりする場合は、必ずしも良い選択とは限りません。
検証は不可欠です。訓練に使用していないデータでモデルを評価し、評価データがモデルが直面する顧客、市場、条件を代表していることを確認します。デプロイ後も検証を継続します。顧客の行動、市場、データパイプラインは変化する可能性があり、かつて有効だったパターンが信頼できなくなることがあります。Bojinov氏は、検証とテストの弱さを一般的な間違いとして挙げ、組織はモデルを適切にテストせずに導入すると、結果に過信する可能性があると指摘します。専門家は、モデルがどのように評価されたか、どのような間違いを犯すか、テストデータが代表的かどうか、パフォーマンスが長期にわたってどのように監視されるかを尋ねるべきです。信頼は証拠から来るべきであり、システムがどれほど先進的または自信を持っているように見えるかから来るべきではありません。
顧客分析はダッシュボードだけでは不十分です。ダッシュボードは何が起こったかを示し、予測モデルは次に何が起こるかを推定し、実験は組織が何をすべきかを判断するのに役立ちます。顧客が離脱する可能性があるという予測は、企業が現実的な維持戦略を持っている場合にのみ価値があり、介入が実際に機能するかどうかを測定する必要があります。専門家は相関と因果関係を混同しないようにすべきであり、実験的思考が価値を持ちます。介入が機能すると仮定するのではなく、テストし、結果を測定し、証拠から学ぶべきです。目標はより多くの予測を生み出すことではなく、より良い意思決定を行うことです。
LLMはAIをより身近なものにし、コーディング、リサーチ、文法改善、情報要約、アイデア生成、新しいことの学習に定期的に使用できます。しかし、流暢で自信に満ちた言語は事実の正確さと同じではありません。LLMはコンテキストを誤解したり、古い情報に依存したり、出典を捏造したり、誤ったコードを生成したり、セキュリティの脆弱性を見落としたりする可能性があります。LLMの出力を盲目的に信頼せず、重要な主張を検証し、生成されたコードを検査し、機能するかテストし、セキュリティ問題をチェックします。LLMをアシスタントとして扱い、権威として扱いません。タスクの結果が重大であればあるほど、その出力をより注意深くレビューする必要があります。
Bojinov氏によると、データリテラシー、実験的思考、AI出力を批判的に評価する能力は、これらのツールが広く使われるにつれてますます価値が高まります。専門家はAIの専門家になる必要はありませんが、適切な質問をし、証拠を解釈し、弱いまたは信頼できない出力を認識し、いつ答えを信頼できるかを理解するのに十分な流暢さが必要です。最終的に、際立つ専門家は、技術的理解、ドメイン知識、そして健全なビジネス判断を組み合わせることができる人々です。
多くの企業は遅れをとりたくないためにあらゆる場所にAIを追加しようと急いでいますが、AIが本当に正しい解決策であるかどうかを最初に問うことなく、API、インフラストラクチャ、トレーニング、メンテナンスに多額の費用を費やす可能性があります。誇大広告はやがて落ち着き、企業はAIがどこで真の価値を追加するか、どこで人間が不可欠であるか、そしてよりシンプルで安価な解決策で十分な場所を学ぶでしょう。成功するデータサイエンスとAIプロジェクトは、最新のモデルから始まるのではなく、明確な問題、信頼できるデータ、適切な評価、現実的なコスト、そして結果を行動に変える計画から始まります。目標はどこでもAIを使用することではなく、意図的に使用し、慎重に検証し、意思決定を真に改善する場所に適用することです。
Abid Ali Awan(@1abidaliawan)は、機械学習モデルの構築を愛する認定データサイエンス専門家です。現在はコンテンツ作成に注力し、機械学習とデータサイエンス技術に関する技術ブログを執筆しています。技術管理の修士号と電気通信工学の学士号を持ち、グラフニューラルネットワークを使用して精神的健康に苦しむ学生向けのAI製品を構築することを構想しています。