AI News HubLIVE
站内改写3 分钟阅读

根据哈佛商学院在线课程,专业人士应了解的数据科学和AI知识

了解为什么明确的业务目标、数据质量、简单的模型、仔细的验证、现实的成本以及人类判断力比追逐最新技术更重要。本文融合了哈佛商学院教授Iavor Bojinov的见解和数据科学从业者Abid Ali Awan的经验。

来源KDnuggets作者: Abid Ali Awan

数据科学和人工智能并非数据科学家的专属领域。任何专业人士都可以从中受益,前提是理解这些技术的能力、局限性和评估方法。本文结合了哈佛商学院教授Iavor Bojinov的见解与数据科学从业者Abid Ali Awan的实践经验,为专业人士提供了一份实用的数据科学与AI素养指南。

首先,明确要解决的业务问题。不要为了使用AI而使用AI。例如,与其说“我想用AI做客户分析”,不如说“我想识别可能流失的客户,以便客服团队及时干预”。这会将模型与可衡量的结果和实际行动联系起来。Bojinov强调,AI应被视为决策的输入而非替代品,专业人士需要理解其能力与局限,验证其建议,并专注于更好的业务成果。

其次,重视数据质量。在训练模型之前,先进行探索性数据分析:检查缺失值、重复记录、异常值和潜在偏差。一个模型即使准确率高达95%,也可能毫无意义——比如在只有5%客户流失的情况下,预测所有客户都不会流失。因此,专业人士应质疑指标是否真正反映业务目标,而不是被一个漂亮的分数迷惑。数据准备包括处理缺失值、修正格式、去除重复、转换类别、选择有用特征以及分离训练集和评估集。改善数据往往比用复杂模型替代简单算法带来更大收益。

选择模型时,坚持“简单有效”原则。对于结构化数据(如客户记录、交易数据),回归或决策树往往比通用大语言模型更合适。大语言模型擅长语言类任务,如总结文档、提取信息、生成初稿或分析客户反馈,但对于预测、分类和表格数据,传统机器学习可能仍是更佳选择。在选择模型前,应比较预测性能、训练和推理成本、速度、可扩展性、可解释性、维护需求以及错误预测的代价。一个稍微更准确的模型如果更昂贵、更难解释或维护,不一定是更好的选择。

验证必不可少。用未参与训练的数据评估模型,并确保评估数据代表模型将面对的客户、市场和条件。部署后应持续验证,因为客户行为、市场环境和数据管道都可能变化。Bojinov指出,验证和测试薄弱是常见错误,组织可能因不当测试而对结果过度自信。专业人士应询问模型如何评估、它犯什么错误、测试数据是否具有代表性,以及性能将如何长期监测。信任应来自证据,而非系统看起来多先进或多自信。

客户分析不应仅停留在仪表盘上。仪表盘显示发生了什么,预测模型估计接下来可能发生什么,实验则帮助确定应采取什么行动。预测客户可能流失只有在公司有现实的留存策略时才变得有价值,并且必须衡量干预是否真的有效。专业人士应避免混淆相关性与因果关系,采用实验思维,测试干预措施,衡量结果,并从证据中学习。目标不是产生更多预测,而是做出更好的决策。

大语言模型使AI更加普及,可用于编程、研究、语法改进、信息总结、创意生成和学习新事物。然而,流畅自信的语言并不等同于事实准确性。大语言模型可能误解上下文、依赖过时信息、编造来源、产生错误代码或忽略安全漏洞。我从不盲目信任它们的输出,而是检查重要声明、审查代码、测试功能并检查安全问题。我将LLM视为助手而非权威,任务后果越严重,输出审查越应仔细。

根据Bojinov的观点,数据素养、实验思维和批判性评估AI输出的能力将随着这些工具的广泛使用而变得越来越有价值。专业人士无需成为AI专家,但需要足够的熟练度来提出正确问题、解释证据、识别薄弱或不可靠的输出,并理解何时可以信任答案。最终,脱颖而出的专业人士将是那些能将技术理解、领域知识和健全商业判断相结合的人。

许多公司因不想落后而急于在各方面加入AI,但可能在没有先问AI是否真正是正确解决方案的情况下,在API、基础设施、培训和维护上大量花费。热潮终将退去,公司将学会AI在哪里增加真实价值,哪里人类仍然至关重要,以及哪里更简单便宜的解决方案就足够了。成功的数据科学和AI项目不是从最新模型开始的,而是从清晰的问题、可靠的数据、适当的评估、现实的成本以及将结果转化为行动的计划开始的。目标不是到处使用AI,而是有目的地使用它,仔细验证它,并将其应用于真正改进决策的地方。

Abid Ali Awan (@1abidaliawan) 是一位认证的数据科学专业人士,热爱构建机器学习模型。目前他专注于内容创作,撰写关于机器学习与数据科学技术的技术博客。他拥有技术管理硕士学位和电信工程学士学位,愿景是利用图神经网络为有心理健康问题的学生构建AI产品。