十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI让科学家做得更多但更差?关键在于判断力

AI让科学家做得更多但更差?关键在于判断力 最近关于“AI让科学家做得更多但做得更差”的讨论在技术圈子里引起了不少波动。这个判断听起来有点反直觉因为过去一年里我们听到的几乎全是AI提效、AI自动化的好消息。无论是写代码、跑论文、做数据分析还是搭实验流程AI似乎都在把科研人员从繁琐劳动里解放出来。但“解放”的另一面可能不是“专注”而是“失控”。如果你在真实的项目里长期使用过AI工具你会对“做得更多、做得更差”这句话有很深的体感。批量产出想法、快速生成初稿、加速阅读和总结这些能力都真实存在。但同样真实的是结果需要反复验证、输出需要仔细审查、流程需要不断校准。很多时候AI确实让科研人员“多做了”但这个“多”是否等于“更好”要打一个很大的问号。这篇文章想认真聊一聊这个问题。我会把“做得更多但做得更差”拆成几个具体现象分析背后的机制再给出一套我认为更合理的使用框架。文章不会否定AI的价值但会指出一个关键事实AI不是替你做科研而是把你的工作量从“执行”转移到了“判断和筛选”。如果你的判断力没有跟上AI带来的就不是效率而是噪声。1. 先搞清楚“做得更多”和“做得更差”分别指什么这句话听起来像是一句抽象判断但放在真实工作流里它有非常具体的含义。要理解AI对科研工作的真实影响先得把这两个概念拆开。“做得更多”指的是科研人员单位时间内能产出的动作变多了。以前读一篇论文可能要半天现在用摘要工具辅助阅读一小时能看十几篇。以前写一段实验方法描述要反复斟酌措辞现在输入几个关键词几秒钟就能生成一段像模像样的初稿。以前需要手写代码做数据清洗现在一个提示词下去Python脚本直接生成。这些动作量的增加是AI带来的真实收益不需要怀疑。但“做得更差”也不是指AI生成的内容质量一定差而是指科研人员在产出结果之后对结果的理解和控制能力变弱了。简单说你可以更快地生成一段代码、一段结论、一个图表、一篇综述但你是否清楚这段代码每一步在做什么你是否能解释结论背后的统计假设你是否能判断这篇自动生成的综述遗漏了哪些关键文献如果不能那么你只是在生产文本和输出物而不是在推进认知。更麻烦的是这种状态会积累成一种“伪效率”。你感觉自己完成了大量工作但真正可复现、经得起审视、融入研究逻辑的部分可能少得可怜。你只是把工作量和产出物堆在了评审者面前而这些产出物是否经得住推敲往往要等几周甚至几个月之后才暴露出来。这里就出现了一个核心矛盾AI极大降低了“生成”的边际成本但“验证”和“判断”的成本没有降低甚至因为生成量变大而变高了。我在多个真实项目里观察到的规律是没有使用AI工具的人会把大量时间花在“动手做”上面而深度使用AI的人时间被重新分配到了“检查AI做了没有”“检查AI做得对不对”“检查AI这样做会不会引入偏差”上面。表面上产出多了实际上你的认知带宽并没有被释放只是被换了一个占用方式。1.1 具体来看AI让科研人员“多加”了哪些环节过去做论文调研核心动作是读。现在做论文调研核心动作变成了搜、筛、读、交叉验证。AI帮你搜到了更多相关论文甚至还帮你做了摘要看起来你“调研了更多材料”但问题是你无法判断摘要是否准确把握了原文的核心贡献也无法判断搜索引擎的语义匹配是否真的覆盖了领域内的重要文献。过去做数据图表核心动作是写代码、调参数、看结果。现在你让AI生成图表代码跑出图之后你还需要核实坐标轴对不对、数据有没有被错误处理、图注是否准确。看起来你“做完了更多分析”但你实际投入的认知成本没有消失只是从“编码”转移到了“审查”。过去写论文草稿核心动作是组织逻辑和表达。现在你先让AI生成一段草稿再逐句修改、查证、补充。看起来你“写出了更多段落”但你的精力和时间消耗并不比直接动笔少多少。尤其涉及专业术语和论证严密性时AI初稿往往需要大改改完之后还得回头检查有没有引入不准确的表述。这些现象说明一件事AI并没有真正减少科研人员的工作量它只是改变了工作量的结构。你可以把它理解为“生成外包判断自持”。如果你能够承接住更重的判断任务你的科研质量才有机会提升如果你只是把生成结果直接当作最终结果那“做得更多”就一定会导向“做得更差”。1.2 为什么“多”和“差”会同时出现最核心的原因在于科研并不仅仅是“产生文本”的过程它更是一个“建立可信链条”的过程。一篇论文的价值不在于句子多漂亮而在于它的结论能经得起复现、逻辑能经得起推敲、数据能经得起验证。AI擅长的是生成符合语言模式的内容但不擅长生成“已经被验证过的真实结论”。当你的产出速度提高之后你实际上是不断向自己的认知流程里注入未经验证的噪声。如果你没有严格的复核机制这些噪声就会成为下一轮生成的输入然后再被放大。这就形成了一种“垃圾进、垃圾出”的循环。你可能花了更少时间写出了一篇看起来很完整的初稿但你需要花更多的时间去验证它、修正它、补充引用、核对数据。总体时间并没有减少而由于验证难度更高、工作量更隐蔽你最终可能选择“先这样吧”于是质量真的变差了。另一个原因是认知资源的有限性。人的注意力和工作记忆是有限的。以前你一篇文章读三遍每一遍都会更深地进入结构和论证逻辑。现在一上午浏览十几篇论文每篇只停留五分钟你获得的是宽而浅的覆盖而不是深而透的理解。当所有论文都变成了“快速摘要”和“关键段落高亮”你的学术判断力反而会因为缺乏深度阅读训练而退化。所以“做得更多但做得更差”不是AI的问题而是使用者把“生成的产出”错误地当成了“研究的成果”。深层原因在于我们没有及时建立起匹配AI生产速度的验证机制、筛选机制和暂停机制。2. AI真正改变的不是省时间而是科研工作的注意力结构要理解“做得更多但做得更差”这个现象需要看得更深一层AI并不是简单帮你省了时间而是彻底改变了你在科研流程中的注意力分配。在传统科研流程里注意力主要花在执行上。你要读原文、写代码、整理数据、写论文段落。这些执行性任务占用了大量时间但也天然约束了你的研究规模。AI介入后执行环节被压缩到极致。读论文可以靠摘要写草稿可以靠生成代码可以靠补全。于是注意力被释放出来了。但问题在于释放出来的注意力并没有消失它必须重新分配到新的环节上筛选AI生成的候选结果、判断哪个方向值得继续深入、验证输出是否可靠、跟踪每一步的推理链条。换句话说AI改变了注意力的结构而不是减少了对注意力的需求。它把科研人员的注意力从“做”转向了“选择”和“判断”。而选择与判断的难度并不比执行更轻松。真正的风险在于如果科研人员没有意识到这种结构变化就会沿用旧的“执行型注意力模式”来面对新的“判断型工作流”最终导致系统性的质量下滑。2.1 从“动手做”到“判断怎么做”的转变对科研新手更不友好对于资深研究员来说这种变化可能还在可承受范围内。他们脑子里已经有了很多验证过的知识框架、方法库和判断标准知道该在什么时候信任AI生成的结果什么时候必须停下来检查。但对于研究生和刚进入科研领域的新人这组变化带来的问题要大得多。新人的知识体系还不稳固缺乏判断信息可靠性的经验。他们也相对缺乏对某些实验方法、统计口径的直觉。当AI把大量看似合理的结果摆在面前时新人很容易进入“接受默认值”的状态。于是判断的重任落在了一个尚未建立判断能力的人身上。可以这样理解以前新手写代码遇到报错要去查资料这个过程虽然慢但会慢慢建立对系统运作逻辑的理解。现在AI直接给出“没问题版本”新手照着跑通之后对底层的异常处理、边界条件、资源占用可能完全没概念。一旦换一个数据集或者部署到别的机器问题立刻暴露。这时候你甚至说不出到底哪里出了问题因为你对整个流程的理解建立在“AI帮我填好了”的幻觉之上。所以我一直觉得AI工具在科研场景里更适合当一个“高级助手”而不适合当一个“替代品”。如果你已经知道自己要去哪AI能帮你把路修得更快如果你还不知道路怎么走AI只会帮你更快速地走到一个自己都不理解的地方。2.2 学术审查压力不减反增成为隐性瓶颈你可能会问AI生成的东西只要经过人工审查问题不就解决了吗理想状态下确实是这样。但现实中“审查”这个环节恰恰是当前科研流程中最薄弱、最容易被忽视的环节。原因很简单审查本身也需要消耗大量时间。你要逐行确认代码逻辑要回到原始论文里核对某个数据的来源要重新计算一遍统计量。而AI生成内容的速度远快于人工审查的速度。当产出端和审查端的速度差距越来越大产出端的“快速增加”就会迫使审查端不断压缩甚至跳过。于是你会看到很多现象论文里的参考文献可能是AI杜撰的图表代码看起来结构完整但隐藏着严重的数据泄露综述文章读起来非常流畅但缺少关键的方向性批判。这些都不是AI工具本身的问题而是流程失衡的必然结果。对于团队和科研机构来说这其实是一个非常值得重视的工程管理问题。就像一个团队开发软件如果编码速度无限提高而CI/CD、代码评审、测试覆盖没有同步改进那代码库的质量一定会快速劣化。科研工作也一样。AI提升了“写”的速度那“验”的能力也得同步加强。否则AI只会让问题暴露得更晚、更严重。这里补充一句类似的情况在工业生产中有很多先例。你引进一台速度更快的机器如果不变更质检流程那么产出的不合格品不会变少只会更多。AI在科研中的角色和高速机器在生产线上的角色其实非常相似。核心不是要不要用新机器而是新机器背后的流程是否同步演进。3. 从“生成能力强”到“判断能力强”才是AI时代科研的核心能力既然AI已经在生成能力上远超人类那科研人员的核心竞争力就只能往上游走。说得直白一点AI负责生成人负责判断。但“负责判断”这句话往往被说得很轻松实际上要做到它需要一套新的能力体系。这个能力体系不是指“更专业”而是指“更懂筛选、更懂验证、更懂丢弃”。这些能力传统科研训练里很少系统性地教授。大部分人是通过大量的论文阅读、实验试错和代码调试才慢慢积累出判断力的。但到了AI时代这种“试错积累”的路径正在被侵蚀——因为你的错误会被AI掩盖。比如你在跑一个数据分析流程AI主动帮你修复了一个数据格式错误。这个修复看起来很贴心但你没有看到修复过程就无法理解数据为什么报错。下一次换一个文件、换一个数据库你很有可能会卡在同样的位置因为你根本没有建立起格式问题的模式识别能力。AI帮你绕过了问题也帮你绕过了学习机会。所以在AI时代科研人员需要刻意训练的是“提问能力”“验证能力”和“边界感”。提问能力指的是你如何把模糊的调研需求拆成能让AI有效工作的具体指令。验证能力指的是你面对AI生成的结论能否追踪每一层推理、找到证据支撑、识别逻辑断裂。边界感指的是你知道什么时候该停止让AI生成回到人工深度阅读和思考上来。这里值得展开说一句这三个能力本质上是同一个能力的三个切面也就是“批判性思维”。但批判性思维不应该是抽象口号它必须落到具体的流程、动作和检查清单上。否则喊一百遍“批判性使用AI”也不会带来任何改变。3.1 我的判断AI不会替代科学家只会淘汰没有判断力的科学家从工程实践来看AI可以替代的是那些高度可预测、有标准答案的环节。但科研的核心不是执行标准答案而是提出还没有标准答案的问题并找到可靠的方法逼近答案。这个过程需要大量的模糊决策、权衡判断以及面对不确定性时的取舍。目前AI在这些方面还非常薄弱。但为什么说科研人员仍然有被淘汰的风险因为很多科研工作者的日常并不仅仅包括“提出新问题”和“创造新知识”还包括大量重复性、流程性、文档性的工作。比如整理文献、写综述初稿、生成常规图表、撰写标准化代码。这些工作在AI介入后确实可以大幅自动化。如果一个科研人员的主要价值集中在这些可自动化的环节那么AI对他的冲击会非常大。而如果你能够把自己的价值定位在“提出关键问题”“判断研究方向”“验证结论可靠性”这些不可自动化的事情上AI反而会成为你的放大器。所以“AI让科学家做得更多但做得更差”这句话更应该被理解成一道分界线一边是把自己当执行者的人他们会被AI加速带偏另一边是把自己当判断者的人他们能借由AI更快地获得候选输出然后投入更多精力做严格验证。前者的产出越来越多但越来越糙后者的产出越来越多但依然可信。学术界真正需要的是让更多人站到后者一边。3.2 这项能力不靠天赋靠刻意练习判断力不是天生的也不是“读了很多论文自动会有的”。它更像一种需要高频使用来维持的肌肉。你在多大程度上频繁进行“比较筛选”“推理验证”“来源追溯”这些动作你的判断力就会以多快的速度增长。这里可以给出一个建议每天给自己设置一个“不借助AI的深度阅读时间段”。哪怕只是读一篇文章也要完整地跟着作者的论证走一遍。去看看他的数据、图表、方法部分是怎么一步步支撑起结论的。这个动作看起来退步了但实际上是在训练你大脑内部的“验证模型”。有了这个模型你再去快速阅读AI生成的摘要、综述或分析才能快速判断哪些地方可疑、哪些地方需要回头深挖。如果把全部时间都交给AI速览你可能越来越熟练地“扫过”论文但理解深度会不知不觉下降。等到有一天你需要独立判断一个研究方向是否值得投入时你才发现脑子里没有足够的深层记忆可以从容地关联、比较和判断。到那时候AI生成再多的候选结论也只是在你没有土壤的认知场里不断播种注定长不出可靠的判断。这里我建议科研人员把日常使用AI的流程设计成“先提要求—生成结果—交叉验证—记录差异—复盘原因”这样一个闭环。每次都要记录AI给的答案和你自己的判断之间的距离。今天你容忍的距离可能很大但坚持两周后你会发现你能更快地发现AI输出中哪些部分是在“编造”、哪些是在“误导”、哪些是在“合理推测但缺少证据”。这种感知能力就是判断力的前身。4. 给科研人员一套可落地的AI使用框架聊完了“是什么”和“为什么”现在进入最关键的“怎么办”。在真实项目里我觉得可以执行一套非常清晰的框架。它不是特别复杂但需要科研人员重建自己的工作习惯。这套框架我概括为“三层筛选、两阶段复核、一个暂停键”。先说三层筛选。第一层是你向AI提需求之前先分清楚这是“探索型任务”还是“执行型任务”。探索型任务是开放性的比如“帮我梳理这个方向有哪些争议”这种任务不能只把AI输出拿过来当结论必须自己再去读几篇关键文献做校对。执行型任务则相对明确比如“把这个CSV文件按某列排序并输出统计值”这种任务可以给AI更大的自主权但还是要检查代码逻辑。第二层是生成结果之后做一个来源筛选。AI给出的结论哪些有明确来源哪些是在综合推理哪些看起来像合理推测但缺少依据判断这一步你可以关闭AI的联网功能去测试它的基础能力也可以要求AI在输出里指出“哪里是确定信息、哪里只是建议”。这部分虽然不能完全消除幻觉风险但可以明显降低你被误导的概率。第三层是你自己的投入筛选。不要把所有AI输出的结果都同等对待。优先验证那些与你研究核心结论强相关的部分。如果你的论文主结论依赖一个AI生成的数据分析结果你必须单独重新验证如果只是背景介绍或写作措辞可以适当放松。这才是把时间花在刀刃上的做法。再说两阶段复核。第一阶段是生成后的即时复核。你需要在AI输出之后立刻检查最明显的错误、格式问题、引用是否真实、数据口径是否一致。第二阶段是延迟复核。隔一天再回来看一次这份内容重点看它在你完整的论证链条里是否还成立。有时候AI生成的段落单独看没问题放进上下文里就发现少了一个前提假设、多了一个隐含偏见。这种问题只有延迟看才能发现。最后是“一个暂停键”。当你发现自己已经连续生成大量内容但真正理解的部分变少、检查的成本变得不可接受时就该按下暂停键回到传统的人工阅读、手动编码和纸笔整理流程里去。千万不要有“AI都做了我必须跟上它的速度”这种心态。科研不是赶工。4.1 具体到三类高频场景怎么执行这套框架代码生成场景。这个场景最容易让人掉入“跑通正确”的陷阱。AI生成的代码可能运行成功但没人仔细读过每一步。我建议在让AI写代码之前先自己明确目标数据格式、算法逻辑和边界条件。代码生成后至少手动审查一遍完整的输入输出示例。有条件的话用一小段测试数据跑一遍然后和预期结果对比。尤其要警惕那些“仅能跑通当前用例”的代码它们往往没有处理空值、类型转换、边界条件等工程问题。用“冷门数据测试用例”来验证比对AI说“没问题”有效得多。文献综述场景。AI可以帮助快速生成综述初稿但综述的核心是“综述者自己的判断”不是“文本流畅性”。执行上我建议让AI按“研究脉络—关键证据—争议点—空白点”四分法来做输出然后你自己重新整理一遍这些类别看看有没有遗漏。尤其要留意AI在总结某个研究时是否隐含地把“摘要结论”当成了“全文结论”这种错误非常常见但特别容易被忽视。你要反复追问来源并回到原始论文去做验证。数据分析场景。AI在数据清洗、统计建模、图表绘制方面都能帮上忙但最危险的隐患是“数据泄露”和“统计误用”。比如AI可能默认使用均值填补缺失值但这可能让方差被严重低估。也可能自动选择了逻辑回归而没有审视变量间是否存在共线性。因此数据分析场景的判断框架是无论AI给了什么结果都必须至少回答三个问题——样本代表性有没有问题统计方法假设是否满足结论的效应量和显著性是否一致回答不出来就不要急着把结果写进论文。5. 从“工具使用者”到“流程设计者”才是AI时代的科研进阶方向如果看完整篇文章只记住一句话我更希望是这句AI时代科研人员的核心竞争力不是生成能力而是判断能力。而判断能力最终会体现为流程设计能力——你如何设计一套可复用的工作流让AI的生成优势被保留同时人的验证判断被强制执行。这个观点听起来有点抽象但放到工程实践里非常具体。一个流程设计者会思考的不再只是“让AI写一段代码”而是“AI写出来的代码如何进入测试流程”不再是“让AI生成一段综述”而是“AI生成的综述如何经过基础事实核验”不再是“用AI去做统计分析”而是“什么样的数据能进入统计流程、统计结果如何独立复核”。这种流程设计能力不是从AI使用教程里学来的而是从实践经验、失败复盘和工程方法迁移中沉淀出来的。所以我非常不建议科研人员把时间花在追各种“AI新功能”上。新功能永远追不完。真正值得关注的是你自己的科研流程里哪些地方适合让AI介入哪些地方必须保留人类判断。有了这个框架再出现新工具、新模型、新提示词你都能很快判断应该把它放进哪一层结构、和谁连接、由谁兜底。最后给一个非常现实的建议如果你正在带学生或者你自己就是学生一定要在项目流程里加上“AI使用记录”。不一定是正式的日志哪怕每次跑完一个AI辅助任务在旁边备注一句“我如何验证了这个结果”都行。这一步动作的价值会在你回头看三个月前的产出时体现出来。你会清楚地看到哪些AI产出真正帮你推近了研究哪些只是在你还没有判断力的阶段悄悄制造了工作量幻觉。如果没有这一步你连自己正在“做得更好还是做得更差”都无法回答。
返回列表