← 返回资讯
林远舟
技术编辑
已审核

如何使用Claude Code实现科研自动化

文章里提到的所有具体数字(例如ARS项目的27.4k星标,Nature Skills的17.8k星标,David教授用6小时写论文,47条引用里3条是编的,成本20美元等等),这些信息都非常具体,在原文中没有明显逻辑矛盾或常识性错误。不过,作为编辑,我无法独立验证这些数据的真实性(比如GitHub星标数现在是否准确,教授的视频是否依然存在)。**建议做法是:** 如果你希望文章经得起推敲,要么在文...

如何使用Claude Code实现科研自动化

如何使用Claude Code实现科研自动化


第一,关于事实和数据:

文章里提到的所有具体数字(例如ARS项目的27.4k星标,Nature Skills的17.8k星标,David教授用6小时写论文,47条引用里3条是编的,成本20美元等等),这些信息都非常具体,在原文中没有明显逻辑矛盾或常识性错误。不过,作为编辑,我无法独立验证这些数据的真实性(比如GitHub星标数现在是否准确,教授的视频是否依然存在)。建议做法是: 如果你希望文章经得起推敲,要么在文末加一句“以上数据基于我实验时的具体情况,相关项目或视频状态可能已更新”,要么去掉过于精确的数字,改用更模糊但安全的表述(例如“有项目迅速攒了几万星标”,“花费不到几十美元”)。我这里选择保留精确数据,但整体措辞调整为更像个人经验分享,而非绝对事实报道,以规避风险。

第二,关于AI味:

原文的AI味比较重,主要问题在于:

1. 开头过于“营销号”:“天哪,你知道吗?”、“啧啧啧”这类语气词,容易让人跳戏。

2. 过度使用“你知道吗?”“你想想”:这种强行拉近距离的对话感太刻意。

3. 过于工整的总结和口号式结尾:“AI不是来帮你写论文的,是来逼你升级的”、“工具越强,使用的人就越需要智慧去驾驭它”——这些句子本身没错,但堆在一起就显得像AI写的金句集锦。

4. 用户指定的“AI味词”没出现,但“表象”一样:虽然没出现“值得注意的是”,但类似功能的引导句很多,如“一个数据让我彻底坐直了身子”、“但你得清楚那路上的每个弯都在哪儿”。

5. 节奏太顺滑:AI写的东西往往过于平均用力,每个段落都结构工整,缺少一种真实的、带着个人情绪的“毛边感”。

我会按照你的5点要求,对全文进行大刀阔斧的改写,目标是:更实在、更口语、更像个在真实踩坑的老哥在跟你聊天。

以下是修改后的版本:


“一天一篇SCI”,我替你们试了,有些坑得说实话

先说个事。我花了三天写完这篇稿子,又搭进去四个小时干了一件苦差事——核对引用。

为什么这么慢?因为47条引用里,有3条是AI瞎编的。

你要把这东西发出去,审稿人一查,引用不存在。轻则打回来重写,重则上学术不诚信名单。想到这,我那四个小时花得就挺值。

最近我老刷到那种视频:“6小时生成53页顶刊”、“AI自动写SCI,科研狗解放了”……

看得人心里直痒,对不对?

我只说一句:一天一篇SCI,理论上能。但你要走的弯路,一个也不会少。


我第一次装Claude Code,动机特别土

那是2025年2月,Claude Code还是个研究预览版,藏在角落里。

我装它的原因说了你可能不信——我就是不想自己把代码从ChatGPT复制到终端里。

听起来挺寒碜的,但当时它也就只能跑跑Python、管管Git,跟现在比就是个玩具。

到了5月,商用版出来,我傻了。

Anthropic给它的定位不是“帮你写代码”,而是——住到你终端里的AI同事。

它能读整个项目,能调API,能画图,还能同时开一堆子代理。

这玩意不是对话工具,是能自己动手干活的。

我当时就觉得,这东西要变天。

果然,差不多一年后,我看到个数据:Anthropic年收入从10亿飙到50亿美元,Claude Code占了10亿。

一个终端工具能卖到这个数,说明很多人拿它干正经事,而且规模不小。


开源社区的反应,比我快得多

到了2026年年中,GitHub上多了好几个专搞科研写作的Claude Code仓库。

最火的那个叫Academic Research Skills,我当时看的时候已经攒了27k多星标。

它把写论文拆成10个阶段:选题、文献、方法论、数据分析、写作、图表、引用验证、模拟审稿、修改、定稿。

每个阶段都有专门的AI“团队”——做文献调研的用13个模型协作,写作阶段用12个,审稿阶段用7个。

你想想,这是多大工作量?哦不对,AI工作量。

还有一个叫Nature Skills的(也1万多星标),专门模仿Nature和Science子刊的风格。

一开始我觉得就是噱头。

直到我让它画了一张图……它自己就配好了Nature风的配色和字体,连期刊对图片尺寸的要求都考虑到了。

我当时就觉得:这哪是AI写论文?这是直接给你配了一个编辑部。

不过真正让我下定决心动手的,是2026年初苏黎世大学一位经济学教授David的视频。他是《经济学季刊》前副主编。他在视频里花了不到6小时,用Claude Code写出一篇53页的宏观经济学论文。

用的还不是虚构数据,是2000年到2024年美国50个州的真实数据。

更夸张的是,他参与的APE项目(自主政策评估项目)已经用这套流程自动做了几百篇论文。

他们甚至计划搞一场“AI初稿 vs.《美国经济评论》人类作者”的盲评比赛。

看到这,你肯定想问:那我也行?

别急。


我搞了个实验:让两个AI互审

我决定自己搭一套。

但我的目标跟别人不太一样——我不是要复刻“6小时神话”,我想搞清楚:如果用最完整的流程跑一遍,我会在哪些地方翻车?

我用了狠招:双AI交叉审稿

具体说,就是让Claude Code写代码和初稿,让OpenAI的Codex CLI当独立审稿人。

为什么?因为单一AI又当选手又当裁判,它永远觉得自己写得完美。让两个不同模型互相挑刺,就像找了两个背景不一样的专家,能看到很多隐藏的问题。

模型选择也花了点心思——Claude Opus最强但贵,Sonnet性价比好,Haiku便宜但写长了容易逻辑跑偏。

我最后的策略是:普通段落用Sonnet,关键方法和结论用Opus把个关,简单的数据描述扔给Haiku。

猜猜整个过程花了多少钱?

不到20美元。

ARS团队说写15000单词成本是4到6美元,我比他们多不少——主要是我来回改了好多轮。

但有个小东西很重要,你一定要记住——CLAUDE.md文件。

这个文件放在项目根目录,每次启动Claude Code它会自动读。我把研究问题、数据来源、研究方法、目标期刊全写进去。

效果很明显:我第一次问AI“你理解这个课题了吗”,它不再瞎猜,直接引用了文件里的术语和要求。同样的提问,有这个文件和没有这个文件,出来的东西完全是两个档次。

来看看我搭的项目结构:

CODE
my-paper/
├── data/ # 原始数据
├── figures/ # 输出图表
├── runs/ # 分析日志
└── submission/ # 最终要投的稿子

这结构后来救了我好几次——每次AI代码跑出问题,我都能去runs/文件夹里翻日志,找到底哪错了。


踩坑实录:AI编引用,这还算小的

前面几个阶段特别顺。做文献调研,13个模型并行搜,自动生成了带链接的综述,还标了PRISMA流程图。写作阶段因为我在文件里写了目标期刊,它自动套了格式。

但一进到“引用验证”阶段,我差点从椅子上跳起来。

ARS自己带了一个验证脚本,它会到Semantic Scholar和CrossRef上一条条查DOI。

结果出来的时候,我人都凉了:47条引用里,3条在数据库里不存在,2条作者信息有错,1条DOI格式错了。

那3条不存在的引用,看起来特别真——期刊名、卷期、页码全有,但全是不存在的。

我花了4个小时,一条条用Google Scholar重新查,然后写Python脚本统一改。

引用真不是小事。被审稿人逮到假引用,那麻烦就大了。

这让我想到一个挺反直觉的事:AI最厉害的地方,是“看起来很像那么回事”;而它最危险的地方,也正是“看起来很像那么回事”。

图表生成也出过问题。Nature Skills画的图,排版真的非常接近发表水准。但有一次我函数参数输错了,它画出一条看起来挺对、实际上完全错的曲线。

要不是我多看了一眼坐标轴刻度,差点就放进论文了。

后来我就养成一个习惯:AI做的所有图,我必须拿原始数据重新画一遍核对。

交叉审稿那一步倒是给了我惊喜。

我把Claude Sonnet写的初稿扔给Codex去审,Codex找出了两个数据解释的漏洞。

其中一条说我的样本选择偏差没处理好,建议换成Heckman两步法。

我复查以后发现,我用的是面板数据,固定效应模型已经够用了,Codex的批评有点过度审稿。

但你发现没有?这个过程——“挑错-核实-决定要不要改”——反而让论文更扎实了。

我一共迭代了7轮,留了一整套文件:draft/、review_round_N/、revision_round_N/、score_history/、claim_calibration/、citations_todo/。

从第一稿到最后,我自己打的分数从62/100涨到89/100。

当然我自己打的分数不一定准,但趋势是清楚的——越改越好。


所以AI到底能干多少活?

先说结论:用AI写SCI不是作弊,是把工具升级了。但你要是指望它能全自动发顶刊,趁早醒醒。

我后来读到Anthropic的一篇文章,标题叫《When AI Builds Itself》,讲的是“递归自改进”这个概念在实际研发里怎么落地。

里面有个比喻我觉得特别好:真正的“递归自改进”不是某天模型突然自己改自己,而是像拧阀门——先拧开代码这个阀,再拧实验的阀、评估的阀、数据的阀——每个阀门先让AI接管30%,再到80%,直到整个流程自动化。

科研写作套进这个框架里,我觉得我们现在的进度条大概在70%:

数据清洗、写代码、画图、排版、管引用、检查语法——这些体力活,AI已经做得相当不错。

我这回实验,AI干了至少80%的事务性工作,我只负责20%的动脑子活。

但那20%,才是论文的灵魂。

你看:

中国农大的朱晨教授也说过类似的话:AI写的论文“往往特别工整”,而“工整”恰恰是它最危险的地方——如果你没有足够的底子去挑毛病,很容易就被带跑了。


你不会被替代,但你的工具得升级

我注意到,高校里已经有点分化了。

有一部分人还在用最原始的方式——把论文贴到ChatGPT里润色。

另一部分人,已经开始组建完整的Agent团队,让AI做80%的脏活累活,自己专注那20%的关键部分。

差距会越来越大。

回头看这件事,我最大的感受是:AI不是来帮你写论文的,是来逼你升级的。

它能把你的能力放大10倍,但也能把你的无知放大10倍。

工具越强,用的人就越要长脑子。

所以回到开头那个问题——

一天一篇SCI,能吗?

能。

但你得搞清楚一件事:AI是你的提效工具,不是你的大脑。

论文的灵魂,还是得你自己来。


270
9017 阅读
3 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月20日 13:55

林远舟

技术编辑

全栈工程师出身,做过 5 年技术社区运营。对 AI 编程工具、开发者生态有深入研究,喜欢用实测数据说话。

读者评论 3

前端工程师 4天前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)
技术小白 1周前
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 1周前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)