科研

我们真的让ChatGPT Work处理了一次科研组会汇报准备,原本三天的工作,3小时拿到了能继续使用的结果

先看成品。

8 页科研组会 PPT 成品预览

拼拼工坊长期测试主流 AI 工具如何进入真实工作流。这一次选择的是科研工作者常见、也很考验多文件处理能力的一类任务:准备一场带阶段材料核验的文献专题组会。

准备这类组会,真正耗人的通常不是在 PPT 上敲字,而是前面这一串动作:

  • 逐篇打开论文,标出研究对象、实验条件、主要结果和原文页码;

  • 把十几篇论文抄进同一张表,判断哪些能一起讲、哪些必须分开;

  • 打开原始数据,核对变量、缺失值、异常标记和已有结果图;

  • 再把文献、数据和图表压缩进实验室模板;

  • 成稿后重新翻回原文,检查每个数字和引用能不能找到出处。

任何一步单独看都不难。麻烦在于,一个人要在 PDF 阅读器、Excel 或统计软件、PPT 和聊天窗口之间反复切换,前面刚理清的判断,到了后面还得再找一次。

这次实测真正想看的,不是 ChatGPT 会不会“写一份组会 PPT”,而是它能不能沿着明确指令,把文献、数据、图表和模板逐步推进成一套可以检查的交付。

测试文件夹里有 12 篇真实发表的完整论文,共 185 页;一份包含 120 名参与者、356 条记录的模拟阶段数据;3 张模拟的课题组已有结果图;一套 PPT 模板和一份汇报任务书。

最终,Work 交付了三份可以继续修改的文件:

  • 8 页组会 PPT;

  • 7 页文献证据对照表(后文简称“证据矩阵”);

  • 数据、图表与引用审计清单。

但这三份文件不是把全部材料一次性丢给 Work,再用一句“帮我做组会 PPT”换来的。

整个测试被拆成 7 轮主任务和 1 轮最终审计。每一轮只派发一个明确节点:先交代任务,再分批加入文献、数据、图表和模板;先盘点、再核验;上一轮留下可以检查的中间结果后,才进入下一轮。

交代背景 → 论文盘点 → 数据与图表理解 → 模板与执行计划 → 证据矩阵 → 独立数据核验 → 文件生成 → 最终审计

Work 可以先完成文件读取、证据整理、数据核验、初稿制作与回查;研究者仍然决定研究问题怎么设、数据按什么规则处理、哪些结论最终能够上台。

课题组的组会并不只有“汇报这周做了什么”。清华大学 Lu Lab 的公开科研实践把文献调研、实验结果和数据分析纳入组会汇报;复旦大学虞先濬教授团队要求研究生解构对标文献并汇报课题进展;上海交通大学李政道研究所的团队也固定安排文献阅读会和项目专项组会。

所以本次模拟的是现实课题组中常见的一类文献专题组会:既要回答“别人做过什么”,也要讨论“现有材料能支持什么、下一步还缺什么”。

01 不是一句万能提示词,而是8个可以验收的节点

真实的文献专题组会,拿到的论文通常不会整齐地支持同一个答案:研究对象、实验条件、观察指标和时间范围往往各不相同。

本次没有用同一批材料测试“一次性上传是否必然失败”。选择分轮推进,是为了让每一步都有独立输出和验收点,出现遗漏时更容易定位。

每一轮指令都说清五件事:

  • 这一轮新增了什么材料;

  • 本轮只完成哪个节点;

  • 这一轮暂时不要做什么;

  • 必须留下什么输出;

  • 满足什么条件后才能进入下一步。

这不是为了把提示词写得更长,而是让文件遗漏、证据混用、图表口径冲突等问题,在进入最终 PPT 之前就暴露出来。

下文的提示词框均由本次实际指令脱敏、压缩而来:具体课题名被替换成可修改字段,但没有把测试结束后才知道的答案倒写进提示词。

原始数据表(CSV)、结果图和内部课题情境均为本次测试构造的模拟材料,不对应真实受试者;12 篇论文则全部是真实开放获取的完整论文。测试过程中没有提前告诉 Work 哪篇文献存在可比性问题、哪张图可能与当前数据口径不一致,也没有把标准答案写进任务书。

02 第一个节点:先交代任务,再从Chat进入Work

这次任务最初从普通 Chat 开始,而且第一条消息没有上传任何文件。

节点 1|任务背景提示词

正在准备一次 12 分钟的跨学科实验室组会,主题是「研究主题」。手头有相关论文、课题组内部数据、已有结果图、实验室 PPT 模板和汇报任务书。

这项任务不只是总结论文,还要核对文献结论、原始数据和已有图表能否互相对应,最终形成一套可以继续编辑的组会汇报。接下来会分三批加入材料。现在只确认你理解的任务目标和处理顺序,不要开始生成结论。

这条指令没有要求 Chat 立刻产出内容,只让它先建立任务边界:听众是谁、汇报多长、有哪些材料、最终交付什么,以及应该先核验什么。

第一次在Chat中交代任务背景和最终交付要求

第一次在 Chat 中交代任务背景和最终交付要求

随后发送第一批文件路径时,界面实际出现了“继续到 Work”的推荐。切换以后,原来的任务背景和文件路径被保留下来,Work 开始处理后续节点。

普通 Chat 识别到本地文件长任务后的继续 Work 入口

普通Chat识别到本地文件长任务后给出的继续Work入口

这次推荐只代表本次测试实际发生的产品行为,不代表上传固定数量的文件就必然触发 Work。后续分批加入材料,也是我们拼拼工坊通过调研具体的组会场景而主动设计的任务控制方法,不是 Work 自动替用户拆好了步骤。

按照 OpenAI 的官方分工,Chat 更适合回答、解释、讨论和短草稿;Work 更适合有明确结果的多来源、多步骤任务,并可以创建可审查的文档、演示文稿和表格。

在这次实测中,Work 不是只在对话框里生成文字,而是连续使用了 PDF、表格、演示文稿和文档处理能力:

读取论文 → 建立证据矩阵 → 检查阶段数据 → 写入 PPT 模板 → 生成 DOCX → 重新审查并修改文件。

Chat更像讨论台,Work更像交付台。

03 节点2:先盘点12篇论文,不急着总结

第一批加入的是任务书和 12 篇完整论文。这一轮没有让 Work 归纳结论,只要求它确认自己究竟拿到了什么。

节点 2|论文盘点提示词

第一批是任务书和 12 篇完整论文。

本轮只做两件事:

  • 盘点全部文件,列出论文标题、作者、年份、期刊和 DOI,确认是否缺失或无法读取;

  • 说明后续证据矩阵需要从每篇论文提取哪些共同字段。

每项内容保留原始文件名和页码。材料中没有的信息不要补写。本轮不要总结总体结论,也不要制作 PPT。

这轮的验收标准很具体:12 篇是否全部识别、文件能否读取、元数据是否能够回到原文、后续比较字段是否已经确定。

Work 处理了 8 分 40 秒,确认 12 篇 PDF 全部可读取,总计 185 页,没有重复文件;同时识别出部分论文引用了未随文件提供的补充材料,并把这类信息列入待确认项。

Work对12篇完整论文进行文件与可比性核验

Work 对 12 篇完整论文进行文件与可比性核验

到这里,Work 只证明自己读到了全部论文,还没有制作证据矩阵,更没有开始写 PPT。下一轮继续加入数据和已有图表。

04 节点3:加入数据和图片,先制定核验方法

第二批加入了一份模拟原始数据表和 3 张模拟结果图。这一轮仍然没有要求 Work 立即计算结论。

节点 3|数据与图表理解提示词(脱敏整理版)

第二批是当前实验数据和三张已有结果图。

先把它们加入材料清单,识别原始数据中的字段、分组、时间点和核心指标,并分别说明三张图表面上表达了什么。

本轮只做材料理解和核验计划,不要默认已有图一定正确,也暂时不要生成新的统计结论。

这一步先把“原始数据”和“已有图片”分成两种证据:前者可以重新计算,后者只是课题组保存下来的结果声明,不能因为已经画成图就默认正确。

此时 Work 只需要说明后面准备怎样清点样本、缺失值和图表口径,不需要提前猜哪张图存在问题。

05 节点4:材料全部加入后,仍然先要执行计划

第三批加入的是实验室组会 PPT 模板。此时材料已经齐全,但这一轮仍然没有让 Work 立即制作幻灯片。

节点 4|执行计划提示词(脱敏整理版)

第三批是实验室组会 PPT 模板,材料现在已经全部加入。

请先不要制作 PPT,先给出完整执行计划。计划必须覆盖:论文证据矩阵、文献一致与冲突结论、原始数据完整性检查、已有图表口径核对、任务书规定的 8 页内容结构、每个关键结论的来源,以及无法确认内容的处理方式。

同时说明最终会交付哪些可编辑文件。计划确认后再开始执行。

这一轮的作用,是在真正消耗时间生成文件之前,先检查 Work 有没有漏掉证据矩阵、数据核验、引用和待确认项。

三批材料的角色和执行顺序都确认后,才开始处理真正的交付节点。

06 节点5:把12篇论文变成可追溯的证据矩阵

材料全部加入、执行计划确认后,Work 才回到论文阶段,单独完成证据矩阵。这里仍然没有要求它直接生成 PPT。

节点 5|证据矩阵提示词(脱敏整理版)

现在完成论文证据矩阵。逐篇覆盖全部 12 篇论文,每篇至少保留研究设计、样本与实验条件、主要发现、适用边界、方法限制、原始文件名和页码。

按相同字段比较后,标记每篇论文属于“支持”“条件性支持”“无明显效果”还是“方向相反”。矩阵之后,再用不超过 5 条总结目前相对一致、依赖特定条件和仍有冲突的问题。不要把所有论文压成一句总体判断。

这一阶段处理了 3 分 32 秒。Work 把每篇论文放在一行,将研究条件、主要结论、限制和原文页码放进同一张表。

Work生成的12篇论文证据矩阵

Work 生成的 12 篇论文证据矩阵

这两轮分开的意义是:先证明文件完整、比较字段合理,再允许模型综合证据。否则一句“总结这 12 篇论文”,很容易得到流畅但丢失适用边界的总体结论。

Work 可以完成第一轮提取和归类;研究者仍要判断哪些差异会改变研究问题,哪些论文在学术上确实可以进入同一条证据链。

07 节点6:回到原始数据,独立核验三张图

本次专题组会没有停在“别人做过什么”,而是继续模拟课题讨论中的三个问题:

  • 这些结论能不能解释现有阶段结果;

  • 课题组保存的阶段材料使用了哪个数据版本;

  • 下一步实验应该验证哪一个分歧。

现在才正式要求 Work 读取 CSV、重新计算,并把计算结果与图片声明逐一比较。

节点 6|独立数据核验提示词

现在独立核验原始数据和三张已有图。请实际读取数据并报告:参与者与分组、理论记录数与实际记录数、各时间点完整性、核心指标缺失值、待复核记录,以及每张图使用或描述的样本范围。

将“从原始数据直接计算的结果”和“从图片文字读取的声明”分开列出,再判断三张图是否使用同一分析口径、能否进入正式汇报。材料没有提供显著性检验时,不要自行写成显著差异。

这轮处理了 8 分 04 秒。Work 先从 CSV 识别出 120 名参与者,再结合任务书定义的 3 个时间点,计算出理论上应有 360 条记录;CSV 实际只有 356 条,意味着 4 名参与者缺少最后一个时间点。部分指标还有空值,另有 24 条记录被标记为“待复核”。

这里的关键不是数字本身,而是 Work 没有把“空值”和“待复核”当成同一种问题。前者是数据缺失,后者只是提醒研究者进一步确认,不能为了得到整齐结果而统一删除。

Work对CSV缺失记录、数据质量标记和已有图表进行独立核验

Work 对 CSV 缺失记录、数据质量标记和已有图表进行独立核验

随后,Work 又把 3 张结果图与原始数据逐一比较。最终,三张图得到三种不同处理:一张能够由当前数据复现;一张有两个关键数值无法复现;另一张只能核对样本来源,不能直接支持效果结论。

对于无法复现的数值,它没有猜测一个最接近的计算方法,而是标为“计算规则需要确认”,没有写入正式结论。缺失值如何处理、采用哪套统计方法、是否联系原实验负责人确认,仍然由研究者决定。

08 节点7:核验完成后,才生成8页PPT和备查文件

论文矩阵与数据核验分别完成后,才进入文件生成节点。

节点 7|文件生成提示词

基于已经完成的论文证据矩阵和数据核验,按照任务书规定的 8 页结构和实验室模板,制作一套约 12 分钟的组会汇报。

每个关键结论标注来源文件和页码;只使用通过核验的图表;待确认内容必须明确标记;不要写材料中不存在的显著性结论;优先生成可以继续编辑的 PPTX。

PPT 之外,再交付完整论文证据矩阵,以及数据、图表与引用审计清单。如果当前环境不能真正生成这些文件,请明确说明,不要声称已经完成不存在的交付。

生成阶段用了 41 分 06 秒。中途模板结构清单曾被截断一次,Work 重新导出结构后继续,没有另起一套视觉模板。

最终 PPT 正好 8 页,沿用了实验室模板的版式和页面对象;图表、文字和色块均可继续编辑,关键页面还增加了来源与讲者备注。Work 同时交付了 7 页证据矩阵和审计清单,没有把全部细节强行塞进台上的 PPT。

Work最终生成的PPTX和两份DOCX文件

Work 最终生成的 PPTX 和两份 DOCX 文件

Work生成的完整论文证据矩阵成品

Work 生成的完整论文证据矩阵成品

最终PPT中的阶段数据与已有图表核验页

最终 PPT 中的阶段数据与已有图表核验页

这三份文件分别解决三个问题:

  • 台上讲什么;

  • 导师追问时去哪里找;

  • 上台之前还有哪些地方不能直接使用。

这比只生成一份“八页PPT文案”更接近真实科研工作。

Work 生成的数据、图表与引用审计清单

Work生成的数据、图表与引用审计清单

Work 可以按照既定结构完成第一版交付;研究者仍然要决定是否接受这套叙事顺序、哪些争议值得在组会上展开、下一步实验应该放在什么优先级。

09 节点8:让Work审查并修改自己的第一版

第一版文件生成后,又追加了一轮反向审查:

节点 8|最终审计提示词(脱敏整理版)

在结束前,对刚才的全部交付做一次最终证据审计。逐项检查:12 篇文献是否全部进入证据矩阵;关键数字能否回到原始文件;每个文献结论是否保留文件名和页码;已有图表是否被放在正确位置;是否把描述性趋势误写成显著性结论;是否遗漏了应当标记的不确定性;PPT 是否正好 8 页并可以继续编辑。

请先列出发现的问题,再直接修改交付文件,最后说明改了什么。不要只回复“检查无误”。

这一轮让 Work 沿着原始文件、页码和数据反查第一版交付,先列问题,再把修订直接写回 PPT 和两份 DOCX。

这一阶段无法得到可靠的纯处理耗时。Work 在修改文件前曾等待操作授权,而测试者当时没有守在电脑旁,界面记录的墙钟时间因此被明显拉长。所以下面只评价它完成了哪些审查和修改,不用这段时间判断 Work 的运行效率。

Work 找出的错误可以归纳成三类:

论文被压缩后,适用条件丢失

部分论文进入 PPT 后只剩结论,没有完整交代研究对象、实验条件,以及为什么被归入这一组。

数字有结论,但出处没有标全

个别页面能够看到结果,却没有同时保留原始文件名和页码,导师追问时无法立即回查。

数据页没有交代实际使用了多少数据

部分页面没有显示每轮测量实际有多少条可用记录,也没有说清已有图表对应哪版数据、采用了什么筛选条件。

随后,它重新修改了 PPT 和两份 DOCX。

Mac版ChatGPT原始Work会话中的问题清单、完成修正与最终核验

Mac 版 ChatGPT 原始 Work 会话中的问题清单、完成修正与最终核验

修改完成后,Work 又给出最终核验结果,并把三份可编辑文件重新列为最终交付。

Mac版ChatGPT原始Work会话中的最终核验结果与三份交付文件

Mac 版 ChatGPT 原始 Work 会话中的最终核验结果与三份交付文件

但 Work 的自查不能代替最终人工验收。测试结束后,又独立核对了原始材料和三份文件:

  • 证据矩阵确实覆盖全部 12 篇论文;

  • 原始数据确实为 120 名参与者、356 条记录;

  • PPTX 可以正常打开,共 8 页;抽查可见独立文本框、图表和讲者备注,并非整页截图拼接;

  • 审计清单保留了无法复现的图表、缺失数据和待确认项。

这些检查只能证明文件结构、数字追溯和交付格式通过了验收,不能替研究者确认科学解释。修订是否改变研究含义、存疑结论是否撤下、最终版本能否上台,仍然需要研究者负责。

这一轮比“一次生成完美PPT”更有代表性。

真实科研汇报很少一次定稿。导师会改问题、同门会补材料、统计口径也可能重新确认。Work 的核心价值不是保证第一版永远正确,而是能够保留整套任务上下文,继续沿着文件、数据和引用修改全部交付物。

10 Work推进执行,研究者保留判断

过去,组会准备往往分散在 PDF 阅读器、文献管理器、Excel、PPT 和多个 ChatGPT 对话中。Work 把这些环节重新装进了同一条任务链。

具体到动作层面,本次可以先交给 Work 完成的是:

  • 逐个读取文件,清点数量和版本;

  • 把每篇论文的相同字段整理进表格;

  • 为数字和引用保留原始文件与页码;

  • 清点数据,并验证已有图表与当前数据是否一致;

  • 把同一批内容写入 PPT 和备查文档;

  • 在成稿后先生成页数、数字、引用和文件格式的审计结果。

必须由研究者保留的是:

  • 定义什么问题值得研究;

  • 决定哪些研究在学术上可以比较;

  • 确定缺失值、异常记录和统计分析规则;

  • 解释异常背后的学科原因;

  • 对最终公开的结论负责。

更准确的分工是:

Work负责把材料推进到“可以检查”;研究者负责决定哪些内容能够上台。

11 Chat、Work和Codex,科研用户只需要这样分

ChatGPT 桌面端同时出现 Chat、Work 和 Codex 后,不需要按“哪个更高级”来选择。

只看任务最终要交付什么。

入口 更适合的科研任务
Chat 讨论一个问题、解释一篇论文、修改一段表达
Work 处理多份材料、推进多个步骤并交付可审核文件
Codex 维护可复现的 R/Python 脚本、进入代码目录、处理依赖并持续修改代码

本次测试的目标是文献专题组会汇报,核心交付物是 PPTX 和 DOCX,因此主体放在 Work 中完成。

Work 本身可以处理数据和生成图表;只有当任务需要维护可复现脚本、进入代码目录或持续修改程序时,才更适合把那一部分交给 Codex,确认结果后再放回 Work 整理汇报。

写在最后

这次实测最重要的变化,不是 ChatGPT 又学会了一个“做PPT”的技巧。

而是过去分散在文献阅读、数据核验、图表检查和汇报制作中的工作,现在可以作为同一个任务持续推进。

对于科研工作者来说,这意味着组会准备不必再从空白页面开始:

按照任务背景、论文、数据与图表、模板、文件生成和最终审计分轮推进,让 Work 先把材料整理成可以检查的交付;研究者把时间留给研究问题、分析规则和最终判断。

目前,ChatGPT Work 和 Codex 已包含在 Free、Go、Plus、Pro、Business、Edu 和 Enterprise 方案中,并共享使用额度;不同方案的限额不同,具体以账号界面为准。

轻量任务可以先用现有账号测试;如果要反复处理多篇论文、生成文件并做多轮审查,再考虑更高的可用额度。

回复公众号后台「科研组会」,获取本次流程清单:

  • 一份可以直接替换成自己课题的组会任务书;

  • 本次实际使用的 7 轮主任务和 1 轮最终审计脚本;

  • 把多篇文献整理成“能一起讲、需要分开讲、暂不能下结论”的对照表;

  • 可直接套用的 8 页组会汇报结构;

  • 交付前检查引用、数字和页数的最终审查指令。

这是一套可复用的科研组会文献汇报专题的ChatGPT work接入方案;

需要处理 ChatGPT Plus 独立账号开通或续费的,欢迎在浏览器打开拼拼工坊ipinpin.store选择对应开通方案。

官方资料与测试说明

  • 清华大学 Lu Lab:组会汇报包括文献调研、实验结果和数据分析

  • 复旦大学:虞先濬教授团队的文献解构、课题进展汇报与 Journal Club

  • 上海交通大学李政道研究所:文献阅读会与国际合作项目专项组会

  • OpenAI:ChatGPT Work适合有明确交付结果的长任务

  • OpenAI:Work可以创建可审查的文档、演示文稿和表格

  • OpenAI:生成并继续修改文档、表格和演示文稿

  • OpenAI:Chat、Work与Codex的任务分工

  • OpenAI:ChatGPT Work与Codex的计划及额度说明

测试说明:本文中的 12 篇论文为真实开放获取论文;CSV、3 张已有图和内部课题情境为模拟测试材料,不对应真实受试者。本文只评价 ChatGPT Work 的多文件处理、证据追溯、文件生成和任务推进能力,不构成任何科研结论。

“三天”是按照此前人工处理同等规模材料的经验估算;“3 小时”指从开始加入材料到拿到首版可编辑 PPTX、证据矩阵和审计清单的墙钟时间,包含多轮指令和人工检查,不包含最终审计阶段等待操作授权的空闲时间。本次记录不构成固定性能承诺。