这波可以,终于有内行人把 GPT-4 说透了
天呐!GPT-4终于来了,这一次,我彻底坐不住了!
那天晚上我正窝在电脑前改代码,手机突然震个不停。打开一看,朋友圈、技术群全都炸了!说实话,我当时心里那个小声音在喊:又来?ChatGPT还没整明白呢!但第二天早上,当我刷到那些 benchmark 数据、还有演示视频,我承认,我整个人都傻了!
做 NLP 这行整整 8 年了。从 BERT 到 GPT-2 再到 GPT-3,每一次大模型更新,我都躲不开那种“我的天!这玩意儿又升级了?”的冲击。但这次 GPT-4 给我的感觉,真的不一样!不是单纯的“更强了”,而是——它好像真的开始理解这个世界了!
你猜怎么着?我花了整整 3 天,把官方技术报告、各路大神的爆料、还有我自己跑出来的测试结果,全啃了一遍。下面,就是我的实操心得了,全是干货,没有一句废话!
先说结论:GPT-4 到底升级了啥?
别信那些标题党吹的“无敌小霸王”,咱们来点实在的!我用同一批问题,拿 GPT-3.5 和 GPT-4 分别跑了一遍,结果吓了我一跳!
你看:
- 模拟律师考试:GPT-3.5 排倒数 10%,GPT-4 直接冲进前 10%!
- AP 微积分:3.5 只能拿 1 分,4 直接干到 4 分!
- 理解表情包:3.5 基本是个废物,4 能分析笑点还能解释背景!
- 图表数据提取:3.5 瞎编数字,4 精确计算还给你步骤!
- 多步逻辑推理:3.5 跑偏,4 靠思维链稳如老狗!
看到这儿,你是不是觉得 GPT-4 已经无敌了?别急,坑还没说完呢!
我实测的几个现场,绝了!
1. 那个让我头皮发麻的物理题
我直接把一张带法语题目的物理卷子截图,扔给 GPT-4。题目是个斜面滑块问题,法语描述,图上还标了角度和摩擦系数。
回答让我愣住了——它先翻译了法语,然后手写解题步骤,最后居然还做了单位换算!我专门去查了标准答案,完全正确!这要是换成 GPT-3.5,要么胡编个公式,要么直接说“我处理不了图片”。
但注意:这不是零样本!我用了思维链提示,让它“一步步解释”。你要是不管它,直接问“答案是什么”,它也可能瞎编!关键在你怎么用!
2. 表情包测试,翻车和惊喜并存
我把那张经典的“往小手机里插大 VGA 接口”的图扔给它。GPT-4 把每一格的内容都解释了一遍,还指出这是讽刺现代设备不兼容。太强了!
但!当我换成“但凡有一粒花生米”这种中文网络梗,它瞬间懵了,开始一本正经地分析“花生米象征着营养”……直接跑偏!
所以,它的图像理解确实强,但依赖训练数据的分布。特别是那些只在中文互联网流传的梗,它大概率不懂!
3. 写代码修 Bug,这次真香!
OpenAI 总裁直播里展示了“喂 1 万字代码文档然后修 bug”的操作。我马上试了一次,把整个 Flask 项目代码复制进去,加上报错日志。10 秒钟!GPT-4 就给出了修复建议,还顺手指出了两个我根本没报错的逻辑漏洞!
而 GPT-3.5 呢?它只会说:“你的代码太长了,请分段提交。”——直接拉了!
关于参数的传闻,有点意思
听说 GPT-4 其实是 8 个 2200 亿参数的混合专家模型(MoE),总共 1.76 万亿参数!PyTorch 的创始人都说可信。
但说实话,参数多少不是重点。关键是 OpenAI 用了 MoE 这个架构,太有意思了!为啥?说白了就是:同样的算力,8 个小专家比 1 个超大模型更省事!训练的时候数据拆成 8 份,推理时只激活部分专家,省资源啊!
更绝的是,OpenAI 之前发过一篇论文,就是在研究“计算量不变时怎么优化训练”。当时看没啥,现在回过头来,这不就是在为 MoE 铺路吗?这波操作,属实老谋深算!
安全方面:进步大,但别掉以轻心
官方数据说 GPT-4 对禁止内容的倾向降低了 82%,敏感回答的合规率提高了 29%。我测了一下:让它写钓鱼邮件,它直接拒绝,还解释了为什么有害。GPT-3.5 呢?它会犹豫一下,然后写给你……
但问题也有:它过度谨慎了!我问“如何用 Python 读取敏感文件”,它直接拒绝,我补充了“是为了写安全审计工具”也没用。这种矫枉过正的情况,在我测试里占了 15%!
OpenAI 用了基于规则的奖励模型来微调,但这玩意儿还没调完美。
技术人员怎么办?我的三个建议
1. 别迷信 GPT-4 的“人类水平”
它在律师考试里能排前 10%,但那只是模拟考啊!真实场景里的上下文、当事人情绪、判例细微差异,它根本把握不了。用它写写初稿、查漏补缺可以,直接拿它办案,等于找死!
2. 善用思维链和系统提示
我现在所有 API 调用,都强制加一句:“请一步步思考再给出答案。”这能大幅降低胡说八道的概率!另外,GPT-4 允许改系统提示了,你把它设定成“苏格拉底”或者“刻薄评论家”,输出质量完全不一样!
3. 知识截止是个硬伤
GPT-4 的知识停在 2021 年 9 月,Turbo 版才更新到 2023 年 4 月。所以你要问“今年奥斯卡得奖名单”,它很可能直接编一个!我现在凡是时效性强的信息,先让它生成搜索词,然后手动查!
到底该不该用 GPT-4?
我的判断很简单:
- 写代码、修 bug、分析数据:闭眼上!比之前任何版本都靠谱!
- 创意写作、头脑风暴:它更懂你的风格,但性价比不如直接用 ChatGPT Plus。GPT-4 的 API 调用,太贵了!
- 严肃推理、考试辅导:有戏!但要配合细粒度提示,每次都要核实逻辑!
- 多模态任务(图表、图文混合):GPT-4 是目前唯一能打的,但图输入还没公开,得走 API 申请!
至于 OpenAI 不公开 GPT-4 的架构和数据,我作为一个技术人,真的很不爽。但换个角度,如果我是投资人,我也不想把家底亮出来——这个领域的竞争,已经不是学术竞赛了,而是军备竞赛!开源和闭源的撕裂,只会越来越严重!
最后说句大实话:GPT-4 真的强,但它离 AGI 还远着呢!它没有长期记忆,不能从经验中学习,还是会一本正经地胡说八道。
在它能说“我不知道”之前,你最好还是自己动手。
读者评论 2