精选
|
疑问
8 月 11 日上午 10 点,我在视频号里做了一场临时答疑。

起因是星友张文茹在星球里问了一串 AI 工具的问题,我觉得很有共性,很多网友可能都有类似困惑,就干脆直播解答。直播超过一小时,颇有酣畅淋漓的感觉。我把其中部分共性问题梳理成这篇文章,有些融合了直播后的进一步思考,和现场未必完全一致。
下面咱们开始分享。
付费文茹在留言里说自己是小白。她的体感是 K3(Kimi 家的新模型)不花钱几乎用不了,那么究竟值不值得掏这个钱?
这个问题,说出了很多人的疑惑: AI 从前不是免费的吗?怎么突然都找我要钱了?
前几年用各种工具软件,周遭世界都对免费用户显得挺友好。开发的人工费如果人家不跟你收,程序跑在你自己电脑上,电费和损耗可以当没看见。微信你用了这么多年,也没为「能发消息」单独交过钱,是吧?
不过现在这些 AI Agent 不太一样。它们很少在你本机里把活干完。你用的是远端那头很大的模型。你可以去查一下,若要把 DeepSeek V4 Flash 这种级别的东西自己在家部署,硬件要准备到什么份上。多数人看一眼那个数,就打消念头了。
所以调用 AI 工具,你付的其实是租用远端模型和算力的钱。DeepSeek V4 Flash 这个模型目前仍然便宜,性价比高。K3 的模型更大,耗的资源也更多,所以它贵。

在目前的情况下,算力、存储都是稀缺资源。要求 AI 免费,基本上等于请人上街发钱。这当然不可能。甚至「物美价廉」的目标,恐怕连提供商自己也做不了主。
前些日子流传出来的一段文本里,DeepSeek 创始人梁文锋跟投资人交流时说,他们按「买一批设备回来,十个月收回成本」来定 API 价。不过就在 8 月 6 日,DeepSeek 开发者平台又挂出一条很显眼的提示:计划近期整体上调 API 定价,预计涨幅较大,具体方案以正式通知为准。

直播那天是 8 月 11 日。公告已经出来好几天了,正式新价目直到 8 月 13 日才落地,8 月 17 日才生效,部分档位涨幅还不小。我对涨价的理解是,即便一家店不想多赚钱,只想要「合理的利润率」,但只要他家提供的东西又便宜又好用,人就会涌过来。供给跟不上,价格会被供需托起来。差价若不自己收,中间商也会收。
回到文茹的问题:值不值得花?你得自己能算。
Kimi 现在最高档 Allegro 是每月 699 元。

你交了这 699,它给你省下的时间、省下的成本,或者你拿产出去市场上换回来的钱,加起来如果明显过了两千、三千、五千,这钱就花得值。粗算的法子不复杂:先估一下你一小时值多少钱,再数数它替你省了几个小时,乘起来跟 699 一比就清楚了。反过来说,交了 699,算下来连 300 都换不回,那就不值。
选择哪一档来使用,跟每个人干什么活完全有关。我高强度跑任务的时候,就算 Kimi 订阅顶档,几天里也能把一周额度用光。

不过那是我的用法,不是你的用法。至于使用感受上,我写过 《聊聊我对 Kimi K3 的体感》,你可以参考。
很多人问我:你推荐的那些工具都分档,要不要一步到位买最高?
用不着。进去先选最低档。试过了,觉得好,再加。你原来订 20 美金,后来想订 200 的,完全来得及。反过来,先甩出 200 美金,用完发现在你这儿 2 美金都不值,那就亏大了。
订阅的注意事项还有一条,我常在星球里说:除非你特别笃定,先别锁定年付。年付账面上往往比月付便宜一截。真要算的大账不是那一截,而是你用了一两个月,更好的竞争产品出来了,剩下那十个月你守着个鸡肋产品,该怎么办?
不过这话我也说不得别人,毕竟年初的时候我也不知道哪根筋搭错了,订了一年的 Gemini Pro。后面发生的事儿,别问,打听多了也不好。
但这也并非没有特例。我在去年黑五订过一年的 YouMind Max 档,当时一次趸交,觉得挺肉疼。不过用到现在仍觉得值。
订阅费值不值得花,只能在你自己体验里判断。这就是人家做成不同档位的原因。丰俭由己嘛。
马具文茹第二问:龙虾和 Codex 有啥区别?
这两个,加上 Claude Code,现在常被放在同一个词下面:harness。英文原意是马具。前些日子我在青海湖边骑过一次马,还留了张照片,说是亲自体验了一把 harness。

AI 模型就是那匹马。光给你一匹马,没有鞍、没有缰绳,大部分人发挥不出那匹马该有的能力。牧区里或许有小朋友徒手上得去马,不过你我大概不行。
这个词的来路,我在 《什么是「驾驭工程」(Harness Engineering)?》 里写过。
龙虾(OpenClaw)、Codex、Claude Code、Kimi Code 都是「马具」(Harness),特点却都有区别。
Claude Code 底层很擅长编程。你拿它干别的也能干,可它最强的能力在写代码、改代码。Codex 也在加强编程,同时有一条我用得更多的能力:computer use,也就是直接操作电脑上的浏览器和软件界面。很多专业工具当年是为人类操作图形界面设计的,不是为 Agent 设计的。面对这些界面,Codex 是我现在最顺手的那一种框架。
8 月 9 日早上,我在星球里记过一次:用自然语言让 AI 去跑 NetLogo 仿真,自己没碰它的界面和代码编辑器。参数、多轮实验、结果图,都是它自主操作 NetLogo 完成的。
十几年前我学 NetLogo 这东西,国内连中文教材都不好找,后来还是从美国背回一本很厚的书。直播里我提到,2021 年北师大张江老师出过中文教材,我特别兴奋地写过推荐序。
回到我当初用 NetLogo 写论文的 2013 和 2014 年,那时候 NetLogo 还是特别专业的技能。彼时我还不是硕导,有别的老师的学生跟着我做研究。那两年他几乎没干别的,就负责把 NetLogo 的编程、设定这套吃透了,就有很强的竞争优势。我负责提想法,他来用 NetLogo 实施,我们配合得挺好,发了两篇 C 刊,加上一篇会议论文。
可是,这次我测试,把当年那个研究场景复现出来,哪里用的了几个月的时间?三五轮对话就走通了。

这件事不限于仿真。你专业里那些有界面的研究工具,越受欢迎,往往越是为人类用户设计的。以前你得自己啃用户手册。现在如果它足够常见,模型训练时多半见过;不够常见,你把文档链接丢给 Codex,让它先学再试。
把「熟悉某款软件」当成技术护城河的时代,一去不复返了。
另外你注意,我让 Codex 操作 NetLogo 时,用的还不是它 5.6 Sol(Codex 的旗舰推理档)那一档里最高级的推理,只用了中档 (Medium) 已经能把这事做完。
与 Codex 类似,腾讯的 WorkBuddy 也是「我来帮你把事干了」这一类型。我拿它主要是填 Word 表:把自己的材料和对方提供的样例丢进去,一会儿就填好了。要知道,我最讨厌填表了,有了这个工具,解脱了不少。
OpenClaw 和 与之类似的 Hermes 则是另一种风格。虽然它俩的能力和 Codex 有重叠,但我更喜欢让它们在后台处理定期、轻量的任务。
例如我上次帮高中同学做个项目。让龙虾定时去盯几本农业期刊、把论文下载下来再做初步处理,然后形成知识图谱,并据此分析研究趋势和热点主题。

框架和模型也不是绑死的。Codex 默认是 OpenAI 自己的模型,Claude Code 默认是 Anthropic 的。不过很多人会把一套 harness 接到另一家模型上。龙虾本身没有默认模型,你自己接。政策上两边态度不一样。直播里我说的是:Anthropic 对订阅接到龙虾比较严;OpenAI 则允许接到龙虾、OpenCode 或 Hermes。具体以两家当时的规则为准。
更细的搭配,我在 《Claude Code, Codex, OpenClaw,我是怎么让它们配合干活的?》 里写过。上个月那篇 《Claude Code 吭哧吭哧干活儿,我为什么偏要让 Codex 来拆台?》,说的是推进和审查怎么拆开:Claude Code 往前走,Codex 在关键节点找茬。让两个顶尖模型一起「商量着把活干完」,有时更能获得更高质量结果。
创作文茹问的第三件事,是两款给创作者用的 Agent:YouMind 和 Flowith。
Flowith 我之前已经为你写文章介绍过,这里专说 YouMind。
我最近半年写东西、做课件、插图,主要就靠两样:YouMind 和 Dessix。YouMind 是专给创作者做的。你写字也好,配音、画图、剪视频也罢,不管干哪一行,它把这一行里比较强的模型都请了进来,按它自己平台的积分统一扣钱(不用给每个模型单独订一份),还顺手帮你挑,哪件活该交给哪个模型,它都替你安排好了。
模型这东西更新快。YouMind 最近把 MiniMax H3 和 Seedance 2.5 也接了进来,这俩是最新的视频模型。你想用,不用再单独掏订阅,也不用自己去配 API,点开就能使。

创作者那些烦心事,它也挺会替你收拾。就说往 X 或者公众号发图文吧,以前我得把字和图来回倒腾,格式还老出错。现在 YouMind 一键排版,排好了等你点确认才发,不着急,你说了算。

我订的是 Max 档,所以用起来有点「大手大脚」。拿 Fable 5(Anthropic 的一款编程模型)说吧,这模型原本在 Claude Code 里得靠 Coding Plan(Anthropic 的订阅套餐)那点额度,一周就烧光;到了 YouMind 这边,我每个月 20 万积分放开手用,不用自己接 Anthropic API,当然积分也烧得挺快。

YouMind 还能开不同的工作区。你把一堆资料丢进去,后面的检索、切分、整合,它都替你接好了。我备课、做讲座、准备教创赛的 PPT,一大批都是用 YouMind 弄的。

教创赛不管校赛、省赛还是国赛,交的幻灯只认 PowerPoint 这一种格式。这可就戳到我的痛处了。我平时上课、讲座,全用 Reveal.js 做 HTML,根本不做 PPT。怎么办?我用 YouMind 加 GPT Image 2,把幻灯先做成一页一页的图,再拼成 PPTX。可拼完又冒出个问题,图上的字想改,怎么弄?
YouMind 能把文字层抽出来。

你改完一按回车,字就回到图里了,特别顺手。
取舍直播中不少观众问,我日常使用的话,选用哪个模型呢?
模型好不好,先看你拿它干嘛。你要是图个陪伴、图点情绪价值,豆包值得你自己去摸透。我这边要的是复杂一点的调度、计划,还有对结果的把关。所以咱们的需求可能不同,你没有必要「抄作业」。真拿不准,就问自己三件事:干什么(陪伴还是干活)?预算多少?质量门槛多高?
国内模型,我最近用得多的就俩。一个是 DeepSeek V4 Flash,我把它接到 Pi Agent(一种能统一调度各家模型的框架)这类框架上。当然最近 DeepSeek Harness(DeepSeek 官方自己出的框架)闪亮登场,Pro 版本也一起发布了。我于是更多地采用官方 Harness + DeepSeek V4 Pro。

另一个是 GLM,旗舰模型 5.2 挺好用。之前让学生使用,调用地址栏没配好,做个 Mirofish(一个跑多主体社会仿真的工具)仿真几天就烧掉一两千块。好在这篇文章被会议录用了,学生也要去做报告,也算没白花钱。就在我写这篇文章时,GLM 5.3 也闪亮登场了。

各种 AI 怎么扬长避短,我一直念叨张玉新老师那四个字:重器轻用。哪件工具合适你手头这件活,就用哪件。别老幻想着靠一把锤子打遍天下。你呢,也不用追着问别人「你用什么」。先想清楚自己这活要什么,再用上面那三样去筛,答案自然就出来了。
编程,就上擅长编程的那副马具,例如 Claude Code 。按模板填 Word,就用会填表的那副,例如 WorkBuddy。想出图、出视频、想一键发布,就走创作那条路,试试 YouMind。干什么、预算、质量门槛,这三样对上了,就合适。再也不用追着问「到底哪家最强」。
实在拿不准哪个工具合适,可以试试下面的办法。先问 AI,大部分都能解决,但是注意检索出来的结果未必准,因为噪声始终存在;另一种方法是问真正上手用过的人。我在直播中能一条一条如数家珍,是因为提到的这些模型、框架工具我全都亲手用过。
AI 市场上的生态位多得很,没有哪一家能长期把所有人的需求全覆盖。找到适合自己的工具,开心地用就可以了。
边界文茹那串问题答完,现场又有人问了几个问题。我选择其中几个有代表性的给你说说。
Tommy 在医院工作,经常要查共识、指南、行标,问我知识库该用哪个。这里先分清一件事:你要往里装的,是公开资料,还是单位内部不能外传的东西。
公开的、通用的内容,选择就多了。别人做好的库,拿来就能用。我用得最顺的是得到大脑,能用大白话查,平时也能很方便地追加内容。得到大脑还留了对外接口,在支持 Skill 的各种 Agent 里能直接调。团队协作,飞书那一套大家更熟,我用的是给教育优惠的商业版。它也支持 Skill,可以在 Agent 里面调用。
一旦沾上保密、单位内部、科研档案,事情就变了。模型不能往外连,上传这些信息本身就可能是违规的,利用第三方云知识库也不合适。

有人问指导学生的论文,能不能用本地部署模型,免得泄密?信息不出本机,这点确实解决了。可你在家用普通笔记本部署的那个模型,跟 V4 Flash 这种能正常起作用的差着一截。拿安全换来的,常常是能力不够,出来的结果跟你想要的不是一回事。这才是更大的风险。不是本地部署不能做,是你得接受这个代价,才值得做。
用 Agent 盯期刊和论文,除了 OpenClaw,也可以看看 Hermes。这类轻量的定时任务,两者没有本质上的高下。安全问题多半出在用法上:装在单位电脑里,里面又有敏感数据,权限还全开,那就不是给自己装助手,是把大门钥匙挂在了门外。开源项目出过漏洞,一般也能较快被发现。听风就是雨,一听龙虾就如临大敌,没必要;乱授权,同样要不得。
这类轻活,模型用不着上最贵的。DeepSeek V4 Flash 我用官网 API 调过,前两天有一次大概 1.3 亿 token,人民币几块钱。
AI 在科研里读文献、起草论文、模拟审稿,该怎么合理用?得到上我有两门课。一门 2024 年开的,讲传统 AI 工具,更新到 2025 年收尾;另一门是有了 Agent、Claude Code、Codex 之后,怎么用 Skill 干这些事,是今年的新课。
小结说了这么多,落到最后其实就一句大白话:值不值,你自己算一笔账就知道。你一小时大概能挣多少钱?它替你省了几个小时?两个数一乘,盖得过那笔订阅费,就值;盖不过,就别掏。这跟工具新不新、贵不贵,没多大关系,全看你怎么用它。
选哪一个,想清楚三件事就够了:你是想让它陪你说说话、解解闷,还是想让它实打实替你干活?你打算花多少钱?活儿得做到什么份上,你才觉得这钱没白花?这三件事对上了,就从最低一档试起,用顺手了再往上加;一时拿不准,就别急着一次买一年,省得回头出了更好的,你守着一个用不上的后悔。
至于怎么用,就更简单了:哪件工具擅长你这件活,就用哪件,前面每一节都举过例子,照着配就行。别老想着一步到位买最贵的,配得上你手头这件活,才是合适的。
工具和模型会一直出新,但「先算值不值、再看自己要什么、从低档试起」这套路子不会过时。记住它,你往后就不用再追着人问「到底哪家最强」了。
如果你觉得本文有用,请点击文章底部的「推荐到博客首页」按钮。
如果本文可能对你的朋友有帮助,请转发给他们。
欢迎关注我的专栏,以便及时收到后续的更新内容。
延伸阅读
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-8-14 20:57
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社