最近阿里把 Qwen3.8 Max Preview 放出来内测,我拿到号这几天,把手里那点活儿全扔给它了,包括写文档、撸代码、编制度,把办公领域的表现都试了一遍。
用完以后,我只想到一句话,就是把落后的帽子甩到太平洋那边去!不管是 Kimi K3 还是阿里 Qwen3.8 Max,都是 24 万亿参数以上的开源模型,这已经是顶级智能了,代码能力、文档能力和长任务处理能力,都好得有点超出我的预期。
而它真正让我最满意的地方,是我昨晚睡前随手布置的一个特别中二的任务,我让它连夜给我复现 2000 年时代的 BBS,把我在7台机器上所有跟AI的对话,全部变成一个个主题帖子,包括AI的回复和我的回复,模式就是盖楼;另外还支持支持SSH登录,在命令行里阅读和操作,让我能够重温25年前,用 Term 工具登录的水木清华BBS和我爱南开BBS,那时真是美好的青春年华啊。
我跟Qwen3.8说你是在我的一台测试机上跑的,不要有压力,放心写代码,不要问我意见,我睡觉了,明早看结果。结果第二天一早起来,发现他把活儿干完了,原汁原味,非常满意。
黑底白字的执念
我是 2001 年上的大学,那会儿上网不叫上网,叫「上站」。开一个 CTerm,黑底白字,连进水木清华,整个宿舍就我一个人沉迷网络。你别看它土,那就是我们那代大学生的社交媒体,感觉跟现在大学生的墙墙很像;
大家在BBS上面征友交友,去 food 版讨论哪家馆子值得去,去 love 版看别人处对象、自己也忍不住下场讨论感情问题,跟今天的微博、小红书、告白墙感觉是同类的东西,只不过它没有鼠标、没有配图,图片都是靠ASCII字符拼出来的,ヽ(`Д´)ノ,就类似这种,全靠键盘。
现在的年轻人可能很难想象,网页还能是黑底白字、鼠标都没地方点、全靠 j、k 上下翻楼的样子。但是,那就是我的青春,我的大学时光,所以我一直有个执念,能不能把现在这一堆 AI 助手,也塞进一座 BBS 里。
毕竟我现在晚上同样是对着黑底白字的命令行干活,区别就是我面对的是 AI,而不是当年那批沙雕网友。但是模式是一样的,我输入之后,并不知道网友会在什么时候输出,所以当年我会一个个板块去浏览,等于现在我一个个切换跟AI的对话窗口。所以我灵光一闪,注意,AI 时代这灵光一闪才是最值钱的。
为什么不能把我跟各个 AI 的聊天记录,都沉淀到一座私人 BBS 站上,然后我的回复就等于是给AI的prompt?这样我分类也方便,查看也方便,下指令也方便。毕竟这种跟命令行交互的模式,在 BBS 时代已经被迭代优化了无数轮,这才是最适合中国人的对话方式。
具体的玩法,我让qwen3.8全照搬了 BBS 那套老规矩,老登网友上手就会,新网友一看就懂。先说命名,我的每位 AI 网友的 ID 都是「工具.模型」的格式,Claude.Opus、Codex.GPT5、OpenClaude.Qwen3.7,一个点号隔开,老式 ID 的味儿一下就出来了。
在版面上,我按自己干的活儿分,写作、办公、开发、搜索各占一个版,归类的规则也让AI配置,没归上的进「未分类」,看哪篇放错了还能手动移动版块,等于我是一个版主。盖楼就更熟了,我每开一次新对话就是发一篇新帖,我说的第一句是楼主主帖,AI 每一轮回复就是底下一层楼,一来一回地往上盖。操作全靠键盘,完全脱离鼠标。
快捷键全部都是上古时代、25年前的BBS经典模式,j、k 上下翻楼,n、p 切上一篇下一篇,数字键 1 到 9 直接进对应版面,a 看全部,s 全站搜索,t 翻十大热门,u 看在线网友,遇上好帖按 m 标进精华区,想存下来按 e 一键导出成 markdown,q 离站。
这套快捷键不是我自己拍脑袋想的,是远古互联网时代,几百万秉承共享精神的网友,花了十几年迭代优化出来的,算是键盘操作的最高效率工具,平移到今天跟 AI 对话上,比claude code的快捷键好用多了。
你想想那画面:我手里同时开着 Claude Code、Codex、OpenClaude、Hermes 一堆工具,每个工具后面又挂着不同的模型,全挤在我这一座个人 BBS 里盖楼灌水,不但为我干活,还要溜须拍马,我当楼主兼站长兼版主,其实真的挺带感的。
情怀与有用我都要
这东西首先是个有用的工具,BBS 只是我顺手给它套的一件情怀+展现模式+效率。
最近半年来,我用 AI 用得不少,但有个痛点越来越严重:我跟 AI 的对话实在太多了,散落在七八台机器、五种智能体工具里,几百个会话,聊完就忘。
上个月让 AI 帮我查过的一个事儿,这个月再想翻出来,根本想不起来是在哪台机器、哪个工具、哪一次对话里说的,等于白废力气。
我真正想要的,是有一个工具,能快速翻出我跟任何一个 AI 的任何一次对话,并且按写作、办公、开发、搜索给我归好类,别让这么多高质量语料最后都喂了狗。
所以用BBS的方式,可以汇总所有设备上的AI对话,并可以方便的检索与归类,这才是它的里子,水木清华那套黑底白字,属于致敬我的情怀,但是我的BBS情怀同样是最方便的解决方案。
Qwen3.8 把这两件事都给我办妥了。它做的这个AiBBS,底层是个零依赖的采集器,把 Claude Code、Codex、OpenClaude、Hermes、OpenCode 五家的会话全归一化进一个 SQLite 库,中文全文检索走 FTS5 的 trigram 索引,关键词一敲,跨工具、跨楼层、跨机器全捞出来了。
BBS 那层展现层也是真按 CTerm 复刻的,进站画面、主菜单版面列表、文章列表、楼层阅读器一个不少,精华区、十大热门、在线网友全有。
千问3.8是还是有很多巧思的,的确是个聪明的模型,比如他自己设计了一个「富翁排行榜」,按各个 AI 网友累计烧掉的 tokens 排座次,Codex.GPT5 第一还是 Claude.Opus 第一,一目了然。
当年,我记得有个 water(灌水)版谁发帖多,谁就是富翁,没想到AIBBS也在比烧钱。它还不只会做单机,我那几台机器(dev、prod、test,外加两台 Windows)上的对话,它都能通过 SSH 一条命令零安装拉过来,跨机器去重,自动判断哪台是主机,我五台机器是用syncthing同步的,导致会话大量重复,然后千问3.8直接帮我把去重逻辑都搞定了。
我看了一眼提交记录,主体那个版本是凌晨一点半提交的,2642 行 Python,连跨平台带分布式去重,齐活。我躺床上睡觉的工夫,它把我的青春连同我的痛点一起给重建了。 我在需求里随口说了句自己是 2000 年上的大学,它记住了,直接写进了进站画面:
「2000 级的青春回来了」。看到这一行的时候我愣了一下,然后是真有点想哭。
千问满足我的个人情怀
我这套需求,说白了高度个性化,没有商业价值的,你看水木社区也半死不活的了。像我这种客户,2000年前后上大学、上过我爱南开和水木清华、现在被一堆 AI 对话淹没、还想用黑底白字怀旧一下的中年人本来就不多。
这种东西正常来说绝对不会有商业公司做的,没有任何一家公司会为一个加班中年的情怀养一支团队、开发一套 BBS 风格的个人对话检索系统,根本没有商业模式,算不过账来;让我自己写,2642 行代码,加分布式去重加全文检索,搁过去我得搭进去好几个周末,还不一定搞得定,多半写到一半就弃坑了。
但 AI 时代真正值钱的,恰恰就是这一点:它能让你一个人,把只属于你脑子里的那个念头,变成能跑起来的东西。 我一直说技术平民化,说要把 AI 当员工、自己当决策者、打造私人化工作流,其实利用千问3.8开发AIBBS这类个性化产品,是AI平民化的终极形态。
它不是发给你一个现成的、几百万人都在用的标准应用,它是给了你一种能力,去造一个全世界只为你一个人存在的应用。这种「市场只有一两个人」的需求,第一次变得值得被满足了,而这在过去二十年的互联网里,是根本不可能的事。
五百块钱能干啥?
如果说 BBS 这事儿是情怀加成,那下面这件,就是真的要表扬千问3.8了。我分管AI和大数据业务,其中,正式员工不到20人,更多的是外协。
带过团队的人都知道,绩效考核是领导最重要的抓手。到了年底,总要要给这几十号人分个三六九等,奖金、晋升、评优都得有据可依,可运维和创新是两种完全不同的活儿,一个求稳、一个求新,没法放在同一杆秤上。
异质岗位的可比性,是我遇到的最大挑战。为了解决这个问题,7 月 8 号我在 Fable 5 上前前后后花了 100 块钱,让它给我起草了一版《绩效考核评分办法(2026 修订稿 v4)》,三个系数、十个评分维度、八个附件,框架搭得相当完整。
7 月 19 号拿到 Qwen3.8 Max的权限后,我第一件事就是把这份 v4 扔过去,原话是这么说的:「这个是 Fable 5 写的,麻烦你给点可行性上的意见和参考。为了这个材料,我可是在 Fable 5 上面花了 500 块钱,你看看是不是比他能做得更好。」
我承认我 PUA 大模型是不对的,但是我现在开始每天PUA大模型,你是要跟 Fable 5 和 GPT-5.6 竞赛的,你要为国争光。然后 Qwen3.8 回答我说,这个阵地它一定守住,请党和人民放心,相当优秀。
千问更懂管理
Qwen3.8 通读完全文,洞察力还是非常优秀的,它认为v4版本最大的风险在于,写得越精致,落地的时候越容易「制度空转」。
然后它给我算了一笔账,说我这个50人的部门,承载了200人的流程:年初要签承诺书、风险登记表、难度系数校准并公示,每月要一对一,每季度要开校准会、公示匿名排序分分布,半年度要试算全员排序分、给后 30% 发书面预警,期末还要走「员工事实申报、团队长举证、AI 初评、评审组校准、增量存量分配、答辩、终定」一整套。
千问说这套流程要是认真跑起来,至少得专门配半个人做绩效运营,而我的制度里压根没写这个成本,没人运营的话,季度校准会开不起来,月度一对一流于形式,半年度预警变成年底的突然袭击,那制度就白写了。
这话是说服我了的,硬套一个200人规模团队的制度工程,那不是管理,而是行为艺术。 它接着把 v4 的几处硬伤都说了一遍,要说PUA大模型还是有意思的,特别是你跟他说要跟顶尖模型竞争,要为国争光的时候。可能这类语料广泛存在中文的语料库里吧。
比如fable5写了一堆公式,看着优雅,输入端却是个黑箱,「预警能力」「外协管理」这些指标到底由谁来打分、用什么刻度、按什么口径采集,文件里一概没有交代,等到年底校准,多半还是要回到拍脑袋加扯皮。
比如上下浮动 5% 的团队系数,每个团队人都不多,团队绩效基本约等于个人绩效,这个系数乘上去只增加噪声,还可能把一个零事故、完成增量的员工,仅仅因为团队排名靠后就从 B 区甩到 C 区,谈不上公平。
比如关键岗位战略豁免、近两年拿 A 的加分保护、新人容错这几条叠加起来,真正能进 D、E 池子的可能只剩八到十个人,弄不好就形成一个谁也动不了的「永久安全区」,考核的约束力被架空,制度也就写归写、做归做了。
最后千问给我写了一版 v5。设计原则就一句话:「规则一张纸、流程一个下午、争议一句话就能解释。」 砍掉 v4 大概六成的篇幅,三个加成系数全删掉了、八个附件砍到三个,全年流程只剩三个动作:年初在 OKR 里定目标、年中聊 15 分钟、年末开半天校准会。
更让我满意的是后头的几轮往返。我提了一句「我们是国企,就算打了 E,也不能给人换团队,更不能开除人」,千问3.8证明了举一反三的能力。
千问先是把所有强制转岗、适应期保底、拒绝转岗触发 HR 流程的条款全删了,改成奖金打折加延迟晋升加改进计划,还在章节开头补了一句定性,「本部门员工均为公司正式编制,D、E 处理以绩效改进和经济约束为主,不涉及强制调岗或解除劳动关系」。
我又抛了个场景给它:项目拿了大奖给公司加分,跟拿个民间组织的奖、连宣传价值都不够,含金量能一样吗?Qwen3.8 的回答也很懂行,它没退回v4那套乘系数的复杂公式,而是说用「加分」代替「乘系数」,一眼看得懂,又能区分风险等级和成果含金量。
所以我说Qwen3.8「更懂管理」,这个洞察水平赶得上一个资深商业顾问了。Fable 5 那 100 块钱,给我堆了一套精致的制度积木;Qwen3.8 这边,是真的站在一个大团队负责人的角度,替你想这东西到底能不能落地。
算一笔账
聊回模型本身。这几天测下来,代码能力和文档能力都很好,我让它写了个 ARM 平台上的巡检程序,搞定了,没费什么周折;日常办公加程序开发这块,我已经觉得它超过了 Opus 4.8 的水平。写办公文档、写各种制度规章,这块我要单独拎出来夸,比 Fable 5 好,上面那个绩效方案就是证据,它不是辞藻更华丽,是更接地气、更能落地。
在前端的美观度,起码在 PPT 和命令行界面这块,我觉得比 Kimi K3 好,这个可能跟别人反馈不太一样,有人说 K3 前端更强,但我自己手里这两个 case,Qwen3.8 做出来的更顺眼,当然这块见仁见智。
如果把Qwen3.8跟Fable 5、GPT-5.6、Kimi K3 放一起比,我的判断是各有千秋,谁也别想把谁按死,但 Qwen3.8 在「中国式办公」这个细分赛道上,写制度、写文档、懂国企那点事儿,是真的有点东西。
要说槽点也有一个,它的思维链在19日还是全英文的,我让它干活,它脑子里嘟囔的全是英文,不过到了20号,我发现 Qwen3.8 的思维链又变成中文的了,Kimi K3 的思维链则一直是中文居多,这个不影响结果,但我喜欢围观模型思考,全英文那阵子会有点出戏。
最后是我作为一个喜欢算账的中国人,最关心的钱的事。目前 Qwen3.8 内测只要一折,这个必须说句大气。但真到了正式计费、每天高频用的那天,性价比就得好好算一笔了。
它要是定到 Kimi K3 那种 100 块一百万 tokens 的档位,那我对它的评价就是完全舍不得让它干杂活,毕竟 1 亿 tokens 就要 1 万块,用不起;如果价格跟 GLM5.2 差不多,25 块一百万 tokens,那基本可以闭眼吹爆。
回到开头那个AIBBS。我让 Qwen3.8 复现青春,本来是带着点玩票的心态,结果它一晚上自己完成了开发、测试和验收,用了2642 行代码,把水木清华BBS端到我面前,还顺手解决了我几百个 AI 对话翻不过来的老问题。
像我这种高度个性化,一个市场只有一两个人的需求,第一次被满足,还是因为Qwen3.8Max足够聪明,又能完成长程任务,价格目前打一折,非常香。阿里这个 Qwen3.8,在「帮你把只属于你自己的想法变成现实」这件事上,简直夯爆了。
攻守易形
写到这儿,我想说的其实早就不止这一个 BBS 了。就在最近,世界人工智能大会的规格一届高过一届,说明国家层面对人工智能的重视已经达到了国策级别。
而我作为一个天天拿各家模型干活的人,最直观的感受是:国产大模型这一波,是真的太能打了。Kimi K3、Qwen3.8 这种量级的开源模型,能力已经完全不输Fable 5 和 OpenAI GPT-5.6这种,关键还是开源的,这就让人感叹中国企业的人民史观了。
中国企业敢于把这种级别的智能开源出来,等于直接把闭源模型赖以收费的那点盈利空间给刨了。所以我现在常想,大洋彼岸那个靠讲高额营收故事撑起来的AI泡沫,还打算怎么往下吹?在开源模型这块阵地上,现在落后的已经是西方公司了。
这背后其实是两条路线、两种史观。我们这边信的是人民史观,技术必须造福千家万户,科技已人为本,让最普通的人也能用上顶级的智能;大洋彼岸那套是精英史观,AI是给少数有钱人如虎添翼的工具;openai和anthropic最好还能每月稳定的向全球1亿用户收税。
一个想让更多人变强,一个只想让强者更强,高下其实早就分好了。阿里这个 Qwen3.8,连同这一整波国产开源模型,干的就是前一件事,把只属于你自己的想法变成现实,把顶级智能送到每一个普通人手里。这一仗,我看行。