过去一周,Qwen3.8-Max-Preview 与 Kimi K3 接连亮相,把国产大模型的参数规模推向 2 万亿级以上。
不过,大模型之争早就过了单看 Benchmarks、只看参数的版本。能够切实介入日常的工作流,才是衡量基模能力的最好标准。
对此,Biteye 今天决定是驴子是马,拉出来溜溜。
同样是“一句话做个 Biteye 风格的雷霆战机网页小游戏”的提示词,Qwen3.8、Kimi K3、gpt5.6 sol 三个模型交出了完全不同的答卷:
Qwen3.8:能动,也仅限于能动
GPT-5.6 Sol:视效好看,像品牌官网
Kimi K3:花活最多,游戏感最强
⚠️温馨提示:由于 Kimi K3 因为算力限制不再开放订阅,本次测试最终由 WorkBuddy 调用。
https://x.com/i/status/2079865420576927996
🔗:试玩 Qwen3.8 版本
打开 Qwen3.8 版本,第一感觉是:逗我呢?
深蓝色背景,中间一个并非 Biteye 原生的 Logo,一个“开始游戏”按钮。标题里的黑色文字与深色背景融为一体,仿佛提前开启了隐身模式。
点进游戏后,基础功能倒是勉勉强强:
实测中,战机可以持续射击,分数也一路涨到了 858,Qwen3.8 至少跑通了。
可问题是,整个游戏像一个刚搭好的 Canvas Demo:敌机是三角形,子弹是光点,玩法基本没有变化。没有任何武器成长、没有任何道具系统,也没有明显的关卡节奏。
就像 Qwen 团队自己宣布的那样,Qwen3.8 的后训练还没有做好,正在“按天迭代中”。
显然,美术和策划还没进群。
https://x.com/i/status/2079865420576927996
🔗:试玩 GPT-5.6 Sol 版本
打开 GPT-5.6 Sol 版本打开,气势一下就上来了。
左边是鲜明的任务,中间是战斗区域,右边是可视化雷达和遥测模块。深色背景配荧光青,再加上中英文混排和 Biteye 品牌元素,非常有 007 特工仪表盘的视觉感。
它的系统也比 Qwen 丰富不少,譬如:
实测中,游戏成功运行并拿到了 922 分。失败后不会简单地弹出“Game Over”,而是显示“战机离线”,重新开始则叫“重新连接”。从开始到结算,文案和视觉都保持着同一套世界观,这一点还蛮 fancy 的。
不过,GPT-5.6 Sol 的问题,就是太会做包装了。左右两侧的信息面板占据了大量空间,真正的游戏区域反而被压在中间。它更像一张完成度很高的品牌活动页,里面顺便嵌了一款小游戏。
相比 Qwen3.8,gpt-5.6 sol 的美术、品牌和运营全部到岗,不过游戏策划显然是摸了点鱼。
https://x.com/i/status/2079865420576927996
🔗:试玩 Kimi K3 版本
Kimi K3 的首屏虽然没有 GPT-5.6 Sol 那么惊艳,但游戏说明一出来,味道就不一样了:
进入游戏后,还有三条生命、火力等级、炸弹数量、暂停按钮和声音开关。
另外两个版本还在慢吞吞地解决“飞机怎么移动”,Kimi K3 已经开始考虑玩家捡到道具之后怎么玩了。
这也是三个版本最明显的差距:Qwen 做出了射击功能,Sol 做出了视觉包装,Kimi 则主动补上了道具、资源、成长和主动技能。
当然,它的画面仍然不算精细。敌机和特效大多是简单的几何图形,部分 Logo 素材贴得也比较直接。但作为一款小游戏,它最懂得不断给玩家新东西。
如果把三个模型当成新员工,这次测试大概是这样的
一句话生成游戏,拼的早就不只是代码
以 Biteye 的雷霆战机测试为例,现在让大模型写代码,做一个“飞机会移动、子弹会发射”的网页并不难。
但真正拉开差距的是,模型在前置逻辑训练后,会不会主动设计反馈、关卡、道具、成长和视觉主题。大模型不仅要理解代码,还要真正理解,玩家为什么愿意再玩一局。

【免责声明】市场有风险,投资需谨慎。本文不构成投资建议,用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
