实测一句话生成雷霆战机,Qwen3、Kimi、GPT 谁最夯?
2026-07-2208:29
Biteye
2026-07-22 08:29
Biteye
2026-07-22 08:29
收藏文章
订阅专栏

过去一周,Qwen3.8-Max-Preview 与 Kimi K3 接连亮相,把国产大模型的参数规模推向 2 万亿级以上。

不过,大模型之争早就过了单看 Benchmarks、只看参数的版本。能够切实介入日常的工作流,才是衡量基模能力的最好标准。

对此,Biteye 今天决定是驴子是马,拉出来溜溜。

同样是“一句话做个 Biteye 风格的雷霆战机网页小游戏”的提示词,Qwen3.8、Kimi K3、gpt5.6 sol 三个模型交出了完全不同的答卷:

Qwen3.8:能动,也仅限于能动

GPT-5.6 Sol:视效好看,像品牌官网

Kimi K3:花活最多,游戏感最强

⚠️温馨提示:由于 Kimi K3 因为算力限制不再开放订阅,本次测试最终由 WorkBuddy 调用。

Qwen3.8:战机起飞了,结果没有然后 | 评价:1 颗⭐

https://x.com/i/status/2079865420576927996

🔗:试玩 Qwen3.8 版本

打开 Qwen3.8 版本,第一感觉是:逗我呢?

深蓝色背景,中间一个并非 Biteye 原生的 Logo,一个“开始游戏”按钮。标题里的黑色文字与深色背景融为一体,仿佛提前开启了隐身模式。

点进游戏后,基础功能倒是勉勉强强:

  • 鼠标拖拽战机
  • 自动发射子弹
  • 红色三角形敌机
  • 分数统计
  • 撞机与结束机制

实测中,战机可以持续射击,分数也一路涨到了 858,Qwen3.8 至少跑通了。

可问题是,整个游戏像一个刚搭好的 Canvas Demo:敌机是三角形,子弹是光点,玩法基本没有变化。没有任何武器成长、没有任何道具系统,也没有明显的关卡节奏。

就像 Qwen 团队自己宣布的那样,Qwen3.8 的后训练还没有做好,正在“按天迭代中”。

显然,美术和策划还没进群。


GPT-5.6 Sol:美工不错,玩法有待加强 | 评价:3.5 颗⭐

https://x.com/i/status/2079865420576927996

🔗:试玩 GPT-5.6 Sol 版本

打开 GPT-5.6 Sol 版本打开,气势一下就上来了。

左边是鲜明的任务,中间是战斗区域,右边是可视化雷达和遥测模块。深色背景配荧光青,再加上中英文混排和 Biteye 品牌元素,非常有 007 特工仪表盘的视觉感。

它的系统也比 Qwen 丰富不少,譬如:

  • Wave 波次
  • Armor 装甲
  • Overdrive 状态
  • Combo 连击
  • 最高纪录
  • 暂停功能
  • 鼠标和键盘双操作

实测中,游戏成功运行并拿到了 922 分。失败后不会简单地弹出“Game Over”,而是显示“战机离线”,重新开始则叫“重新连接”。从开始到结算,文案和视觉都保持着同一套世界观,这一点还蛮 fancy 的。

不过,GPT-5.6 Sol 的问题,就是太会做包装了。左右两侧的信息面板占据了大量空间,真正的游戏区域反而被压在中间。它更像一张完成度很高的品牌活动页,里面顺便嵌了一款小游戏。

相比 Qwen3.8,gpt-5.6 sol 的美术、品牌和运营全部到岗,不过游戏策划显然是摸了点鱼。


Kimi K3:别人在做 Demo,它开始加氪金点了 | 评价:4 颗⭐

https://x.com/i/status/2079865420576927996

🔗:试玩 Kimi K3 版本

Kimi K3 的首屏虽然没有 GPT-5.6 Sol 那么惊艳,但游戏说明一出来,味道就不一样了:

  • W:火力升级
  • S:星盾
  • B:炸弹
  • H:修复
  • 空格:释放炸弹
  • P:暂停
  • M:静音

进入游戏后,还有三条生命、火力等级、炸弹数量、暂停按钮和声音开关。

另外两个版本还在慢吞吞地解决“飞机怎么移动”,Kimi K3 已经开始考虑玩家捡到道具之后怎么玩了。

这也是三个版本最明显的差距:Qwen 做出了射击功能,Sol 做出了视觉包装,Kimi 则主动补上了道具、资源、成长和主动技能。

当然,它的画面仍然不算精细。敌机和特效大多是简单的几何图形,部分 Logo 素材贴得也比较直接。但作为一款小游戏,它最懂得不断给玩家新东西。

三个模型,分别招进哪个部门?

如果把三个模型当成新员工,这次测试大概是这样的

一句话生成游戏,拼的早就不只是代码

以 Biteye 的雷霆战机测试为例,现在让大模型写代码,做一个“飞机会移动、子弹会发射”的网页并不难。

但真正拉开差距的是,模型在前置逻辑训练后,会不会主动设计反馈、关卡、道具、成长和视觉主题。大模型不仅要理解代码,还要真正理解,玩家为什么愿意再玩一局。

【免责声明】市场有风险,投资需谨慎。本文不构成投资建议,用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。

专栏文章
查看更多
数据请求中

推荐专栏

数据请求中

一起「遇见」未来

DOWNLOAD FORESIGHT NEWS APP

Download QR Code