三款国产大模型协同重构网站实测:Qwen3.8-Max综合表现最优

近期,三款中国开源大模型——智谱GLM-5.2、月之暗面Kimi K3与阿里巴巴Qwen 3.8-Max-Preview被共同用于重构硅星人/品玩改版网站项目。该网站为半成品Next.js前端项目,集成Payload CMS与Anime.js动效,存在历史代码冗余、结构臃肿、前后端bug交织等典型“屎山”特征,测试聚焦模型在真实工程场景下的理解力、执行精度与协作能力。

首轮测试要求模型准确识别项目当前状态,区分已完成功能与历史文档中未落地需求。Qwen 3.8-Max-Preview以10秒内完成分析的速度和对近期开发动作的精准捕捉位列第一;Kimi K3次之,虽全局观强但出现CMS集合数量误判及文件夹归属错误;GLM-5.2对底层架构理解最深,识别出14个CMS集合、Payload版本锁定与数据库检查机制,却将已实现的全文搜索列为待办事项,混淆历史方案与当前状态。

第二轮测试针对前端报错诊断与修复。当因CMS未启动导致页面报错时,Qwen 3.8-Max-Preview直接启动CMS服务,响应最快且行动闭环;GLM-5.2在端口被占后选择复用已有服务,体现成熟工程判断,但响应滞后;Kimi K3仅提供文字解决方案,未执行操作,任务未完成。

第三轮测试考察前端精确修改能力,要求实现“此刻发生”板块无缝无限轮播:卡片持续左移,第08张移出后第01张从右侧自然衔接,禁止跳帧、停顿或空白。GLM-5.2完整保留自动轮播、鼠标拖动与循环逻辑,仅衔接处存在轻微跳帧,功能覆盖最全;Kimi K3实现真循环但取消自动播放,动画衔接不精细,属诚实半成品;Qwen 3.8-Max-Preview删除拖动功能,以内容复制伪装循环,架构不可扩展,属高风险错误方案。

第四轮测试要求统一修改“最新观点”板块视觉样式:强调色改为科技蓝(#3157FF),应用于标题、序号及悬停态;增加浅蓝边框与圆角;悬停时卡片上浮、边框变蓝。Qwen 3.8-Max-Preview修改范围最广,覆盖标题、序号、边框、圆角,唯独遗漏悬停态交互色;GLM-5.2主动询问修改边界,确认范围内执行准确,但未覆盖部分(如无图卡片、大卡片悬停色)完全遗漏;Kimi K3仅修改边框、圆角及一处颜色,其余未动,理解严重偏差。

第五轮测试为开放式审美任务:重设计首页Hero区域,体现科技媒体专业感、前沿感与编辑气质,禁用霓虹渐变、玻璃拟态等流行元素,动效应克制流畅。Kimi K3采用科技极简风,左侧文案+蓝色按钮,右侧辅以网格、细线与柔光动效,科技感最强;Qwen 3.8-Max-Preview呈现粗体极简媒体风,超大黑色标题三分屏,视觉重心突出;GLM-5.2走杂志编辑风,引入衬线斜体标题、EDITION 2026等期刊元素及滚动提示,风格辨识度高。按硅星人自身定位——本质为AI而非传统媒体——Kimi K3获第一,Qwen 3.8-Max-Preview第二,GLM-5.2第三。

第六轮测试聚焦CMS审核流程重构:要求集中展示待审文章列表,点击后右侧展开详情面板,含摘要、正文预览、审核操作,操作后同步更新状态与计数。Qwen 3.8-Max-Preview详情面板信息最全,含标题、作者、提交时间、状态、分类、摘要及正文预览,底部操作可直触“通过”或“驳回”,完全满足不跳转要求;Kimi K3基本信息与操作齐全,但正文预览简化过度,仍需跳转查看全文;GLM-5.2详情区被图片加载失败占位大面积覆盖,有效信息缺失最严重。

六项任务积分制排名(第一名3分、第二名2分、第三名1分)显示:Qwen 3.8-Max-Preview总分16分居首;Kimi K3得13分;GLM-5.2得12分。Qwen 3.8-Max-Preview优势在于响应速度快、对项目当前状态敏感,在项目分析、CMS启动、“最新观点”样式修改及审核工作台四项中均居首位;其缺陷亦源于求快倾向,如轮播实现中删减交互功能、以伪循环替代真循环。GLM-5.2展现深度架构理解力与完整功能实现能力,轮播与Hero设计各具风格,但响应慢、易受历史文档干扰。Kimi K3表现最具波动性,项目分析简洁但数字错误多,前端修改常漏关键项,却在CMS审核任务中率先完成,反映任务类型对其性能影响显著。本次测试仅针对硅星人网站重构这一具体工程场景,结果不构成模型综合能力排序依据。

免责声明:本文内容由开放的智能模型自动生成,仅供参考。

Copyright © DoNews 2000-2026 All Rights Reserved
京ICP备2025120072号