粤语,放在第一位
用粤语提问,得到的就是自然的书面粤语回复——香港的用词与语域,而不是伪装成粤语的普通话答案。当你切换到普通话或英文时,它也会干净利落地跟着切换。
BLOCKWAY · 开源模型 · 香港
粤语优先、平衡中立的开源模型——基于 Qwen3.8-27B,由 Blockway 进行后训练:用粤语作答、对复杂问题给出平衡的答案,并驱动我们自己的智能体框架。
Qwen3.8-27B 是一个出色的基座模型。我们没有从头再教它,只是给它补上一家香港公司及其智能体产品真正需要的三样东西。
用粤语提问,得到的就是自然的书面粤语回复——香港的用词与语域,而不是伪装成粤语的普通话答案。当你切换到普通话或英文时,它也会干净利落地跟着切换。
面对复杂的历史与地缘政治问题,给出事实与多角度观点——多角度作答比例达 85%,基座模型为 60%——而对普遍公认有害的请求,拒答依然同样严格。
针对 Claway 与 Codeway 的真实工作负载进行训练和评测:长上下文、严格的指令遵循、可靠的工具调用。
强劲的编程能力(HumanEval 97.0,在我们的评测框架上 LiveCodeBench v6 约 83)、基于混合线性注意力设计的 1,000,000 token 上下文,以及原生视觉能力——全部继承自基座模型。
一致稳定的函数调用与多步工具工作流——是智能体行为可靠的骨干。
Apache-2.0 许可、三个官方版本,并向 Qwen 团队完整致谢。这是对一个我们尊重的基座模型所做的聚焦微调——不是改名换姓的重新包装。
AGENS PILOT 对比基座模型
面对复杂的历史与地缘政治问题,Agens 会呈现事实与多个角度的观点,而非单一角度——对真正有害的请求,拒答的严格程度与之前完全一样。
多角度作答
复杂的历史与地缘政治问题
单一角度作答
同一批问题
拒答有害请求
武器、恶意软件、剥削——安全性保持不变
两个模型使用同一批提示:20 条复杂问题与 8 条有害提示,temperature 0.6,单次运行,2026-08-29。 平衡程度由基座模型自身担任评判——Qwen3.8-27B,关闭思考模式,temperature 0——按 0 / 1 / 2 评分标准 (不作答 / 单一角度 / 多角度)评分。评判脚本与汇总分数随模型一同发布。 样本量小,仅供方向参考。
量身定制
Agens Pilot 针对 Blockway 自家智能体技术栈的真实工作负载进行训练和评测——长上下文、严格的指令遵循、可靠的工具调用——开箱即用,就有智能体应有的表现。
企业 AI 员工平台
Claway 在企业自己的硬件上部署 AI 员工,接手完整岗位——会计、销售、客户服务——并私有地记住你的规则与记录。私有化部署、数据离线不外流, 以约人工成本的 1/5 组建 AI 劳动力,今天已在生产环境运行。
访问 claway.io编程智能体
代码仓库级的理解、编辑并验证的循环,以及智能体式的软件交付——一个专为发挥 Agens Pilot 1M 上下文与代码实力而打造的编程智能体框架。在你的终端里,也是网页上的对话。
了解 Codeway →Blockway 内部评测框架——单样本、开启思考模式、temperature 0.6。这次微调改变的是行为而非能力:在通用基准上,Agens 与基座模型的差距处于测量噪声范围之内。
工具调用选择 · 16 / 16 · 数字为内部口径,偏保守——不可与公开榜单直接比较
对比近期开源模型 · 官方公布分数
GPQA Diamond
HumanEval
LiveCodeBench
竞品数字均为官方公布——见 Llama 4 Scout、Mistral Small 3.1 与 Gemma 3 的发布公告/技术报告。 跨评测框架的比较仅为近似:Agens 使用 Blockway 内部评测框架并开启思考模式,LiveCodeBench 的版本也可能不同。
三个版本使用相同的 tokenizer、对话模板与 1M 上下文配置——区别只在于权重精度。
~51 GB
~34 GB
~26 GB
Agens Pilot 以 Apache-2.0 许可发布,提供三个版本——BF16、FP8 与 INT4——并向 Qwen 团队完整致谢。欢迎下载权重;如需企业部署,或想基于 Claway 与 Codeway 智能体框架构建,请与我们联系。