Qwen 预览模型评测活动规则(二期)
一、活动对象
-
千问AI平台已实名认证的注册用户。
-
不支持虚商、RAM 用户(子账号)等账号参加此次活动。
-
每个用户在活动期间仅可参加一个评测类型,活动不可重复叠加。
二、活动时间
2026 年 9 月 22 日 – 2026 年 9月 30 日 23:59(UTC+8)。
三、活动规则
1. 活动流程及时间点
报名评测活动→ 完善报名信息并选择参与评测的类型 → 报名审核(审核通过后为参与用户发放对应评测类型的Token额度)→ 使用需评测的模型进行评测 → 按照要求提交评测报告→ 评测报告审核→ 审核通过后发放对应评测类型的代金券激励(报告审核结果通知后 15 个工作日左右)。
2. 参与方式
活动开始后,参与用户在千问 AI 平台活动页面完成报名,提交补充信息并完善报名信息,选择评测类型。报名审核通过后,系统将为用户报名账号开放评测模型体验名额,并给予对应评测类型的评测额度。参与用户在活动期间使用指定的模型进行评测,并通过活动页面提交评测报告。
| 评测类型 | 评测模型的Token 额度上限 |
|---|---|
| 体验评测 | 2000 万 Token |
| 深度评测 | 5000 万 Token |
| 专业评测 | 1 亿 Token |
说明:模型Token额度仅限于被评测的指定模型
3. 评测报告提交要求
-
评测报告内容:提交的评测报告应基于真实使用场景,按照所选择的评测类型对应的评测要求进行提交。评测报告须为参与者原创,不得抄袭或重复提交。参与者需以指定格式和技术规范提交测评报告,具体如下:
评测类型 评测简介 评测报告涉及内容 体验评测 提交 1 条及以上来自真实工作场景的复杂任务案例。 评测使用的 Agent / Harness、操作系统、评测任务所属领域、评测任务说明、整体体验评价及原因、评测产物、执行过程数据(非必选) 深度评测 提交 1 条及以上来自真实工作场景的复杂任务案例,并为每条案例附上执行过程文件。 评测使用的 Agent / Harness、操作系统、评测任务所属领域、评测任务说明、整体体验评价及原因、评测产物、执行过程数据 专业评测 使用自建评测集完成模型评测,并提交完整的评测报告和执行过程文件。如需共建评测集请通过官方钉群或邮箱联系我们 评测使用的Agent/Harness、操作系统、Benchmark任务所属领域、评测描述、评测体系介绍、评测对象输入/输出描述、评测逻辑、评测分析报告、整体体验评价及原因、执行过程数据 -
评测报告提交方式:通过千问 AI 平台评测时间活动页面统一提交。同一用户仅限提交一次有效的评测报告。
-
评测报告提交时间:活动参与用户应在活动截止日期前完成提交。
说明:参与用户提交的评测报告将被用于模型改进和技术研究,参与者在报名前请充分了解报名协议与隐私政策。参与用户提交的评测报告经去标识化处理后可能在平台公开展示;为便于展示与传播,主办方可对其作节选、格式调整、翻译等适当技术处理。
4. 评测报告审核维度
-
有效性审核:提交的评测报告应内容清晰、要素完整,且相关材料能够正常查看。因材料无法显示、内容残缺等原因导致报告无法审核的,活动主办方有权将其认定为无效材料。
-
原创性审核:评测报告须由参与者本人独立完成,不得使用 AI 代写,并应体现参与者基于实际评测过程形成的主观判断与真实观点。如经审核发现报告并非原创,或存在内容缺失、不符合评测要求、结论存在较大争议等情况,活动主办方有权取消相应激励或参与资格。
-
数据真实性审核:评测报告中的数据应以提交的截图或平台记录为依据,活动主办方将结合实际账号信息及相关记录进行交叉验证。如发现数据伪造、篡改或其他弄虚作假行为,活动主办方有权取消参与资格及相应激励。
-
**价值性审核:**评测报告应对模型优化具有实际参考价值。报告须结合具体使用场景和评测过程,明确指出模型存在的具体问题,说明问题的实际表现、触发条件及影响,不得仅作笼统、抽象或缺乏事实依据的评价;同时,应尽可能提出具有针对性、合理性和可操作性的改进建议。
-
审核标准参考如下:
| 审核项 | 标准 | 适用的评测类型 |
|---|---|---|
| 题目 | 场景真实、合理 | 体验/深度/专业 |
| 执行结果 | 提供成功/失败/部分成功的客观结果 | 体验/深度/专业 |
| 整体体验评价 | 至少给出整体评价(好/中/差) | 体验/深度/专业 |
| 评价原因 | 内容合理的理由,足以支撑评价 | 体验/深度/专业 |
| 过程可观察性 | 提供脱敏轨迹/工具事件/执行日志中至少一种 | 深度/专业 |
| 评测定义 | 明确能力维度和适用范围 | 专业 |
| 数据集 | 来源/版本/样本数明确 | 专业 |
| 评分规则 | 指标/公式/边界条件明确,最好提供脚本(附件形式) | 专业 |
| 结果报告 | 主指标 + 样本量 等分析 | 专业 |
5. 激励说明
-
**激励规则:**成功提交有效评测报告并通过审核的用户,可获得对应评测类型的 Token 代金券。
-
激励设置:活动设三个评测类型,对应不同额度的 Token 代金券激励。
评测类型 激励 体验评测 价值 100 元的千问 AI 平台 Token 代金券 深度评测 价值 300 元的千问 AI 平台 Token 代金券 专业评测 专属奖励 说明:实际发放为等值 Token 代金券,可适用于千问 AI 平台中的模型调用按量付费类产品,代金券使用说明详见:https://platform.qianwenai.com/docs/resources/coupons
-
激励发放:如评测报告审核通过,我们将在评测报告审核结果通知后15个工作日左右为您发放代金券。(如发现恶意刷量等行为,活动主办方有权取消激励。)
6. 特别说明
-
用户参加活动所获得的相关权益,仅限本账号使用,不得转让、出售或以其他方式换取利益。
-
本活动不与其他活动或优惠叠加适用。
-
除特殊情形外,用户参加本活动所获得的产品权益,不支持退订。如因特殊原因发生退订的,退订前需交回通过本活动所享受的相关权益。例如:补足差价、退还已使用的代金券金额等。
-
如用户在活动中存在刷量、虚构、作弊、欺诈或通过其他非正常手段规避活动规则、获取不当利益的行为,例如:作弊领取、恶意变现、网络攻击、虚假交易等,千问 AI 平台有权收回相关权益、取消用户的活动参与资格,并追究违规用户的法律责任。
-
活动名称仅为方便用户理解参考使用,不具效力,实际活动内容以具体活动规则为准。
-
千问 AI 平台可以根据活动的实际情况对活动规则进行改动或调整,相关改动或调整将公布在活动页面上,并于公布时即时生效;但不影响用户在活动规则调整前已经获得的权益。
-
如用户在参与活动中遇到问题,请发邮件至:qwenfeedback@notice.qianwenai.com。或加入“Qwen 共创计划”官方钉群(钉钉群号: 192960007967)
四、相关名词解释
-
千问 AI 平台:包含 www.qianwenai.com 的网站及其客户端,不包含国际站 Qwen Cloud(www.qwencloud.com)及其下属页面。
-
同一用户:根据不同阿里云官网账号在注册、登录、使用过程中的关联信息判断的同一用户(如同一手机号、邮箱、证件等)。
-
个人账号:是指同一用户拥有多个阿里云官网账号的,各个账号之间互为个人账号。
-
Token 额度:活动期间为用户分配的模型调用量上限,以 Token 数量计量。不同评测类型对应不同的 Token 额度。且Token额度仅限于被测评的指定模型使用。
-
评测报告:用户在使用内测模型过程中按要求格式提交的使用报告。
-
评测类型:活动设置的评测分类,不同评测类型对应不同的 Token 额度、评测要求和激励。
-
折扣说明:涉及"打折""折扣""×折"或"省××元"的价格比较,均以活动期间产品价格与非活动期间同类产品的日常最小单位售价(例如:月售价),按照相同购买时长进行比较后,所得的折扣结果。
-
权益归属:用户参与活动所获得的权益、责任,均归属于该千问AI平台账号对应的实名认证主体。
-
时间说明:时间流程中的"天""工作日"等指零点至 24 点(北京时间)。
-
订单有效性:PC 或无线端订单是否购买成功,以实际付款成功为准。
-
除有相反证据推翻外,用户参与活动所获得的全部权益和相应责任,均归属于参与活动的该千问AI平台账号所对应的实名认证主体。
-
对于恶意刷单、批量注册、违规套利等影响活动公平性的行为,千问 AI 平台有权取消活动资格并回收已发放的权益。
-
最终解释权归千问 AI 平台所有。