学习

根据标准设计评分量表

把标准转成可观察、彼此区分且可一致评分的维度

9 分钟准备已测试:ChatGPT复核日期: 2026-08-28
1

补充你的背景

你填写的内容只保留在当前浏览器中,AILesson 提示语不会将其发送给模型或服务器。

2

生成的提示语

未填写的字段会保留为占位符,你仍然可以复制后自行编辑

请严格依据所提供任务和标准设计评分量表。

任务、标准、目标、证据和协助规则:
[task]

水平、类型、表现等级、分值、权重和用途:
[scoring]

无障碍、语言、形式、协作和标准分离约束:
[fairness]

把要求映射到评价维度,并标记标准不支持的拟议维度。使用可观察证据,不评价人格、猜测的努力或模糊形容词。维度互不重叠,避免重复扣分。每级描述质量、准确性、完整性、独立性或迁移的连贯差异,不只依赖错误数量或“优秀”等标签。核验分值与权重。加入缺失、部分、矛盾和等效形式证据规则及不评分内容。提供两个边界校准案例,不虚构学生作品。检查对齐、清晰、无障碍、偏见代理、重叠、计算和评分者一致性。
默认保护隐私提示语在浏览器本地组装。除非所在组织明确允许,否则不要把机密信息提交给任何 AI 服务。

从输入到成果

实际案例

看看具体背景如何通过这条配方转化为可使用的成果

实际输入

任务与标准
成人职场课程:用所给数据完成4分钟建议简报。标准:有准确证据的决策相关主张;一个重大局限;面向指定受众组织。可用笔记,不得用外部数据。
评分设计
分析型,达标/发展中/尚未达标,20分。证据准确性至少一半。用于认证与反馈。
公平约束
现场或预录。不评价口音、魅力、幻灯片设计或眼神。允许字幕和辅助技术。主张质量与组织分开。

示例输出

权重:主张与证据10分;重大局限5分;受众组织5分;总计20分。

主张与证据——达标9至10:可行动建议准确使用数据并解释联系,不用外部数据。发展中5至8:建议可识别,但相关性、选择、准确性或联系不完整;重大数值错误最高6分。尚未达标0至4:没有可行动主张、证据缺失或严重不准,或必须依赖外部数据。 局限——达标5:有证据的局限,并解释它对信心或使用的影响。发展中2至4:局限相关但后果不完整。尚未达标0至1:缺失或无关。 组织——达标5:受众在4分钟内能找到建议、支持、局限和下一步。发展中2至4:要素存在但顺序遮蔽决策需要。尚未达标0至1:关键要素无法定位。

现场与预录使用相同描述。不评价口音、魅力、眼神、视觉或制作。校准A:证据准确但局限只被点名未解释,证据可达标,局限为发展中。校准B:组织精美但错报改变决策的数字,证据不得达标。认证评分前用同一样例校准8分与9分边界。

为什么有效

  1. 1

    可观察描述减少印象式评分并使反馈可行动。

  2. 2

    校准案例在真实评分前暴露模糊边界。

检查结果

  • 两名评分者能否为各描述找到相同证据?

  • 维度是否独立、对齐且计算正确?

  • 量表是否避免无依据的风格或获取条件惩罚?

更多探索方式

这条配方出现在哪里

继续完成任务