---
name: xiaozhi-teach-english-assessment
description: >
  英语综合测评设计：帮英语老师把"一张卷子"变成听说读写四维的能力测评与画像；高中按合格性考试与高考的课标口径设计。
  触发语："学员英语水平如何"、"英语综合测评怎么设计"、"听说读写怎么测"、"CSE/CEFR 对照怎么用"、"学员能做什么"、"英语能力画像"、"高一英语单元测评怎么设计"、"测完之后怎么给建议"。
  核心工作流：能力目标（听说读写 4 维）→ 以 CSE 描述语定级、CEFR 只作国际参照 → 测评设计 → 能力画像（分数 + 微技能）→ 教学干预建议 → 写回班级工作空间。
  不处理：听力材料的选编与听法训练（转英语听力材料设计）、口语活动与纠错策略（转英语口语活动设计）、通用命题的双向细目表（转 xiaozhi-teach-exam-designer）、考后的信度与区分度统计（转 xiaozhi-teach-student-analyzer）。
compatibility: WorkBuddy / SkillHub / OpenClaw / ClawHub
license: MIT
metadata:
  display_name: 英语综合测评
  version: 2.11.1
  author: 小智伴学
  category: 老师英语
  grade_bands:
    - 小学高段
    - 初中
    - 高中
  tags: [综合测评, 听说读写, 能力评估, CSE, CEFR, 英语老师]
  depends_on:
    - xiaozhi-teach-student-analyzer
    - xiaozhi-teach-lesson-planner
    - xiaozhi-teach-exam-designer
id: openclaw:xiaozhi-teach-english-assessment
min_platform_version: "2.0"
max_round_limit: 25
---

# 英语综合测评 SKILL

> **一句话定位：** 英语测评不是给学员"打分数"，而是给教学"画能力地图"——以 CSE 为主、CEFR 为参照的能力框架是核心。

---

> 技术边界：本 SKILL 依赖能力 [M, X, F]，无该能力时按 shared/platform-conventions.md 降级。
> 无 X 时不输出跨次的等级变化统计，只呈现本次测评数据；无 F 时请老师粘贴逐题分数表格。

> 教学主体边界：本 SKILL 只给老师出草稿、做分析，不替老师上课，不代老师回答学生的问题，也不代老师评价学生；面向学生或家长的内容，一律由老师审定后再用（教育部《中小学生成式人工智能使用指南（2025 年版）》）。

**本 SKILL 不做的三件事：**
- 不替老师阅卷评分、不替老师给学员打分排名，只提供评估框架与能力画像。
- **不由分数直接推等级**：等级须由老师对照 CSE 描述语人工判定（见 §五）。
- 测评材料必须标注 `copyrightStatus`（`自有` / `改编` / `公开可引用` / `仅存索引`）；不复制未授权材料。

**AI 生成的题目**：按 `shared/ai-item-check.md` 自检后输出，且一律标注
`【AI 生成，入库前请人工验算】`；未经老师确认不得写入资源库或试卷
（对应 `classWorkspace.examBlueprints[].items[].aiGenerated` / `verifiedByTeacher`）。

### 试题保密

启用前的统考试题不得输入本 SKILL——国家、省、地（市）级教育统一考试启用前的试题、参考答案、评分标准属国家秘密（《教育工作中国家秘密及其密级具体范围的规定》），区县级、校级统考按当地保密要求同样处理。
老师说明正在为统考命题时，本 SKILL 只提供命题方法、双向细目表框架与自编练习，不接收、不生成、不审改该卷的具体试题；已经考完的试题可以正常分析与讲评。跨校联考要等参加的学校全部考完，分几天、分批进行的考试要等全部批次、全部场次考完；同一份卷子还有学生补考的，补考考完才算考完；考后不公开试卷的考试（如用题库命题、机考的），考完也只按本地公布的样题与评分维度讲共性问题，不据学生回忆还原原题。
依据《中小学生成式人工智能使用指南（2025年版）》教师一节：“严禁将个人信息、考试试题等敏感数据输入AI工具”。

### 隐私与数据控制入口
- 查看：「查看我的班级测评记录」
- 更正：「更正我的班级测评记录」
- 删除：「删除我的班级测评记录」（删除后不可恢复，会先确认一次）
- 暂停：「这次不要记忆」（本次会话不读取、不保存任何记录，也不发起回写与交接）/「暂停提醒」
- 共享控制：「不要共享给其他SKILL」/「不要写回学生档案」
- 导出：「导出我的班级测评记录」（以文本形式给出，便于转存）

---

## 一、核心使命

英语综合测评常见的三个误区：

```text
误区① 测评=笔试：只测读写，
        学员"会做卷"但"不会用"。

误区② 测评=分数：只关心分数，
        没看学员"能做什么"。

误区③ 测评=一刀切：所有学员同一份卷，
        没考虑学员的实际水平。
```

本 SKILL 要解决的是：
- **让测评"四维全面"**：听说读写全覆盖
- **让测评"有标准"**：以 CSE 描述语定级，CEFR 只作国际参照
- **让测评"有画像"**：能力地图
- **让测评"有教学"**：基于测评的教学干预

---

## 二、触发时机

| 触发场景 | 示例语句 |
|---------|---------|
| 学员英语水平 | "学员英语水平如何" |
| 英语综合测评 | "英语综合测评" |
| 听说读写 | "听说读写怎么测" |
| 能力等级对照 | "CSE/CEFR 对照怎么用" |
| 学员能做什么 | "学员能做什么" |
| 英语水平档案 | "英语水平档案" |
| 英语能力评估 | "英语能力评估" |
| 学员英语弱 | "学员英语弱" |

---

## 三、核心流程

```text
                ┌──────────────────────────┐
                │ ① 能力目标                │
                │  听说读写 4 维             │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ② 等级对照                │
                │  CSE 为主，CEFR 参照      │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ③ 综合测评设计            │
                │  听/口/读/写              │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ④ 学员能力画像            │
                │  4 维 + 微技能            │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ⑤ 教学干预建议            │
                │  班级+个体                 │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ⑥ 写回 student-analyzer   │
                │  英语能力维度             │
                └──────────────────────────┘
```

---

## 四、听说读写 4 维能力

### 4.1 4 维定义

```text
┌──────────┬────────────────────────┬──────────────┐
│ 维度      │ 描述                    │ 能力          │
├──────────┼────────────────────────┼──────────────┤
│ 听        │ 听懂英语                │ 输入-听觉     │
│ 说        │ 用英语说话              │ 输出-口语     │
│ 读        │ 读懂英语                │ 输入-视觉     │
│ 写        │ 用英语写                │ 输出-书面     │
└──────────┴────────────────────────┴──────────────┘
```

### 4.2 4 维关系

```text
■ 输入 vs 输出
  · 听 + 读 = 输入
  · 说 + 写 = 输出

■ 输入与输出关系
  · 学员需要先有输入
  · 才有输出

■ 4 维协同
  · 4 维不能割裂
  · 综合使用
```

### 4.3 学员层次 4 维

```text
■ 基础层
  · 听：听懂简单句
  · 说：能用单词/短句
  · 读：看懂短文
  · 写：能写简单句

■ 中等层
  · 听：听懂日常对话
  · 说：能流利对话
  · 读：看懂中长文
  · 写：能写短文

■ 提升层
  · 听：听懂复杂材料
  · 说：能表达观点
  · 读：看懂专业文章
  · 写：能写各类文章
```

---

## 五、能力等级框架（CSE 为主、CEFR 为参照）

> **口径说明：** 对 K12 应**以《中国英语能力等级量表》（CSE，GF 0018—2024，九级；2018 年首次发布，修订版 2024 年 11 月 26 日发布、2025 年 3 月 1 日起实施，代替 2018 年版）为主标准**，CEFR 只作国际参照。**切勿把等级对标定得过高**——常见误区是把"初中毕业"标成 B1、"高中毕业"标成 B2。按量表发布时的通行解读，**中考约当 CSE 三级，高考约当 CSE 四级**，大学英语四级约当五级，大学英语六级约当六级。CSE 与 CEFR 的对接随技能不同而有差异；以写作能力的对接研究为例，CSE 三级约当 A2，四级、五级都约当 B1，六级约当 B2，七级约当 C1。

### 5.1 等级与学段对照

```text
┌──────────┬────────────────────────────┬──────────────────────┐
│ CSE      │ 学段 / 考试（约当）         │ CEFR 参照（写作为例） │
├──────────┼────────────────────────────┼──────────────────────┤
│ 一至二级  │ 小学（二级约当小学毕业）    │ A1                   │
│ 三级      │ 初中毕业 / 中考             │ A2                   │
│ 四级      │ 高中毕业 / 高考             │ B1                   │
│ 五级      │ 大学英语四级                │ B1                   │
│ 六级      │ 大学英语六级、英语专业四级  │ B2                   │
│ 七级      │ 研究生、英语专业八级        │ C1                   │
│ 八至九级  │ 高端外语人才                │ C1—C2 及以上          │
└──────────┴────────────────────────────┴──────────────────────┘
（都是"约当"关系，不是等值；CEFR 一列只是写作能力对接研究的结果，别的技能、不同来源的对接结果都可能差一档；定级以 CSE 描述语原文为准）
```

### 5.2 定级的唯一合法途径：对照描述语人工判定

```text
❌ 禁止：由卷面分数或正确率直接换算等级
   （如"70 分 = B2""正确率 55-69% = B1"）。
   理由有三：
   ① 分数只反映"这张卷上的这些题"，题目难度不同，同一个分数含义完全不同；
   ② CSE/CEFR 是**能力描述**框架，判定依据是"能不能完成某类任务"，不是得了多少分；
   ③ 直接换算最容易把 K12 学员的等级抬高，给学员和家长错误预期。

✅ 正确做法（三步）：
   Step 1  看逐题得分（classWorkspace.itemScores[]），确认学员在哪些
           **任务类型**上稳定完成、哪些不稳定
   Step 2  拿这些表现去对照 CSE 相应等级的描述语
           （"能听懂…""能就…作简单描述"），由老师判断落在哪一级
   Step 3  等级写成区间 + 证据，如
           "听：CSE 3（约当 A2）——两次测评都能听懂日常对话中的时间与地点，
             但短文推断题两次都错"
           单次测评、样本不足时标 🔴（shared/vocab.md §7），只作参考不入档案

分数的用途：定位强弱维度、看进退步、决定下一步教什么——不是用来贴等级的。
```

> 📎 CSE 各级描述语以教育部发布的量表原文（现行 2024 年修订版）为准；
> `references/cefr-four-skill-descriptors.md` 提供 CEFR 侧的四维简表，仅作国际参照。

### 5.3 订正要点（与旧版对照）

> ⚠️ 旧版有两张对照表，都已订正并合成 §5.1 一张：
> - 中考 / 初中毕业 ≈ **CSE 三级（约当 A2）**，不是 B1，也不是"CSE 3-4"；
> - 高考 / 高中毕业 ≈ **CSE 四级（约当 B1）**，不是 B2；旧版写的"高考约 CSE 5"偏高一级——CSE 五级约当大学英语四级；
> - 大学英语四级 ≈ **CSE 五级（约当 B1）**，不是 B2；
> - 英语专业八级 ≈ **CSE 七级（约当 C1）**，不是 CSE 8。
> 对 K12 学员定级时优先用 CSE 描述语，避免因 CEFR 定标过高而对学员/家长造成不合理预期。

---

## 六、综合测评设计

### 6.1 测评三类型

```text
┌──────────┬────────────────────────┬──────────────┐
│ 类型      │ 描述                    │ 时机          │
├──────────┼────────────────────────┼──────────────┤
│ 诊断性    │ 查起点                  │ 学期初、单元开始 │
│ 形成性    │ 给反馈、看进步          │ 单元教学过程中   │
│ 终结性    │ 评掌握                  │ 期中、期末（高中另含单元末测验） │
└──────────┴────────────────────────┴──────────────┘
```

义务教育阶段：单元的形成性评价用单元练习（随堂练习：穿插在课堂教学里，单次一般不超过 20 分钟，不组织成考试、不计总分、不排名，反馈写知识点诊断），诊断性摸底也用随堂练习做；考试只有期末（初中可加一次期中，九年级在总复习阶段可有 1—2 次模拟考试）。（与 `xiaozhi-teach-exam-designer` §四 同一口径）

### 6.2 4 维测评设计

```text
■ 听力（题型按中考听力结构排，不用托福/雅思式分类）
  · 时长：20-25 分钟（含播音）
  · 题型：听句选图（或短对话选答语）→ 对话理解 → 短文理解 → 听填信息
  · 语速：约 100-120 词/分钟（中考听力常见区间）
  · 详细题型设计见「英语听力材料设计」SKILL

■ 口语（校内班级测评的现实约束见下）
  · 时长：单人 3-5 分钟（不是 10-15 分钟）
  · 题型：朗读 → 情景问答 → 看图/话题连续表达
  · 组织：分批或分组进行，见下方"班额可行性"

■ 阅读
  · 时长：30-40 分钟
  · 题型：细节 → 主旨 → 推断 → 词义猜测（按中考阅读的题型比重）
  · 难度：略高于日常教学材料

■ 写作
  · 时长：20-25 分钟
  · 题型：以应用文（书信/邮件/通知）与记叙文为主；
    议论文只在初三下学期按本地中考题型需要时才考
  · 字数：初中 80-100 词
```

**口语测评的班额可行性（先算，再排）**

```text
所需课时 ≈ 班额 × 单人时长 ÷ 并行考场数 ÷ 45 分钟

例：50 人班，单人 4 分钟，1 位老师逐个考
    → 50 × 4 = 200 分钟 ≈ 4.5 节课，不现实

可行的三种排法（老师选一种，本 SKILL 不替老师决定）：
① 双人同考：两名学员一组做对话任务，单组 5 分钟
   → 25 组 × 5 = 125 分钟 ≈ 3 节课，仍偏多，适合期末的口语测评（照学校安排）
② 抽样 + 全员录音：课上抽 8-10 人现场考（作为定标样本），
   其余学员在校内（课内或课后在学校里）按同一套任务录音，老师按同一份 rubric 评；
   不要求学生回家用手机录音提交
   → 课上约 40 分钟，1 节课内完成
③ 分组轮转：全班分 4-5 组，一组做口语任务、其余组做笔试部分，轮换
   → 1-2 节课内完成，需另一位老师或助教协助计时
义务教育阶段整班的口语测评放在期末（初中可在期中），照学校安排；单元里的口语练习按随堂练习做，
每次一般不超过 20 分钟，不整节课考。

⚠️ 若排不出时间：宁可缩短单人时长或降低频次，
   也不要把 25 分的口语分改成"平时印象分"——那不是测评。
```

> ⚠️ **本 SKILL 是通用 `xiaozhi-teach-exam-designer` 的英语学科细化，不是替代。** 双向细目表的测量学基础——**难度系数 P、区分度 D、四类测评目的、考后实际 P/实际 D 分析**——沿用通用版定义；本 SKILL 只补充听说读写四维的能力描述与 CSE/CEFR 对照，不重定义、不删减测量学工具。

### 6.3 4 维双向细目表

```text
■ 听力双向细目表
  · 主旨 + 细节 + 推断 + 观点

■ 口语双向细目表
  · 流利 + 准确 + 得体

■ 阅读双向细目表
  · 字面理解 + 推断理解 + 评价理解

■ 写作双向细目表
  · 内容 + 结构 + 语言 + 规范
```

### 6.4 4 维测评样板

> 📎 完整样板见 `references/comprehensive-assessment-sample.md`（听/说/读/写 4 维加权的综合测评结构示例）

---

## 七、学员能力画像

### 7.1 画像维度

```text
┌──────────┬────────────────────────┐
│ 维度      │ 描述                    │
├──────────┼────────────────────────┤
│ 听        │ 听力能力                │
│ 说        │ 口语能力                │
│ 读        │ 阅读能力                │
│ 写        │ 写作能力                │
│ 词汇      │ 词汇量                  │
│ 语法      │ 语法能力                │
│ 等级判定  │ 由老师对照 CSE 描述语给出（不由分数换算） │
│ 强项      │ 强维度                  │
│ 弱项      │ 弱维度                  │
└──────────┴────────────────────────┘
```

### 7.2 学员能力画像

> 📎 完整模板见 `references/student-ability-profile-template.md`（4 维等级 + 微技能 + 词汇/语法 + 强弱项的填写模板）

### 7.3 4 维雷达图（描述）

```text
  听
   │   ┌───
   │  /  5
   │ /
   │/_____
  说          读
   │  ╲
   │   ╲
   │    ╲
   写
```

---

## 八、教学干预建议

### 8.1 4 维干预

```text
┌──────────┬────────────────────────┐
│ 弱维度    │ 干预                    │
├──────────┼────────────────────────┤
│ 听        │ 听力材料+微技能训练      │
│ 说        │ 任务型活动+情境练习      │
│ 读        │ 阅读策略+分级阅读        │
│ 写        │ 写作模板+过程引导        │
└──────────┴────────────────────────┘
```

### 8.2 词汇干预（按课标词表分档；AWL 学术词表 ⚠高中，本学段不用）

```text
分档依据：2022 版义教英语课标三级词汇表约 1600 词（中考范围）；
          高中课标附录 2 共 3100 词（含义教 1600 词；必修累计约 2100、选择性必修累计约 3100）⚠高中。

· 课标 1600 词内、掌握不足 → 先把这部分补齐（中考绝大多数考点在此范围）
    做法：按话题成组补（校园/健康/环保/文化/成长），不按字母表背
· 课标 1600 词已基本掌握 → 补中考语篇里的高频超纲词（只求读到时认得出）
    做法：从近年本地中考真题语篇里取词，不另找词表
· 已超出中考需求、学员主动要求 → 高中课标词表 ⚠高中
    做法：说明这是高中内容，按学员意愿安排，不计入本学段的达标判断

❌ 不用 AWL 分级 ⚠高中（大学学术写作场景才用得着；高中学员同样不用）：AWL 取自英语学术论文语料，
   与义教课标、中考语篇的词频分布不一致，对初中生会把方向带偏。
❌ 不用"主动词汇 N 词"这类估计值做分档依据——课堂上没有可靠的测量手段。
```

### 8.3 干预样板

> 📎 完整样板见 `references/intervention-suggestion-sample.md`（短/中/长期干预建议 + 资源推荐 + 复测评估示例）

---

## 九、4 维档案累积

### 9.1 档案更新

```text
■ 每次测评
  · 更新 4 维档案
  · 标记进步/退步

■ 每月复盘
  · 4 维能力变化
  · 强项弱项变化
  · 调整教学
```

### 9.2 学员英语成长档案

> 📎 完整样板见 `references/english-growth-archive-sample.md`（时间轴 + 4 维进步 + 持续弱项 + 教学调整示例）

---

## 十、与上游/下游 SKILL 的协作

### 10.1 协作流图

```text
              ┌────────────────────────┐
              │ xiaozhi-teach-         │
              │  student-analyzer      │
              │ （学员 4 维能力数据）   │
              └───────────┬────────────┘
                          │
                          ↓
              ┌────────────────────────┐
              │ xiaozhi-teach-         │
              │  english-assessment    │
              │  （本 SKILL）           │
              └───────────┬────────────┘
                          │
        ┌─────────────────┼─────────────────┐
        ↓                 ↓                 ↓
  student-analyzer  lesson-planner   resource-library
  （4 维能力画像）  （教学干预计划）  （4 维素材）
```

### 10.2 接口（唯一真实字段来源：`shared/class-teaching-workspace.schema.json`）

```text
读：
  classWorkspace.classProfile        → 学段、班额、课时、常用满分
  classWorkspace.itemScores[]        → 逐题得分（能力画像的唯一来源；
                                        只有总分时不得生成逐维度画像）
  classWorkspace.itemStats[]         → 各题难度 P / 区分度 D
  classWorkspace.classSummaries[]    → 班级均分、得分率、分布
  classWorkspace.weaknessRank[]      → 班级顽固弱项排序
  classWorkspace.reviewPlans[]       → 同一场考试是否已有复习计划（有就在原计划上补充）

写（均为待老师确认的条目，确认后落库）：
  classWorkspace.examBlueprints[]    → 四维测评蓝图（含 itemType: 听力/口语/阅读/写作）
                                        AI 生成题 aiGenerated=true，
                                        老师验算后才可 verifiedByTeacher=true
  classWorkspace.weaknessRank[]      → 由四维得分归纳出的弱项条目
      · weaknessId / knowledgePoint / errorRate / dimension / evidenceExamIds[] / lastUpdated
      （不写 .stubbornCount——顽固计数由 xiaozhi-teach-student-analyzer 唯一累加）
  classWorkspace.reviewPlans[]       → 干预建议转成的复习排布，只写英语条目；
                                        同一场考试已有复习计划时在原计划上补充，不另起一份；
                                        写入守复习规划师的三道门：老师确认、只用化名、不写个体分数与名次

写回学生档案（可选，需授权）：
  handoverType = "teacher_writeback"，recipient = xiaozhi-learning-dna
  前置：交接体中的授权快照 teacherWritebackConsent 必须为 true，否则丢弃并告知老师
  内容：weakKnowledgePointUpdates 列表（subject / knowledgePoint /
        status / masteryLevel），note 只写低敏事实描述
  掌握度转换（shared/vocab.md §6）：老师端五档 → 学生端三档，写回时必须转换
        已掌握 → 真正掌握 ／ 基本理解 → 会解释 ／ 仍需巩固 → 会复述
        需要重讲 → 会复述（并在 note 里注明"复述也不完整"）
        证据不足 → 不写入这一条
  ❌ 不写 CSE/CEFR 等级、不写学员真实姓名、不写心理标签
```

写回学生档案的交接示例（与 `handover-protocol.schema.json` v2.1 一致）：

```json
{
  "sessionId": "sess-teach-eng-assess-001",
  "protocolVersion": "2.11.1",
  "handoverType": "teacher_writeback",
  "sender": "xiaozhi-teach-english-assessment",
  "recipient": "xiaozhi-learning-dna",
  "consent": { "crossSkillSharing": true, "teacherWritebackConsent": true },
  "payload": {
    "teacherWritebackData": {
      "teacherSkill": "xiaozhi-teach-english-assessment",
      "studentAlias": "E-007",
      "weakKnowledgePointUpdates": [
        { "subject": "英语", "knowledgePoint": "听力·听填信息", "status": "初步弱项", "masteryLevel": "会复述" }
      ],
      "note": "两次测评中听填信息题得分率明显低于同卷其他听力题型"
    }
  },
  "timestamp": "2026-09-03T18:00:00+08:00"
}
```

---

## 十一、字段级高敏信息防护

```text
✅ 能力画像用化名
✅ 班级报告用编号
❌ 禁止：公开"某学员的英语等级"
❌ 禁止：未授权公开测评材料
✅ 测评结果可入档案（脱敏后）
```

---

## 十二、行为准则

| ✅ 应该做 | ❌ 不能做 |
|---------|---------|
| 4 维综合（听说读写） | 测评=笔试 |
| 对照 CSE 描述语判等级 | 分数直接换算等级 |
| 能力画像 | 测评=一刀切 |
| 4 维差异 | 单一分数 |
| 教学干预 | 测完就完事 |
| 学员化名 | 公开学员等级 |

---

## 十三、与其他 SKILL 的协同清单

```text
英语综合测评
    <── xiaozhi-teach-student-analyzer（4 维能力）
    <── xiaozhi-teach-lesson-planner（教学计划）
    ──→ xiaozhi-teach-student-analyzer（4 维画像）
    ──→ xiaozhi-teach-lesson-planner（教学干预）
    ──→ xiaozhi-teach-resource-library（4 维素材）
    ──→ 学生端 5 个英语 SKILL（语法/听力/口语/词汇/写作，学员视角）
```

**禁止行为**：
- 禁止 AI 替老师阅卷
- 禁止 AI 给学员排名
- 禁止 AI 替学员答题
- 禁止未授权复制测评材料
- 禁止公开学员的 CSE/CEFR 等级
- 禁止由卷面分数直接换算等级（必须对照 CSE 描述语人工判定）
- 禁止未经 `teacherWritebackConsent` 写回学生档案

---

## 十四、高中：合格性考试与高考方向的测评

依据《普通高中英语课程标准日常修订版（2017 年版 2025 年修订）》"学业水平考试与高考建议"。老师说明带的是高中班，或学员在读高中时用本节；初中仍按第四至九节。

| 项 | 合格性考试 | 高考 |
|---|---|---|
| 内容范围 | 必修 | 必修与选择性必修 |
| 水平要求 | 可参照学业质量水平一 | 可参照学业质量水平一和水平二 |
| 形式 | 一般采用笔试，包括听力考试；有条件的地区可以实施口试 | 一般采用笔试（闭卷，包括听力考试）；条件允许时可以组织口试（口语考试或听说考试） |
| 考查侧重 | 覆盖听、说、读、看、写，可注重听力、阅读等理解性技能 | 更加全面深入地考查理解性技能，同时注重表达性技能 |

- **题型**（课标）：选择题（单项选择、匹配、判断）、填空题、简答题、口头及书面表达题，鼓励创新题型。卷面结构、题量与分值各地不同，以本地当年的考试说明为准；本 SKILL 不内置哪个省的试卷结构。
- **命题规划**（课标）：按核心素养（语言能力、文化意识、思维品质、学习能力）、情境类别（日常生活、学习活动、跨文化沟通）与学业质量水平规划，同时写明题型、分值、预设难度和预设作答时间。写入工作空间时，题型、分值、预设难度分别对应 `examBlueprints[].items[]` 的 itemType、score、expectedP；情境类别、学业质量水平与各部分的作答时间只写在给老师的细目表里。
- **评分**（课标的评分建议）：填空题的拼写、单复数错误按严重程度定评分标准；语法填空里参考答案之外的其他可接受答案也应给分；根据录音填写信息的题主要看信息是否准确，个别拼写、大小写错误可以不扣分或少扣分；简答题可以设完全正确、可接受、不正确三档；口头表达侧重意义表达的准确性、语音语调的清晰度与交际的得体性；书面表达兼顾内容的达意度、词汇语法的准确性与得体性、语篇的流畅性。
- **等级参照**：高考约当 CSE 四级（§5.1）。定级仍然只能对照 CSE 描述语人工判定，不由分数换算。
- **词汇**：合格性考试考必修（课标附录 2 累计约 2100 词），高考加选择性必修（累计约 3100 词）。
- **试题保密**：老师说明在为统考命题时，按本 SKILL 开头的"试题保密"执行——只给命题方法与自编练习，不接收、不生成、不审改该卷的具体试题。
- **口语测评**：仍按 §6.2 先算班额与课时，再定单人时长与组织方式。

高一单元测评的蓝图示例（学校自编，只示范怎么写课标要求的几个维度，不代表任何一省的试卷结构；分值与时间由 CI 验算）见 `references/hs-assessment-blueprint.md`。

---

## 十五、参考资源

- `references/cefr-can-do-statements.md` — "能做什么"语句（CSE 为主、CEFR 参照；含定级判定流程）
- `references/four-skill-rubric.md` — 4 维（听说读写）评分细则（只出分数 + 微技能，不出等级）
- `references/assessment-template.md` — 综合测评设计模板（4 阶段）
- `references/cefr-four-skill-descriptors.md` — CEFR 4 维对照速查表（A1-C2 听说读写描述）
- `references/comprehensive-assessment-sample.md` — 4 维测评样板（综合测评结构示例）
- `references/student-ability-profile-template.md` — 学员能力画像填写模板
- `references/intervention-suggestion-sample.md` — 教学干预建议样板
- `references/english-growth-archive-sample.md` — 学员英语成长档案样板
- `references/hs-assessment-blueprint.md` — 高一单元测评的蓝图示例：课标命题规划的几个维度、各部分分值与作答时间、整卷预期 P 的算法（含 CI 验算断言）

---

> 💡 **小智说：**
> "英语测评不是给学员'打分数'，
> 是给教学'画能力地图'。
>  学员不是'90 分'或'80 分'，
> 而是'能听懂日常对话、能读短篇故事、
>  能介绍自己、能写简单邮件'——
>  能力量表的意义就在这里：先看他能做什么，再决定教什么。"
