如何评估韩语和英语的言语声音处理能力

用韩语和英语实施相同的任务,能否判断儿童言语声音处理的薄弱环节处于哪个阶段?本文整理了五项任务体系的开发与验证,以及30名正常发育儿童的结果。

本文译自韩文原文。 韩文原文

在课后班学英语的儿童如果总是把英语单词读错,家长和言语治疗师会问同一个问题:是因为还在学习所以出错,还是言语声音处理过程中的某个环节存在困难?传统的构音检查主要记录哪个音错了、怎么错的。即使儿童表现出相同的错误,其背后处理能力的优势与弱点也可能大不相同。

那么,如果用结构相同的任务分别以韩语和英语施测,能否区分儿童在听取、存储和产出言语声音的各个阶段中,究竟在哪个环节遇到困难?

下面来读一篇回答这个问题的论文。

  • 标题:Development and Validation of a Korean (L1)-English (L2) Speech Processing Task System for Children with and without Speech Sound Disorders
  • 期刊:Folia Phoniatrica et Logopaedica
  • 年份:2026

研究团队开发了一套通过计算机施测的言语处理任务(Speech Processing Task, SPT)体系。SPT 分阶段评估儿童辨别声音的能力、意识并操作声音单位的能力、在头脑中存储单词语音形式的能力,以及规划声音顺序并说出来的能力。五类任务分别用韩语和英语施测,因此共有十个子任务。研究团队将该体系电脑化,使计分和结果分析都能自动完成。

本文使用的核心术语如下。

  • 言语声音障碍(Speech Sound Disorder, SSD):妨碍有效言语沟通的持续性构音困难。
  • 第一语言(L1)与第二语言(L2):在这篇论文中,L1 是韩语,L2 是英语。
  • 作为外语的英语(English as a Foreign Language, EFL):像韩国这样,英语不是生活语言而是作为学科来学习的环境。
  • 典型发育(Typically Developing, TD)儿童:本文中指论文用来与言语声音障碍儿童作比较的同龄儿童。

动机:仅凭构音准确率,难以发现不同儿童各异的处理弱点

为什么要分处理阶段评估

论文给出的理由如下。

  • 言语声音障碍儿童表面上说话同样困难,但严重程度、成因和对治疗的反应因人而异,差别很大。
  • 临床上,大多数儿童的言语障碍原因并不明确。因此,要制定有效的干预计划,需要进行全面的评估。
  • 以往关于言语感知的研究结果不一致。一项研究中,言语声音障碍儿童的感知准确率较低,另一项研究则显示组间没有差异。
  • 相比之下,关于音系意识、音系表征和运动编程的研究,较为一致地发现言语声音障碍儿童存在处理缺陷。
  • 在把英语作为外语学习的环境中,母语的结构和发音习惯对英语习得影响很大。因此,言语声音障碍儿童在英语学习中更可能遇到更大的困难。

支持最后一条理由的有先前研究(Kim 和 Ha)。言语声音障碍儿童的音系短时记忆较低,英语词汇习得成绩也低于典型发育儿童。非词复述得分显著预测了接受性词汇的学习能力。后续研究发现,言语声音障碍组的英语辅音准确率低于同龄儿童,并观察到韩语的错误模式迁移到英语发音中的现象。

评估的理论框架是 Stackhouse 和 Wells 的言语处理模型。该模型把处理路径分为以下阶段。

  • 外周听觉处理
  • 言语与非言语声音的区分
  • 语音辨别
  • 音系识别
  • 音系表征
  • 运动编程
  • 运动计划
  • 运动执行

该模型主张,针对各阶段施测相应任务,就能找出儿童的优势与弱点,并将其反映到干预计划中。

以往研究未涉及的部分

在英语圈,CTOPP(Comprehensive Test of Phonological Processing)和 PAT-2(Phonological Awareness Test 2)被广泛使用。这两种工具能够可靠地评估音系意识、音系记忆、快速命名等单项成分。在韩国国内,最近开发的韩语构音音系档案通过非词复述任务(Nonword Repetition Task, NRT)评估运动编程和音系记忆。荷兰的 CAI(Computer Articulation Instrument)是面向 2~7 岁荷兰语儿童的自动化评估体系,包含图片命名、单词与非词复述以及最大重复速率任务。

论文指出的空白如下。

  • 只涉及单项子技能的工具,难以同时考察言语处理的多个阶段。
  • 单独一个 NRT 就涉及从听觉辨别到音系存储、运动计划的多个阶段。因此,要准确找出运动编程缺陷,还需要配合评估其他阶段的任务。
  • 基于心理语言学的评估因程序复杂,在临床上难以使用,一直受到批评。
  • CAI 虽然实现了施测自动化,但分数计算仍靠手工。其对象仅限于荷兰语儿童,并且缺少辨别和音系意识的评估。

研究团队还考虑到英语学习环境,开发了面向言语声音障碍儿童的韩语、英语双语评估体系。

方法:用两种语言编制五项任务,并以专家和儿童数据加以验证

论文把方法分为三个子研究来说明。研究 1 开发并电脑化了任务,研究 2 检验效度和信度,研究 3 将任务应用于典型发育儿童。本文把研究 1 中的题目开发与计分、电脑化单独拆开,分四个步骤来说明。第 1、2 步属于研究 1,第 3 步属于研究 2,第 4 步属于研究 3。

图 1. SPT 按任务开发与电脑化、效度与信度检验、应用于典型发育儿童的顺序构建而成。

数据与参与者

这篇论文用到三类数据,此前还有一项预研究。

  • 预研究:对 10 名言语声音障碍儿童和 20 名典型发育儿童,用韩语和英语施测辨别、音系表征和非词复述任务。
  • 专家小组:为评估内容效度,选定了 10 名专家。研究团队遵循 Anderson 的建议,即至少 10~15 人就能可靠地评估内容效度。
  • 信度数据:收集了 70 名 5~7 岁儿童的逐题作答。
  • 应用研究的参与者:30 名 5~7 岁典型发育儿童,其中男孩 23 名,女孩 7 名。

研究团队选择 5~7 岁儿童作为对象,依据有两点。儿童在 4 岁左右言语清晰度达到约 100%,音节删除任务通常在 5 岁后半段掌握。

应用研究参与者的入选标准如下。

  • 接受与表达词汇测验(REVT)原始分数在 1SD 以上(原文标注 ≥ 1SD)
  • 韩国版瑞文彩色推理测验(K-CPM)得分在 85 以上
  • 韩语构音音系评估 2(UTAP2)的辅音准确率(Percentage of Correct Consonants, PCC)在 1SD 以上(原文标注 ≥ 1SD)
  • 家长报告无神经系统障碍或听力障碍史
  • 每周 2 次、每次 30 分钟以上的英语课程,已持续 1 年以上

参与者的平均生活年龄为 77.87 个月(±10.63)。平均非言语智力得分为 113.17(±16.85)。英语构音另以 DEAP(Diagnostic Evaluation of Articulation and Phonology)进行了补充评估。

第 1 步:五项任务与题目开发

  • 输入:预研究结果、已有文献、言语处理模型
  • 处理:为每个处理阶段确定任务,并分别编制韩语和英语题目
  • 输出:两种语言各五项任务,共十个子任务
  1. 研究团队依据预研究结果和文献回顾编制了预备题目。
  2. 按照言语处理模型的输入、存储、输出阶段,构建了五项任务。
  3. 英语任务不是由韩语任务翻译而来,而是用适合把英语作为外语学习的 5~7 岁儿童的词汇和刺激重新编制的。

论文表 2 按处理阶段和评估领域对五项任务作了如下分类。

  • 输入阶段:DT(感知)、IPAT(音系识别与表征)
  • 存储阶段:PRT(音系表征)
  • 输出阶段:OPAT(音系识别与表征)、NRT(运动编程)

作答方式因任务而异,包括判断、选图和口述。任务构成可在论文表 2 中查看。

各任务的设计意图如下。

  • 辨别任务(Discrimination Task, DT):儿童听两个相同或相近的声音,回答是否相同。预研究中没有发现组间差异,也没有语言差异,因此研究团队提高了难度以增强敏感度。韩语使用无意义的三音节对,英语则把 CV 单音节对(/sa/-/si/)改为 CVC 单音节对(/fæs/-/fæʃ/)和多音节对。最终的 12 对包括 6 对相同的声音,以及 6 对在擦音、塞音等语音特征上不同的声音。
  • 输入音系意识任务(Input Phonological Awareness Task, IPAT):不需要口头作答的四选一删除任务。例如从 “pineapple” 中去掉 “apple”,就选 “pine” 的图片。选项包括正确答案(fish)、声音相近的错误选项(dish)、意义相近的错误选项(turtle)和第二个图片单词(star)。
  • 音系表征任务(Phonological Representation Task, PRT):同时呈现图片和声音,让儿童判断两者是否匹配。12 个单词中,6 个是原来的声音,6 个是改变了元音的声音(/εlifɔnt/-/εlifint/)。
  • 输出音系意识任务(Output Phonological Awareness Task, OPAT):结构与 IPAT 相同,但儿童需要亲自说出剩下的音节。例如看到校车图片,听到 /skuːl/,就回答 /bʌs/。
  • 非词复述任务(NRT):评估运动编程。韩语为 2~4 音节的 10 题,英语为 1~3 音节的 10 题。

把音系意识任务分为输入型和输出型是有原因的。言语声音障碍儿童在需要口头作答的任务中,音系意识可能被低估。

第 2 步:计分与电脑化

  • 输入:儿童的选择性作答和录音语音
  • 处理:应用各任务的计分规则,在客户端—服务器体系中自动处理
  • 输出:原始分、百分制换算分、NRT 细分指标
  1. 除 NRT 外的四项任务,答对计 1 分,答错计 0 分,得到原始分,再换算为满分 100 分。
  2. NRT 采用判断音节是否处于正确位置的排列得分。从前向(F)和从后向(B)两个方向确认音节位置并计分。
  3. 研究团队与策划、设计、开发团队以及言语治疗专业的教授和临床工作者共同确定了程序内容、呈现形式、输入方法和计分规则。

论文正文以目标非词 /haɾʌʣi/ 被说成 [hamɾʌʣi] 的情形为例。虽然多出了 [m],但前向以 [ha] 正确开头,因此算作正确。后向以 [m] 开头,因此扣 1 分。其他作答示例和分数可参见论文表 1。

这样计分,比单纯的对错更能体现儿童规划音节顺序的准确程度。

电脑化的体系分为施测和评估任务的客户端环境,以及管理数据和任务资源的服务器环境。评估按以下顺序进行。

  • 输入参与者基本信息
  • 选择任务
  • 练习题
  • 正式任务
  • 结束画面

IPAT、PRT 和 OPAT 有预览功能。施测者可借助该功能,先确认儿童是否认识目标词汇。结果画面中,正确答案以蓝色显示,错误答案以红色显示,每项任务给出原始分和百分制换算分。NRT 的结果中同时显示录音文件、目标辅音、儿童的反应、音节得分、顺序得分、插入辅音数、添加错误率等指标。

第 3 步:内容效度与内部一致性检验

  • 输入:10 名专家的问卷回答、70 名儿童的逐题作答
  • 处理:计算内容效度比和指数、克隆巴赫 α 系数
  • 输出:各任务及各题目的效度值、各语言的信度系数
  1. 研究团队用谷歌问卷制作了分三部分的问卷。
    • 第一部分:性别、年龄、学历、临床与研究经历
    • 第二部分:询问各任务是否适合评估相应处理阶段的题目
    • 第三部分:用 5 点量表评价 48 道题目
  2. 根据回答计算了内容效度比(Content Validity Ratio, CVR)和题目水平内容效度指数(Item-level Content Validity Index, I-CVI)。
  3. 用 70 名儿童的回答计算了克隆巴赫 α 系数(Cronbach’s α)。分别按韩语题目、英语题目以及两种语言合并题目三组求得。

各指标的含义和判断标准如下。

  • CVR:表示专家们是否达成了充分共识。按照 Ayre 和 Scally 的小组规模标准,0.80 以上即认为共识充分。
  • I-CVI:表示专家对题目是否符合评估目的的共识程度。10 人小组的最低可接受值为 0.78。
  • 克隆巴赫 α 系数:表示各题目对同一对象测量的一致程度。取值在 0 到 1 之间,超过 0.70 通常被认为信度可以接受。

第 4 步:应用于典型发育儿童

  • 输入:30 名典型发育儿童在十个子任务上的表现数据
  • 处理:按既定顺序施测,并进行 2×5 重复测量方差分析
  • 输出:语言与任务类型的主效应、交互作用、事后比较结果
  1. 参与者先接受筛查,然后依次完成 DT、IPAT、PRT、OPAT、NRT 任务。
  2. 为帮助理解,每项任务都先施测韩语版,后施测英语版。
  3. 在 IPAT、PRT、OPAT 之前,先做词汇确认,看儿童是否认识所有目标词。
  4. 所有听觉刺激最多播放两遍。
  5. NRT 同时录制音频和视频。由两名经过培训的转写员各自转写,分歧通过协商解决。
  6. 进行了语言(韩语、英语)2 水平和任务 5 水平的重复测量方差分析(Analysis of Variance, ANOVA)。

重复测量方差分析针对同一名儿童完成全部十项任务的情形,分别检验分数差异来自语言、来自任务,还是来自两者的组合。由于不满足球形假设,研究团队采用了 Greenhouse-Geisser 校正。

结果:母语优势明显,只有辨别任务是例外

内容效度:五项任务均超过标准

在 10 名专家的评价中,五项任务的 CVR 均在 0.80 以上,CVI 均在 0.90 以上。在题目水平上,所有题目的 CVR 均在 0.80 以上,I-CVI 均在 0.78 以上,因此没有需要删除的题目。各任务的数值可在论文表 2 中查看。

只有 NRT 的 CVR 为 0.80、CVI 为 0.90,低于其他任务。不过 NRT 的数值并未低于 CVR 标准 0.80 和 I-CVI 最小值 0.78。专家评分以 OPAT 和 IPAT 的 4.70 最高。

内部一致性:三组均超过 0.70

用 70 名儿童的回答计算的克隆巴赫 α 系数如下。

  • 韩语题目:0.779
  • 英语题目:0.886
  • 两种语言合并题目:0.912

三个数值均超过 0.70,题目的内部一致性得到确认。韩语题目的系数低于英语题目,这一点值得注意。本文参考的论文正文中没有对这一差异作出解释。

基础评估:英语辅音准确率低于韩语

在施测任务之前的构音检查中,首先确认了两种语言之间的差异。平均辅音准确率韩语为 99.72%(±1.12),英语为 97.45%(±3.90)。配对样本 t 检验显示,韩语辅音准确率显著高于英语(t(29) = 3.734, p < 0.01)。平均接受性词汇得分为 75.23(±16.52),表达性词汇得分为 79.13(±14.48)。

分语言、分任务的表现:五项任务中有四项韩语更高

除 DT 外的四项任务,韩语得分均高于英语。韩语任务中得分最高的是 PRT(93.60),英语任务中得分最高的是 DT(93.40)。两种语言中得分最低的都是 NRT。

图 2. 典型发育儿童在除辨别任务外的四项任务中,韩语得分高于英语。

以 NRT 和 DT 计算语言差异的大小,结果如下。

  • NRT:韩语 86.18 分,英语 78.55 分,相差 86.18−78.55=7.63 分。
  • DT:相反,英语高出 93.40−89.33=4.07 分。

其余任务各语言的平均数和标准差见论文表 4。IPAT 和 OPAT 的标准差为 17.88~25.73,大于其他任务。笔者将这一数值解读为,即使同为典型发育儿童,在音系意识任务上个体差异也很大。这一解读不见于论文,是笔者本人的解读。

重复测量方差分析:语言、任务和交互作用均显著

分析结果如下。

  • 语言主效应:F(1, 29) = 10.601, p < 0.01
  • 任务类型主效应:F(1.999, 57.985) = 4.420, p < 0.05
  • 语言×任务交互作用:F(2.628, 76.199) = 4.674, p < 0.01

在任务间的事后比较中,DT、PRT、OPAT 的得分显著高于 IPAT 和 NRT。也就是说,五项任务分成了三项较易的和两项较难的。交互作用用 COMPARE 语句做了进一步分析。结果显示,DT 英语显著高于韩语(p < 0.05),其余四项任务韩语高于英语。

论文的解释:母语优势、母语干扰、任务复杂度

研究团队从三个主题解释了结果。

  • 母语优势:研究团队认为,已经牢固建立的韩语音系表征,使感知、存储和输出各阶段的处理更有效率。对于只有 DT 是例外,他们给出两点理由。DT 涉及的是早期感知处理,而不是词汇通达或运动编程,因此母语表征的影响较小。另外,韩语刺激全部是三音节,而英语刺激是 1~3 音节,因此部分英语题目可能更容易。
  • 母语干扰:在英语 NRT 中,部分儿童把 /ʧoʊvæg/ 说成 [ʧoʊbæg] 这类更接近韩语词的形式。这被解释为儿童依靠韩语的音系模式来处理陌生的英语声音序列。
  • 任务复杂度:NRT 涉及听觉感知、音系编码、音系记忆、运动编程、运动计划和构音。IPAT 要经过多个步骤:借助视觉线索通达音系表征、提取目标声音,并在头脑中不出声地加以操作。

区分第二语言差异与障碍的问题:笔者的解读

这篇论文的正式研究只以典型发育儿童为对象。因此,与障碍组的直接比较结果只出现在预研究中。在预研究中,言语声音障碍组在两种语言中的言语产出能力都显著低于典型发育组。按任务来看,情况如下。

  • DT:没有组间差异。
  • PRT:语言差异显著。
  • NRT:语言差异和组间差异均显著。

以下是笔者的解读,而不是论文的结论,也未在论文中得到验证。在正式研究中,学过英语一年以上的典型发育儿童在 NRT 上,英语得分同样低于韩语(86.18−78.55=7.63 分)。笔者认为,这种程度的语言差异有可能是英语学习过程中常见的差异。像预研究那样,在同一任务上还出现组间差异的情形,或许可以成为区分语言学习差异与障碍的线索。

不过,SPT 能否用于这种区分,还需要后续研究。论文说明,正式研究没有比较障碍组,未能充分评估 SPT 在言语声音障碍儿童身上的效果。预研究的样本也很小,只有 10 名言语声音障碍儿童和 20 名典型发育儿童。

研究团队还给出了解读任务间分数组合的例子。如果 IPAT 和 PRT 分数高而只有 OPAT 低,困难可能在言语输出阶段。如果 IPAT 低于 OPAT,则可以通过 PRT 分数判断问题在音系意识还是在音系表征。

意义与局限

带来了什么变化

  • 构建了用五项任务同时评估言语处理模型输入、存储、输出阶段的体系。
  • 用结构相同的任务,并列施测韩语和作为外语的英语。英语任务不是翻译而来,而是针对学习英语的 5~7 岁儿童重新编制的。
  • 把音系意识分为无需口头作答的输入型和需要口头作答的输出型,试图减少言语声音障碍儿童音系意识被低估的问题。
  • 用音节排列得分为 NRT 计分,更精细地评估音节顺序的规划能力。
  • 施测、计分和结果显示都已自动化。这一功能有可能减轻计分负担,但实际效果尚未得到证实。论文没有给出施测时间或工作量实际减少多少的测量结果。

对从业者的用处

言语治疗师和教师有可能用 SPT 把每名儿童的优势与弱点整理成分阶段的档案。不过,论文只在典型发育儿童中应用,也没能确认效标关联效度,因此在临床人群中的效度尚未得到确认。遇到英语发音错误较多的儿童时,可以把其韩语与英语的分数差异,与 30 名典型发育儿童的差异作探索性比较。这种比较只是大致的参考,不是判断是否有障碍的标准。结果画面会自动整理对错和细分指标。这一自动计分功能有可能减轻手工计分的负担,但论文并未测量实际节省的时间。

对研究者的用处

任务开发、专家效度检验、儿童应用这三个阶段的程序,在开发其他语言组合的评估工具时也可以参考。对预研究中没有出现差异的 DT 调整难度的过程,是通过修改题目来提高敏感度的一个例子。笔者认为,论文表 4 的数值可以在今后与言语声音障碍儿童作比较的研究中作为参考。论文并没有提出这样的用途。

论文说明的局限

论文自己说明的局限有三点。

  • 正式研究的样本只有典型发育儿童,因此未能充分评估 SPT 在言语声音障碍儿童身上的效果。研究团队正计划开展后续临床研究,纳入目前被诊断为言语声音障碍的儿童和有既往病史的儿童。
  • 国内没有可比较的评估英语言语处理的标准化工具,因此未能确认效标关联效度。
  • 没有收集参与者的社会经济、文化、语言背景以及双语接触方面的信息。

笔者认为的应用条件

以下不是论文中记载的内容,而是笔者着眼于实际应用而补充的条件。

  • 对象年龄和英语经验必须匹配。任务和参考分数是以上过一年以上英语课的 5~7 岁儿童为基准制定的。
  • 现在把表 4 的平均数当作常模还为时过早。30 名儿童的平均数和标准差用于大致比较,不宜作为判定个别儿童是否有障碍的标准,这样更稳妥。
  • 要遵守施测顺序,比较才有意义。正式研究始终先施测韩语版,如果先做英语版,分数可能会不同。
  • 对 DT 的跨语言比较要谨慎解读。两种语言刺激的音节结构不同,英语分数较高,很难解释为英语感知能力更好。

可以马上着手的事

  • 如果已有评估过的儿童数据,把同一名儿童的韩语和英语分数按任务并排放置,计算差异,并与论文表 4 的差异作探索性比较。把像 NRT 那样即使典型发育儿童英语也较低的任务,与像 DT 那样英语并不较低的任务分开来看。
  • 如果保存有非词复述的录音,用前向和后向排列得分规则重新计分。第一步是像论文表 1 的示例那样,确认遗漏和添加如何体现在分数上。
  • 如果以往只以口头作答的形式施测音系意识任务,可同时增加几道选图题。然后根据 IPAT、PRT、OPAT 三项分数的组合,判断困难是在输出阶段还是在表征阶段。

关键词

相关文章