방과후 수업에서 영어를 배우는 아동이 영어 단어를 자꾸 틀리게 발음하면, 부모와 언어치료사는 같은 질문을 한다. 아직 배우는 중이라 틀리는 것인가, 아니면 말소리를 처리하는 과정 어딘가에 어려움이 있는 것인가. 기존 조음 검사는 어떤 소리를 어떻게 틀렸는지를 주로 기록한다. 같은 오류를 보이는 아동이라도 그 밑에 있는 처리 능력의 강점과 약점은 서로 크게 다를 수 있다.
그렇다면 한국어와 영어로 같은 구조의 과제를 실시해, 아동이 말소리를 듣고 저장하고 산출하는 단계 가운데 어디에서 어려움을 겪는지 구분할 수 있을까?
이 질문에 답한 논문을 한 편 읽어 본다.
- 제목: Development and Validation of a Korean (L1)-English (L2) Speech Processing Task System for Children with and without Speech Sound Disorders
- 학술지: Folia Phoniatrica et Logopaedica
- 연도: 2026
연구진은 컴퓨터로 실시하는 말소리 처리 과제(Speech Processing Task, SPT) 체계를 만들었다. SPT는 아동이 소리를 구별하는 능력, 소리 단위를 의식하고 조작하는 능력, 머릿속에 단어의 소리 형태를 저장하는 능력, 소리 순서를 계획해 말하는 능력을 단계별로 평가한다. 다섯 종류의 과제를 한국어와 영어로 각각 실시하므로 하위 과제는 열 개다. 연구진은 채점과 결과 분석까지 자동으로 처리되게 체계를 전산화했다.
이 글에서 쓰는 핵심 용어는 다음과 같다.
- 말소리장애(Speech Sound Disorder, SSD): 효과적인 말 의사소통을 방해하는 지속적인 조음 어려움.
- 제1언어(L1)와 제2언어(L2): 이 논문에서 L1은 한국어, L2는 영어다.
- 외국어로서의 영어(English as a Foreign Language, EFL): 한국처럼 영어를 생활 언어가 아닌 교과로 배우는 환경.
- 일반 발달 아동(Typically Developing, TD): 이 글에서는 논문이 말소리장애 아동과 비교한 또래 아동을 이렇게 부른다.
동기: 조음 정확도만으로는 아동마다 다른 처리 약점을 찾기 어렵다
왜 처리 단계별 평가가 중요한가
논문이 든 이유는 다음과 같다.
- 말소리장애 아동은 겉으로는 비슷하게 말을 어려워하지만, 중증도와 원인, 치료 반응이 아동마다 크게 다르다.
- 임상에서는 대부분의 아동에게서 말 장애의 원인이 밝혀지지 않는다. 그래서 효과적인 중재 계획을 짜려면 포괄적인 평가가 필요하다.
- 말소리 지각에 관한 선행 연구는 결과가 엇갈렸다. 한 연구에서는 말소리장애 아동의 지각 정확도가 낮았고, 다른 연구에서는 집단 간 차이가 없었다.
- 반면 음운 인식, 음운 표상, 운동 프로그래밍에 관한 연구는 말소리장애 아동에게 처리 결함이 있다는 결과를 비교적 일관되게 냈다.
- 영어를 외국어로 배우는 환경에서는 모국어의 구조와 발음 습관이 영어 습득에 크게 작용한다. 그래서 말소리장애 아동은 영어 학습에서 더 큰 어려움을 겪을 가능성이 높다.
이 마지막 이유를 뒷받침하는 선행 연구(Kim과 Ha)가 있다. 말소리장애 아동은 음운 단기기억이 낮았고 영어 어휘 습득 성적도 일반 발달 아동보다 낮았다. 비단어 따라말하기 점수는 수용 어휘 학습 능력을 유의하게 예측했다. 후속 연구에서는 말소리장애 집단의 영어 자음 정확도가 또래보다 낮았고, 한국어 오류 패턴이 영어 발음으로 옮겨 가는 현상이 관찰되었다.
평가의 이론 틀은 Stackhouse와 Wells의 말소리 처리 모형이다. 이 모형은 처리 경로를 다음 단계로 나눈다.
- 말초 청각 처리
- 말소리와 비말소리의 구별
- 음성 변별
- 음운 재인
- 음운 표상
- 운동 프로그래밍
- 운동 계획
- 운동 실행
각 단계에 맞춘 과제를 실시하면 아동의 강점과 약점을 찾아 중재 계획에 반영할 수 있다는 것이 이 모형의 주장이다.
기존 연구가 다루지 않은 부분
영어권에서는 CTOPP(Comprehensive Test of Phonological Processing)와 PAT-2(Phonological Awareness Test 2)가 널리 쓰인다. 두 도구는 음운 인식, 음운 기억, 빠른 이름대기 같은 개별 요소를 신뢰성 있게 평가한다. 국내에서는 최근 개발된 한국어 조음음운 프로파일이 비단어 따라말하기 과제(Nonword Repetition Task, NRT)로 운동 프로그래밍과 음운 기억을 평가한다. 네덜란드의 CAI(Computer Articulation Instrument)는 2~7세 네덜란드어 아동용 자동화 평가 체계로, 그림 이름대기와 단어·비단어 따라말하기, 최대 반복 속도 과제를 담았다.
논문이 짚은 빈틈은 다음과 같다.
- 개별 하위 기술만 다루는 도구로는 말소리 처리의 여러 단계를 한꺼번에 살피기 어렵다.
- NRT 하나는 청각 변별부터 음운 저장, 운동 계획까지 여러 단계가 함께 관여한다. 그래서 운동 프로그래밍 결함을 정확히 짚으려면 다른 단계를 평가하는 과제가 함께 필요하다.
- 심리언어학 기반 평가는 절차가 복잡해 임상에서 쓰기 어렵다는 비판을 받아 왔다.
- CAI는 실시를 자동화했지만 점수 계산은 수작업이다. 대상이 네덜란드어 아동에 한정되고, 변별과 음운 인식 평가가 빠져 있다.
연구진은 이와 함께 영어 학습 환경을 고려해, 말소리장애 아동을 위한 평가 체계를 한국어와 영어 두 언어로 개발했다.
방법: 다섯 과제를 두 언어로 만들고, 전문가와 아동 자료로 검증했다
논문은 방법을 세 개의 하위 연구로 설명한다. 연구 1은 과제를 개발하고 전산화했고, 연구 2는 타당도와 신뢰도를 검증했으며, 연구 3은 일반 발달 아동에게 과제를 적용했다. 이 글에서는 연구 1의 문항 개발과 채점·전산화를 따로 떼어 4단계로 설명한다. 1단계와 2단계는 연구 1, 3단계는 연구 2, 4단계는 연구 3에 해당한다.
자료와 참가자
이 논문에는 세 종류의 자료가 쓰였다. 그 앞에 예비 연구가 하나 있었다.
- 예비 연구: 말소리장애 아동 10명과 일반 발달 아동 20명에게 변별, 음운 표상, 비단어 따라말하기 과제를 한국어와 영어로 실시했다.
- 전문가 패널: 내용 타당도 평가를 위해 전문가 10명을 선정했다. 연구진은 최소 10~15명이면 내용 타당도를 신뢰성 있게 평가할 수 있다는 Anderson의 권고를 따랐다.
- 신뢰도 자료: 5~7세 아동 70명의 문항별 응답을 모았다.
- 적용 연구 참가자: 5~7세 일반 발달 아동 30명이다. 남아 23명, 여아 7명이었다.
연구진이 5~7세를 대상으로 정한 근거는 두 가지다. 아동은 4세 무렵 말 명료도가 약 100%에 이르고, 음절 단위 탈락 과제는 대체로 5세 후반에 숙달된다.
적용 연구 참가자의 선정 기준은 다음과 같다.
- 수용·표현 어휘력 검사(REVT) 원점수가 1SD 이상(원문 표기 ≥ 1SD)
- 한국판 레이븐 색채 지능검사(K-CPM) 점수가 85 이상
- 우리말 조음음운평가 2(UTAP2)의 자음정확도(Percentage of Correct Consonants, PCC)가 1SD 이상(원문 표기 ≥ 1SD)
- 부모 보고상 신경학적 장애나 청각 장애 이력이 없음
- 주 2회, 회당 30분 이상의 영어 수업을 1년 이상 받음
참가자의 평균 생활연령은 77.87개월(±10.63)이었다. 평균 비언어성 지능 점수는 113.17(±16.85)이었다. 영어 조음은 DEAP(Diagnostic Evaluation of Articulation and Phonology)로 추가 평가했다.
1단계: 다섯 과제와 문항 개발
- 입력: 예비 연구 결과, 선행 문헌, 말소리 처리 모형
- 처리: 처리 단계마다 과제를 정하고 한국어·영어 문항을 따로 만든다
- 산출: 두 언어 각각 다섯 과제, 모두 열 개의 하위 과제
- 연구진은 예비 연구 결과와 문헌 검토로 예비 문항을 만들었다.
- 말소리 처리 모형의 입력, 저장, 출력 단계에 맞춰 다섯 과제를 구성했다.
- 영어 과제는 한국어 과제를 번역하지 않았다. 영어를 외국어로 배우는 5~7세 아동에게 맞는 어휘와 자극으로 새로 만들었다.
논문 표 2는 다섯 과제를 처리 단계와 평가 영역에 따라 다음과 같이 분류한다.
- 입력 단계: DT(지각), IPAT(음운 재인과 표상)
- 저장 단계: PRT(음운 표상)
- 출력 단계: OPAT(음운 재인과 표상), NRT(운동 프로그래밍)
응답 방식은 과제에 따라 판단, 그림 선택, 말하기로 다르다. 과제 구성은 논문 표 2에서 확인할 수 있다.
과제별 설계 의도는 다음과 같다.
- 변별 과제(Discrimination Task, DT): 아동은 같거나 비슷한 소리 두 개를 듣고 같은지 다른지 답한다. 예비 연구에서 집단 차이도 언어 차이도 없었기 때문에, 연구진은 난이도를 높여 민감도를 키웠다. 한국어는 무의미 3음절 쌍을 썼고, 영어는 CV 단음절 쌍(/sa/-/si/)을 CVC 단음절 쌍(/fæs/-/fæʃ/)과 다음절 쌍으로 바꿨다. 최종 12쌍은 같은 소리 6쌍과 마찰음·파열음 같은 음성 자질이 다른 6쌍이다.
- 입력 음운 인식 과제(Input Phonological Awareness Task, IPAT): 말로 답하지 않는 4지선다 탈락 과제다. “pineapple”에서 “apple”을 빼면 “pine” 그림을 택하는 식이다. 보기에는 정답(fish), 소리가 비슷한 오답(dish), 뜻이 비슷한 오답(turtle), 두 번째 그림 단어(star)가 들어간다.
- 음운 표상 과제(Phonological Representation Task, PRT): 그림과 소리를 함께 제시하고 둘이 맞는지 판단하게 한다. 12단어 가운데 6개는 원래 소리이고 6개는 모음을 바꾼 소리(/εlifɔnt/-/εlifint/)다.
- 출력 음운 인식 과제(Output Phonological Awareness Task, OPAT): 구조는 IPAT와 같지만 아동이 남은 음절을 직접 말해야 한다. 스쿨버스 그림을 보고 /skuːl/을 들으면 /bʌs/라고 답하는 식이다.
- 비단어 따라말하기 과제(NRT): 운동 프로그래밍을 평가한다. 한국어는 2
4음절 10문항, 영어는 13음절 10문항이다.
음운 인식 과제를 입력형과 출력형으로 나눈 이유가 있다. 말소리장애 아동은 말로 답하는 과제에서 음운 인식이 실제보다 낮게 평가될 수 있기 때문이다.
2단계: 채점과 전산화
- 입력: 아동의 선택 응답과 녹음된 발화
- 처리: 과제별 채점 규칙을 적용하고 클라이언트·서버 체계에서 자동 처리한다
- 산출: 원점수, 100점 환산 점수, NRT 세부 지표
- NRT를 뺀 네 과제는 맞으면 1점, 틀리면 0점으로 원점수를 구하고, 이를 100점 만점으로 환산한다.
- NRT는 음절이 제자리에 놓였는지를 따지는 배열 점수를 쓴다. 앞에서부터(F)와 뒤에서부터(B) 두 방향으로 음절 위치를 확인해 점수를 매긴다.
- 연구진은 기획, 디자인, 개발 팀과 언어치료 교수·임상가가 함께 프로그램 내용, 제시 형식, 입력 방법, 채점 규칙을 정했다.
논문 본문은 목표 비단어 /haɾʌʣi/를 [hamɾʌʣi]로 말한 경우를 예로 든다. 덧붙은 [m]이 있어도 앞 방향은 [ha]로 바르게 시작하므로 맞은 것으로 본다. 뒤 방향은 [m]으로 시작하므로 1점을 깎는다. 다른 응답 예시와 점수는 논문 표 1을 참조하면 된다.
이렇게 채점하면 단순 정오보다 음절 순서를 얼마나 정확히 계획했는지가 더 잘 드러난다.
전산화된 체계는 과제를 실시하고 평가하는 클라이언트 환경과, 자료와 과제 자원을 관리하는 서버 환경으로 나뉜다. 평가는 다음 순서로 진행된다.
- 참가자 기본 정보 입력
- 과제 선택
- 연습 문항
- 본 과제
- 종료 화면
IPAT, PRT, OPAT에는 미리보기 기능이 있다. 검사자는 이 기능으로 아동이 목표 어휘를 아는지 먼저 확인한다. 결과 화면에서는 정답이 파란색, 오답이 빨간색으로 표시되고, 과제마다 원점수와 100점 환산 점수가 나온다. NRT 결과에는 녹음 파일, 목표 자음, 아동의 반응, 음절 점수, 순서 점수, 삽입 자음 수, 첨가 오류율 같은 지표가 함께 나온다.
3단계: 내용 타당도와 내적 일관성 검증
- 입력: 전문가 10명의 설문 응답, 아동 70명의 문항별 응답
- 처리: 내용 타당도 비율과 지수, 크론바흐 알파를 계산한다
- 산출: 과제별·문항별 타당도 값, 언어별 신뢰도 계수
- 연구진은 구글 설문지로 세 부분짜리 설문을 만들었다.
- 첫 부분: 성별, 나이, 학력, 임상·연구 경력
- 둘째 부분: 각 과제가 해당 처리 단계를 평가하기에 적절한지 묻는 문항
- 셋째 부분: 48개 문항을 5점 척도로 평가
- 응답으로 내용 타당도 비율(Content Validity Ratio, CVR)과 문항 수준 내용 타당도 지수(Item-level Content Validity Index, I-CVI)를 계산했다.
- 아동 70명의 응답으로 크론바흐 알파(Cronbach’s α)를 계산했다. 한국어 문항, 영어 문항, 두 언어를 합친 문항의 세 묶음으로 나누어 구했다.
지표의 뜻과 판단 기준은 다음과 같다.
- CVR: 전문가들이 충분히 합의했는지를 나타낸다. Ayre와 Scally의 패널 크기 기준에 따라 0.80 이상이면 합의가 충분하다고 보았다.
- I-CVI: 문항이 평가 목적에 맞는지에 대한 전문가 합의 정도다. 10명 패널에서 최소 허용값은 0.78이다.
- 크론바흐 알파: 문항들이 같은 대상을 얼마나 일관되게 측정하는지 나타내는 값이다. 0에서 1 사이이며 0.70을 넘으면 대체로 받아들일 만한 신뢰도로 본다.
4단계: 일반 발달 아동에게 적용
- 입력: 일반 발달 아동 30명의 열 개 하위 과제 수행 자료
- 처리: 정해진 순서로 실시하고 2×5 반복측정 분산분석을 적용한다
- 산출: 언어와 과제 유형의 주효과, 상호작용, 사후 비교 결과
- 참가자는 먼저 선별 검사를 받고, 이어서 DT, IPAT, PRT, OPAT, NRT 순서로 과제를 수행했다.
- 과제마다 이해를 돕기 위해 한국어판을 먼저, 영어판을 나중에 실시했다.
- IPAT, PRT, OPAT 전에는 아동이 목표 단어를 모두 아는지 어휘 확인을 했다.
- 모든 청각 자극은 최대 두 번까지 들려주었다.
- NRT는 음성과 영상을 함께 녹화했다. 훈련받은 전사자 두 명이 각자 전사하고, 불일치는 합의로 정리했다.
- 언어(한국어, 영어) 2수준과 과제 5수준의 반복측정 분산분석(Analysis of Variance, ANOVA)을 실시했다.
반복측정 분산분석은 같은 아동이 열 개 과제를 모두 수행했을 때, 점수 차이가 언어 때문인지, 과제 때문인지, 둘의 조합 때문인지를 나누어 검정한다. 구형성 가정이 충족되지 않아 연구진은 Greenhouse-Geisser 보정을 적용했다.
결과: 모국어 우세가 뚜렷했고, 변별 과제만 예외였다
내용 타당도: 다섯 과제 모두 기준을 넘었다
전문가 10명의 평가에서 다섯 과제는 모두 CVR 0.80 이상, CVI 0.90 이상이었다. 문항 수준에서도 모든 문항의 CVR이 0.80 이상, CVI가 0.78 이상이어서 빼야 할 문항이 없었다. 과제별 값은 논문 표 2에서 확인할 수 있다.
NRT만 CVR 0.80, CVI 0.90으로 다른 과제보다 낮았다. 그래도 NRT의 값은 CVR 기준 0.80과 I-CVI 최소값 0.78에 미달하지 않았다. 전문가 평점은 OPAT와 IPAT가 4.70으로 가장 높았다.
내적 일관성: 세 묶음 모두 0.70을 넘었다
아동 70명의 응답으로 계산한 크론바흐 알파는 다음과 같다.
- 한국어 문항: 0.779
- 영어 문항: 0.886
- 두 언어를 합친 문항: 0.912
세 값 모두 0.70을 넘어 문항의 내적 일관성이 확인되었다. 한국어 문항의 계수가 영어 문항보다 낮은 점은 눈여겨볼 만하다. 이 글이 참고한 논문 본문에는 이 차이에 대한 해석이 나오지 않는다.
기초 평가: 영어 자음정확도가 한국어보다 낮았다
과제를 실시하기 전 조음 검사에서 두 언어의 차이가 먼저 확인되었다. 평균 자음정확도는 한국어 99.72%(±1.12), 영어 97.45%(±3.90)였다. 대응표본 t 검정에서 한국어 자음정확도가 영어보다 유의하게 높았다(t(29) = 3.734, p < 0.01). 평균 수용 어휘 점수는 75.23(±16.52), 표현 어휘 점수는 79.13(±14.48)이었다.
언어별·과제별 수행: 다섯 과제 가운데 네 과제에서 한국어가 높았다
DT를 뺀 네 과제에서 한국어 점수가 영어보다 높았다. 한국어 과제 가운데 가장 높은 점수는 PRT(93.60)였고, 영어 과제 가운데서는 DT(93.40)가 가장 높았다. 두 언어 모두에서 가장 낮은 점수는 NRT였다.
언어 차이의 크기를 NRT와 DT로 계산해 보면 다음과 같다.
- NRT: 한국어 86.18점, 영어 78.55점으로 86.18−78.55=7.63점 차이가 났다.
- DT: 반대로 영어가 93.40−89.33=4.07점 높았다.
나머지 과제의 언어별 평균과 표준편차는 논문 표 4에 있다. IPAT와 OPAT는 표준편차가 17.88~25.73으로 다른 과제보다 컸다. 필자는 이 값을 같은 일반 발달 아동이라도 음운 인식 과제에서 개인차가 크게 나타났다는 뜻으로 읽는다. 이 해석은 논문에 없는 필자의 해석이다.
반복측정 분산분석: 언어, 과제, 상호작용이 모두 유의했다
분석 결과는 다음과 같다.
- 언어 주효과: F(1, 29) = 10.601, p < 0.01
- 과제 유형 주효과: F(1.999, 57.985) = 4.420, p < 0.05
- 언어×과제 상호작용: F(2.628, 76.199) = 4.674, p < 0.01
과제 간 사후 비교에서는 DT, PRT, OPAT의 점수가 IPAT와 NRT보다 유의하게 높았다. 다섯 과제가 쉬운 과제 세 개와 어려운 과제 두 개로 나뉜 것이다. 상호작용은 COMPARE 구문으로 추가 분석했다. 그 결과 DT는 영어가 한국어보다 유의하게 높았고(p < 0.05), 나머지 네 과제는 한국어가 영어보다 높았다.
논문의 해석: 모국어 우세, 모국어 간섭, 과제 복잡도
연구진은 결과를 세 가지 주제로 해석했다.
- 모국어 우세: 잘 자리 잡은 한국어 음운 표상이 지각, 저장, 출력 단계의 처리를 더 효율적으로 만든다고 보았다. DT만 예외인 이유로는 두 가지를 들었다. DT는 어휘 접근이나 운동 프로그래밍보다 초기 지각 처리에 관여하므로 모국어 표상의 영향이 작다. 또 한국어 자극은 모두 3음절이었지만 영어 자극은 1~3음절이어서 일부 영어 문항이 더 쉬웠을 수 있다.
- 모국어 간섭: 영어 NRT에서 일부 아동은 /ʧoʊvæg/를 [ʧoʊbæg]처럼 한국어 단어에 가까운 형태로 말했다. 낯선 영어 소리 연쇄를 한국어 음운 패턴에 기대어 처리했다는 해석이다.
- 과제 복잡도: NRT는 청각 지각, 음운 부호화, 음운 기억, 운동 프로그래밍, 운동 계획, 조음이 모두 관여하는 과제다. IPAT는 시각 단서로 음운 표상에 접근하고, 목표 소리를 꺼내고, 말없이 머릿속에서 조작하는 여러 단계를 거친다.
제2언어 차이와 장애를 구분하는 문제: 필자의 해석
이 논문의 본 연구는 일반 발달 아동만 대상으로 했다. 그래서 장애 집단과의 직접 비교 결과는 예비 연구에만 있다. 예비 연구에서 말소리장애 집단은 두 언어 모두에서 말 산출 능력이 일반 발달 집단보다 유의하게 낮았다. 과제별로 보면 다음과 같았다.
- DT: 집단 차이가 없었다.
- PRT: 언어 차이가 유의했다.
- NRT: 언어 차이와 집단 차이가 모두 유의했다.
아래는 논문의 결론이 아니라 필자의 해석이며, 논문에서 검증되지 않았다. 본 연구에서는 영어를 1년 이상 배운 일반 발달 아동도 NRT에서 영어 점수가 한국어보다 낮았다(86.18−78.55=7.63점). 필자는 이 정도의 언어 차이가 영어 학습 과정에서 흔히 나타나는 차이일 가능성이 있다고 본다. 예비 연구처럼 같은 과제에서 집단 차이까지 나타나는 경우가 언어 학습 차이와 장애를 구분하는 단서가 될 수 있을지도 모른다.
다만 이런 구분에 SPT를 쓸 수 있을지는 후속 연구가 필요하다. 논문은 본 연구에서 장애 집단을 비교하지 않았고, 말소리장애 아동에게서 SPT의 효과를 충분히 평가하지 못했다고 밝혔다. 예비 연구도 말소리장애 아동 10명과 일반 발달 아동 20명으로 표본이 작다.
연구진은 과제 간 점수 조합을 해석하는 예도 제시했다. IPAT와 PRT 점수가 높은데 OPAT만 낮으면 어려움은 말 출력 단계에 있을 수 있다. IPAT가 OPAT보다 낮으면 PRT 점수로 문제가 음운 인식에 있는지 음운 표상에 있는지 판단할 수 있다.
의의와 한계
무엇이 달라지는가
- 말소리 처리 모형의 입력, 저장, 출력 단계를 다섯 과제로 함께 평가하는 체계를 만들었다.
- 같은 구조의 과제를 한국어와 외국어인 영어로 나란히 실시한다. 영어 과제는 번역이 아니라 영어를 배우는 5~7세 아동에 맞춰 새로 만들었다.
- 음운 인식을 말로 답하지 않는 입력형과 말로 답하는 출력형으로 나누어, 말소리장애 아동의 음운 인식이 낮게 평가되는 문제를 줄이려 했다.
- NRT를 음절 배열 점수로 채점해 음절 순서 계획 능력을 더 정밀하게 평가한다.
- 실시와 채점, 결과 표시가 자동화되어 있다. 이 기능으로 채점 부담이 줄 수 있으나, 실제 효과는 확인되지 않았다. 논문에는 실시 시간이나 노력이 실제로 얼마나 줄었는지에 대한 측정 결과가 제시되지 않았다.
실무자에게 주는 쓸모
언어치료사와 교사가 아동 한 명의 강점과 약점을 단계별 프로파일로 정리하는 데 SPT를 활용할 가능성이 있다. 다만 논문은 일반 발달 아동에게만 적용했고 준거 관련 타당도도 확인하지 못했으므로, 임상 집단에서의 타당도는 확인되지 않았다. 영어 발음 오류가 많은 아동을 만났을 때, 한국어와 영어의 점수 차이를 일반 발달 아동 30명의 차이와 탐색적으로 비교해 볼 수 있다. 이 비교는 대략적인 참고용이며, 장애 여부를 판단하는 기준이 아니다. 결과 화면은 정오와 세부 지표를 자동으로 정리해 준다. 이 자동 채점 기능이 수작업 채점 부담을 줄일 가능성이 있으나, 논문은 실제 시간 절감을 측정하지 않았다.
연구자에게 주는 쓸모
과제 개발, 전문가 타당도 검증, 아동 적용의 세 단계 절차는 다른 언어 조합의 평가 도구를 만들 때도 참고할 수 있다. 예비 연구에서 차이가 나지 않았던 DT의 난이도를 조정한 과정은 문항을 고쳐 민감도를 높이는 예다. 필자는 논문 표 4의 값을 이후 말소리장애 아동과 비교하는 연구에서 참고할 수 있다고 본다. 논문이 이런 용도를 제시한 것은 아니다.
논문이 밝힌 한계
논문이 스스로 밝힌 한계는 세 가지다.
- 본 연구의 표본이 일반 발달 아동뿐이어서 말소리장애 아동에게서 SPT의 효과를 충분히 평가하지 못했다. 연구진은 현재 말소리장애로 진단된 아동과 과거 이력이 있는 아동을 포함한 후속 임상 연구를 계획하고 있다.
- 영어 말소리 처리를 평가하는 비교 가능한 국내 표준화 도구가 없어 준거 관련 타당도를 확인하지 못했다.
- 참가자의 사회경제, 문화, 언어 배경과 이중언어 노출 정보를 모으지 않았다.
필자가 보는 적용 조건
아래는 논문에 적힌 내용이 아니라 필자가 실무 적용을 염두에 두고 덧붙이는 조건이다.
- 대상 연령과 영어 경험이 맞아야 한다. 과제와 참고 점수는 영어 수업을 1년 이상 받은 5~7세 아동을 기준으로 만들어졌다.
- 표 4의 평균을 규준으로 쓰기는 이르다. 30명의 평균과 표준편차는 대략적인 비교에 쓰고, 개별 아동의 장애 여부를 판정하는 기준으로 쓰지 않는 편이 안전하다.
- 실시 순서를 지켜야 비교가 의미 있다. 본 연구는 언제나 한국어판을 먼저 실시했으므로, 영어판을 먼저 하면 점수가 달라질 수 있다.
- DT의 언어 간 비교는 조심해서 읽어야 한다. 두 언어 자극의 음절 구조가 달라, 영어 점수가 높은 것을 영어 지각 능력이 더 좋다는 뜻으로 해석하기 어렵다.
바로 해 볼 일
- 이미 평가한 아동 자료가 있다면, 같은 아동의 한국어와 영어 점수를 과제별로 나란히 놓고 차이를 계산해 논문 표 4의 차이와 탐색적으로 비교한다. NRT처럼 일반 발달 아동에게서도 영어가 낮은 과제와, DT처럼 영어가 낮지 않은 과제를 나누어 본다.
- 비단어 따라말하기 응답을 녹음해 두었다면, 앞 방향과 뒤 방향 배열 점수 규칙으로 다시 채점해 본다. 논문 표 1의 예시처럼 생략과 첨가가 점수에 어떻게 반영되는지 확인하는 것이 첫 단계다.
- 음운 인식 과제를 말로 답하는 형태로만 실시해 왔다면, 그림 선택형 문항 몇 개를 함께 실시한다. 그다음 IPAT, PRT, OPAT 세 점수의 조합으로 어려움이 출력 단계에 있는지, 표상 단계에 있는지 판단해 본다.