OECD는 15세 학생이 한 학년 동안 대략 20점을 얻는다고 설명합니다. 28점이면 1년 반에 가까운 차이입니다.
9월 8일 OECD가 PISA 2025 결과 1권을 냈습니다. 91개국에서 76만 명이 넘는 15세 학생이 참여했고, 생성형 AI가 퍼진 뒤 처음 치른 PISA라 학생이 AI 챗봇을 학교 공부에 어떻게 쓰는지도 이번에 새로 질문했습니다.
국내 기사는 PISA 2025 AI 사용 결과를 "AI를 매일 쓴 학생은 성적이 낮다"로 요약했지만, 보고서에서는 목적과 사용 빈도를 나눠서 봤고 결과도 용도마다 달랐습니다.
미리 요약하면, PISA 2025에서 점수를 가른 것은 AI를 썼는지가 아니라 무엇을 맡겼는지였고, 글을 매일 맡긴 학생은 28점(학년 기준 1년 반 가량) 뒤처졌지만 모르는 것을 묻는 데 쓴 학생과 검증하며 쓰는 법을 배운 학생은 그렇지 않았습니다.
PISA 2025는 AI 사용을 어떻게 평가했나요?
PISA 2025는 AI 챗봇을 네 가지 용도로 얼마나 자주 쓰는지와 검증하는 법을 배웠는지 물었습니다.
네 용도는 글 요약, 과제용 초안 작성, 새 주제에 관한 사전 조사, 모르는 것을 질문해 배우기입니다. 빈도는 "전혀 또는 거의 안 씀"부터 "거의 매일 또는 그 이상"까지 다섯 단계로 답하게 했습니다.
여기에 수업에서 AI가 만든 정보의 질을 평가하는 법을 배운 적이 있는지도 따로 물었습니다. 그래서 쓰느냐 안 쓰느냐로 뭉뚱그리지 않고 용도, 빈도, 검증 훈련 여부로 나눠 점수를 비교할 수 있게 됐습니다.
OECD 평균으로 네 용도 모두 전혀 안 쓴다고 답한 학생은 13.7%였습니다. 모르는 것을 묻는 용도로 거의 매일 쓴다는 학생은 19.1%였습니다. 글 요약과 초안 작성, 사전 조사를 거의 매일 한다는 답은 11% 안팎이었습니다.
AI에 글을 매일 맡긴 학생은 얼마나 뒤처졌나요?
초안 작성을 거의 매일 AI에 맡긴 학생은 안 쓴 학생보다 과학 점수가 28점 낮았습니다.
뒤처진 폭은 용도마다 달랐습니다. 글을 통째로 맡기는 두 용도인 초안 작성과 요약에서 차이가 컸고, 사전 조사와 모르는 것 묻기 순으로 줄었습니다.
용도별로 얼마나 차이가 났나요?
요약 31점, 초안 작성 28점, 사전 조사 19점, 모르는 것 묻기 5점이었습니다.
용도 | 안 쓴 학생 | 거의 매일 쓴 학생 | 차이 |
|---|---|---|---|
초안 작성 | 509점 | 481점 | 28점 |
글 요약 | 508점 | 477점 | 31점 |
사전 조사 | 505점 | 486점 | 19점 |
모르는 것 묻기 | 499점 | 494점 | 5점 |
OECD 평균 과학 점수이고, 학생의 사회경제적 배경을 보정한 값입니다(보고서 Figure I.4.13).
💡
빈도를 다섯 단계로 나눠 보면 요약과 사전 조사에서는 한 달에 한두 번에서 일주일에 한두 번 쓴 학생이 매일 쓴 학생보다 점수가 높았습니다. 요약은 한 달에 한두 번 쓴 학생이 494점, 매일 쓴 학생이 477점이었습니다. OECD는 이를 두고 적당히 쓰는 학생이 아주 드물게 쓰는 학생보다도, 매일 쓰는 학생보다도 점수가 높다고 정리했고, 초안 작성에서는 이 차이가 뚜렷하지 않다고 덧붙였습니다. 다만 이 세 용도에서는 어느 빈도로 쓰든 안 쓴 학생의 점수를 넘지 못했습니다.
AI 때문에 성적이 떨어진 건가요?
이 점수 차이는 상관관계이고, OECD도 AI 사용이 성적을 떨어뜨렸다고 단정하지 않았습니다.
보고서는 "이 관계가 AI 사용이 과학 성적에 부정적 영향을 미쳤다는 뜻은 아니며, 누가 AI를 쓰고 어떻게 쓰는지가 복합적으로 섞인 결과일 수 있다"고 적었습니다. 쉽게 말하면 매일 글을 맡기는 학생과 안 쓰는 학생은 공부 습관이나 그전까지의 성취가 처음부터 달랐을 수 있다는 뜻입니다.
안 쓰는 학생 중에는 사회경제적으로 불리한 배경의 학생이 많고, 자주 쓰는 학생 중에는 유리한 배경의 학생이 많습니다. 그런데도 안 쓰는 학생의 점수가 대체로 높아서, OECD는 배경만으로는 이 차이를 다 설명할 수 없다고 봤습니다. 그리고 적어도 PISA 2025 시점에는 AI를 써야만 성적이 좋은 것은 아니었다고 설명했습니다.
매일 써도 뒤처지지 않은 학생은?
모르는 것을 묻는 데 쓴 학생과 AI 정보를 검증하는 법을 배운 학생은 매일 써도 뒤처지지 않았습니다.
예외는 둘이고, 둘 다 빈도보다 쓰는 방식과 관련이 있습니다.
모르는 것을 묻는 데 쓰면 어떻게 되나요?
모르는 것을 묻는 용도로 일주일에 한두 번 쓴 학생은 안 쓴 학생과 과학 점수가 비슷했습니다.
배경을 보정한 OECD 평균으로 안 쓴 학생은 499점, 일주일에 한두 번 쓴 학생은 501점, 거의 매일 쓴 학생은 494점이었습니다. OECD는 일주일에 한두 번 쓰는 학생은 안 쓰는 학생과 점수가 비슷하고(similar), 거의 매일 쓰거나 한 달에 두 번 이하로 쓰는 학생은 안 쓰는 학생보다 낮았습니다. 매일 써도 5점 차이라 초안 작성의 28점과는 다른 결과로 해석할 수 있습니다. 나머지 세 용도에서는 이런 예외가 없었습니다.
검증하는 법을 배운 학생은 어땠나요?
검증하는 법을 배운 학생은 방법을 배우지 않은 학생보다 14점 높았고, 안 쓴 학생보다 낮지 않았습니다.
수업에서 검증하는 법을 배웠다고 답한 학생은 OECD 평균 62.6%였고, 나라별로는 31%에서 80% 이상까지 벌어집니다. 배운 학생 가운데 거의 매일 쓴 학생은 502점으로 안 배우고 매일 쓴 학생의 488점보다 14점 높았습니다(학년으로 치면 반년이 넘는 차이입니다).
배우고 일주일에 한 번 이상 쓴 학생은 502~506점으로, 안 쓴 학생의 493~497점보다 높았습니다. OECD는 학교에서 AI 관련 학습 기회가 있었던 학생 중 주 1회 이상 쓴 학생이 안 쓴 학생보다도, 월 2회 이하로 쓴 학생보다도 조금(slightly) 앞섰다고 정리했습니다.
이 비교는 배경을 보정하기 전 값입니다. 배경을 보정하면 평균적으로는 검증 훈련과 점수의 관계가 약해진다고 OECD가 각주에 적었고, 이 결과로 인과를 확인할 수는 없다고도 밝혔습니다. 불리한 배경의 학생일수록 이 훈련을 덜 받았다는 점도 같은 조사에 나옵니다.
OECD 교육국장 안드레아스 슐라이허는 보고서 서문에 "학습은 내용을 소비한다고 일어나지 않고, 새로운 내용과 머리로 씨름할 때 일어난다"고 썼습니다(원문은 "a productive cognitive struggle of the mind with new material"). 기술이 대신하면 학생의 성장을 해치고, 돕는 쪽으로 쓰이면 학생이 나아간다는 설명입니다.
AI는 발판(scaffold)이 되어야지 목발(crutch)이 되어서는 안 된다는 말도 여기에 나옵니다. Euronews 인터뷰에서도 AI가 준 답을 확인하고 검증하는 습관이 있어야 한다고 말했습니다.
OECD는 다음 PISA에서 AI 리터러시를 정식으로 평가하겠다고 이미 예고했습니다. 뉴욕시가 학생용 AI 도구를 심사하며 세운 기준도 "AI가 학생의 사고를 대신하는지"였고, 76만 명이 참여한 이번 결과가 그 기준을 뒷받침합니다.
한국 학생은 AI를 얼마나 쓰고 있나요?
한국 학생은 네 용도 모두 OECD 평균보다 자주 쓰고, 검증 훈련 경험도 66.5%로 평균보다 높습니다.
모르는 것을 묻는 용도로 일주일에 한 번 이상 쓴다는 한국 학생은 50.7%로 OECD 평균 45.5%보다 높습니다. 나머지 세 용도는 OECD 부록 자료를 정리한 한겨레 보도에 따르면 사전 조사 43.9%, 초안 작성 37.4%, 요약 36.8%입니다. OECD 평균은 세 용도 모두 30% 안팎이라 한국이 7~13%포인트 높습니다.
수업에서 AI 정보를 검증하는 법을 배웠다는 학생은 66.5%로 OECD 평균 62.6%보다 조금 높습니다. 많이 쓰면서 검증도 함께 배우는 상황에서, 학생들에게 무엇을 어떻게 맡길지가 한국의 과제라고 할 수 있습니다.
이번 한국 점수는 과학 526점, 수학 522점, 읽기 501점입니다. 읽기는 2022년보다 15점 내려 2000년 이후 최저이고, OECD 평균도 14점 내렸습니다. 이 하락과 AI 사용을 잇는 분석은 보고서에 없습니다. 교육부는 후속 조치로 수업과 연계한 독서교육을 늘리고 질문과 토론 중심의 수업을 지원하겠다고 밝혔습니다. 독서교육 집중 학년(초3~4, 중1, 고1) 지정과 책 읽는 학교 확대가 그 안에 들어 있습니다.
AI를 가장 덜 쓴 일본은 어땠나요?
일본은 AI를 안 쓴 학생이 39.1%로 가장 많고 점수도 1위였지만 검증 훈련은 31.2%로 최저였습니다.
네 용도 모두 안 쓴다는 학생 비율 39.1%는 OECD 평균의 약 3배입니다. 일본 국립교육정책연구소(NIER)가 낸 요약 자료에 따르면 학교 공부에 AI를 쓰는 빈도 지수도 OECD 38개국 중 38위입니다. 점수는 과학 538점, 수학 525점, 읽기 503점으로 세 과목 모두 OECD 회원국 중 1위입니다.
여기까지만 보면 안 쓰는 쪽이 안전해 보입니다. 그런데 수업에서 AI 정보를 검증하는 법을 배웠다는 일본 학생은 31.2%로 조사 대상 중 최저입니다. 안 쓰는 학생이 많은 나라의 높은 점수가 "안 쓰는 것이 낫다"는 증거가 되지는 않고, 검증 없이 쓰기 시작한 학생이 어떻게 되는지도 이 결과로는 알 수 없습니다. NIER도 같은 자료에서 검증을 배우고 적당히 쓰는 학생의 점수가 높다고 정리했습니다.
싱가포르는 반대쪽입니다. 모르는 것을 묻는 용도로 일주일에 한 번 이상 쓴다는 학생이 65.6%, 검증 훈련을 받았다는 학생이 81.0%이고, 안 쓴다는 학생은 4.4%입니다. 베트남은 안 쓰는 학생이 4.1%로 조사 대상 중 제일 적었고 검증 훈련 경험은 70.0%였습니다. 둘 다 많이 쓰면서 검증도 함께 가르치는 나라입니다.
교육 현장에서의 활용
이번 결과에 맞는 수업 규칙은 AI에 맡기는 용도, 쓰는 단계, 검증 과제 셋을 미리 정해 두는 것입니다.
이번 결과를 AI를 막을 근거로 읽기는 어렵습니다.
용도를 정합니다.
초안 작성과 요약처럼 글을 통째로 맡기는 일은 빼고, 모르는 것 묻기, 반례 찾기, 자기 글 검토처럼 학생이 먼저 생각한 뒤에 쓰는 용도로 좁힙니다.쓰는 단계는 교사가 정합니다.
모든 걸 열어 두지 않고 자료를 조사할 때나 초고를 다 쓴 뒤 검토할 때처럼 정해진 단계에서만 씁니다.검증을 과제에 넣습니다.
AI 답에서 틀린 곳 찾기와 출처 대조를 채점 항목으로 둡니다. 검증하는 법을 배운 학생이 매일 써도 뒤처지지 않았고, 불리한 배경의 학생일수록 이 훈련을 덜 받았습니다.
코딩 수업이라면 학생이 AI에게 시키기만 하는 바이브 코딩 수업을 어떻게 바꿀지 정리한 글이 있고, 학생이 AI 답을 그대로 붙여 올 때의 지도법은 따로 정리해 두었습니다.
인과 관계는 OECD도 확인하지 못했으니, 우리 교실에서 어떤 용도가 학생의 생각을 대신하는지는 학생이 낸 과제를 보면서 확인할 일입니다. 학교와 기관의 AI·SW 교육을 설계하고 운영하는 악어에듀도 학생에게 정답 대신 힌트를 주는 방식으로 AI를 활용하고 있습니다.
참고 자료