AI에게 물어가며 리포트를 한 편 쓰고 나면, 이상하게 뿌듯합니다. 막힘 없이 술술 풀렸고, 결과물도 예전보다 훨씬 매끄럽습니다. "오늘 확실히 배웠다"는 감각이 남죠.

그런데 며칠 뒤가 문제입니다. 같은 주제로 시험을 보거나 누가 설명을 부탁하면, 분명 방금 다뤘던 내용인데도 말문이 턱 막힙니다.

바로 이 간극이 요즘 교육 연구자들이 경고하는 AI 학습 착시의 핵심입니다. AI를 쓰면 결과물은 분명히 좋아집니다. 하지만 그 좋아진 결과물이 곧 내 실력이 되었다는 보장은 어디에도 없습니다. 오히려 잘 배웠다는 느낌 자체가, 실은 배우지 않았다는 사실을 가려버리는 것이 진짜 함정입니다.

실험이 드러낸 역설 — 결과는 오르고, 사고력은 내려간다

같은 학습 자료로 AI를 써서 공부해도 결과물의 질은 올라가지만 사고력과 파지력은 오히려 내려가, 두 곡선이 반대로 갈라진다. 잘 배웠다는 느낌이 가장 강한 순간이 실은 배우지 않았다는 사실을 가리는 것이 AI 학습 착시의 핵심이다.
결과는 오르고, 실력은 내려간다

케이트 헐리(Kate Hurley)가 EDUCAUSE Review에 쓴 글의 제목은 아예 대놓고 이렇게 말합니다. "AI 조력의 역설: 더 나은 결과, 더 나빠진 사고(The Paradox of AI Assistance: Better Results, Worse Thinking)."

이 글이 소개한 2025년 무작위 대조 실험(RCT)이 그 역설을 정확히 보여줍니다. 같은 학습 자료를 두 집단에 나눠 주고, 한쪽은 전통적인 방식으로, 다른 한쪽은 ChatGPT를 계속 활용해 공부하게 했습니다.

  • 공부하는 동안에는 ChatGPT 집단이 앞섰습니다. 문제를 더 빨리 풀었고, 결과물의 품질도 더 높았죠. 눈앞의 모든 지표가 위를 가리켰습니다.
  • 그런데 6주 뒤, 예고 없이 치른 파지(retention) 시험에서 결과가 뒤집혔습니다. 전통적으로 공부한 집단이 약 11%포인트 앞선 겁니다.
2025년 무작위 대조 실험에서 공부하는 동안에는 ChatGPT 집단이 속도와 결과물 품질에서 앞섰지만, 6주 뒤 예고 없이 치른 파지 시험에서는 전통적으로 공부한 집단이 약 11%포인트 앞서며 결과가 완전히 뒤집혔다. 잘하고 있다는 감각이 가장 강했던 쪽이 정작 더 적게 기억했다.
6주 뒤 뒤집힌 11%포인트

공부하는 순간에 느낀 유능함과, 시간이 지난 뒤 실제로 남은 실력이 정반대였던 셈입니다. 잘하고 있다는 감각이 가장 강했던 쪽이, 정작 6주 뒤엔 더 적게 기억했습니다.

"에세이는 좋아졌지만, 아는 건 없었다"

중국 대학생 117명을 4개 조건으로 나눈 에세이 실험에서 ChatGPT 사용 집단은 가장 많이 개선된 에세이를 냈지만 내용 이해와 자기점검은 가장 얕았고, AI 없이 체크리스트만 받은 집단이 사고 과정에 가장 깊이 관여했다. 연구진은 이를 메타인지적 게으름이라 불렀다.
가장 좋은 에세이, 가장 얕은 이해

또 다른 연구는 이 착시가 대체 어디서 오는지를 짚습니다. 판이저우(Fan Yizhou) 연구팀이 《British Journal of Educational Technology》에 발표한 연구(2024년 말 온라인 공개, 2025년 정식 게재)인데, 중국 학생 117명을 네 가지 조건으로 나눠 에세이 과제를 시켰습니다.

  • ChatGPT를 쓴 학생들은 가장 많이 개선된 에세이를 내놓았습니다. 하지만 내용을 더 깊이 이해하지는 못했습니다.
  • 이들은 원자료를 파고드는 정도가 오히려 낮았고, 자기 결과물을 점검하거나 스스로 이해했는지 확인하는 데 쓴 시간이 거의 없었습니다.
  • 흥미로운 건 따로 있습니다. 집단 간에 과제 후 내재적 동기 자체는 뚜렷한 차이가 없었지만, 계획하고 점검하고 평가하는 자기조절학습 과정에 관여한 정도와 순서에서는 큰 차이가 났습니다. AI 없이 체크리스트만 받은 집단이 그 사고 과정에 가장 깊이 관여했습니다.

연구자들은 이 현상에 "메타인지적 게으름(metacognitive laziness)"이라는 이름을 붙였습니다. 판단하고, 구조를 짜고, 스스로 점검하는 일. 이렇게 머리가 아픈 과정을 통째로 AI에 떠넘기면, 결과물은 좋아지지만 정작 그 결과물을 만드는 사고 근육은 한 번도 쓰지 않게 됩니다.

착시는 학습의 '순서'가 끊길 때 생긴다

원래 배움에는 순서가 있습니다. 스스로 씨름하고, 막히고, 틀리고, 피드백을 받아 고치는 과정에서 지식이 비로소 몸에 붙습니다. EDUCAUSE 글의 표현을 빌리면, AI는 이 순서를 조용히 끊어버립니다.

학생이 AI로 초안을 만들고, 그 초안에 대한 강사의 피드백을 받고, 다시 AI로 수정본을 제출한다. 모든 단계를 완수했지만—아무것도 배우지 못했다.

— EDUCAUSE Review, "The Paradox of AI Assistance"

겉으로는 모든 학습 단계를 다 밟았습니다. 제출도 했고, 피드백도 반영했죠. 그래서 '했다'는 감각이 또렷하게 남습니다. 하지만 정작 씨름하고 판단하는 일은 AI가 대신했기 때문에, 머릿속에는 아무 흔적도 남지 않습니다. 절차를 다 밟았다는 완수감이 학습의 실체를 대신해버리는 것, 이것이 착시의 정체입니다.

Anthropic이 2025년 4월 발표한 분석은 이 패턴이 이미 얼마나 넓게 퍼졌는지 보여줍니다. 대학생과 Claude가 나눈 대화 574,740건을 살펴봤더니, 약 39%가 에세이·요약·코드처럼 학습 콘텐츠를 만들고 다듬는 작업이었고, 약 34%가 기술적 설명이나 풀이를 구하는 것이었습니다. 그리고 거의 절반의 요청이 후속 논의 없이 곧장 '정답'만 받아가려는 형태였습니다. 일부는 표절 탐지를 피하려 문장을 다시 써 달라고 요청하기도 했고요. 씨름하는 과정을 건너뛰고 결과만 챙겨가는 방식이, 예외가 아니라 다수였다는 뜻입니다.

대학생과 Claude가 나눈 대화 574,740건을 분석하니 약 39%가 에세이·요약·코드 같은 학습 콘텐츠를 만들고 다듬는 작업, 약 34%가 기술적 설명이나 풀이를 구하는 것이었고, 거의 절반은 후속 논의 없이 곧장 정답만 받아가는 형태였다. 씨름을 건너뛰고 결과만 챙기는 방식이 다수였다.
574,740건이 드러낸 사용 패턴

그래서, 어떻게 써야 착시에 빠지지 않을까

AI 학습 착시를 피하는 검증법은 AI 없이 스스로 재현·설명할 수 있는지 확인하는 것이다. 학생은 답을 보기 전에 먼저 초안을 쓰고 백지 상태에서 재현해 보며, 가르치는 쪽은 제출물 대신 구두 설명·즉석 변형·과정 회고처럼 남에게 떠넘길 수 없는 사고를 평가해야 한다.
AI 없이 재현되는지로 검증하라

결론은 "AI를 쓰지 마라"가 아닙니다. AI는 결과물의 질을 실제로 끌어올립니다. 진짜 문제는 결과물의 질을 곧 내 실력으로 착각하는 것이죠. 몇 가지 실천 원칙을 제안합니다.

학생이라면

  • AI가 준 답을 보기 전에, 먼저 스스로 초안을 만들어 보세요. 한바탕 씨름한 뒤에 AI를 쓰는 것과, 처음부터 AI로 시작하는 것은 학습적으로 완전히 다른 일입니다.
  • '잘 풀렸다'는 느낌을 믿지 마세요. AI 없이 백지 상태에서 다시 설명하고 재현해 보는 것으로 실제 학습을 검증해야 합니다. 설명하지 못하면, 배운 게 아닙니다.
  • AI에게 정답 대신 질문을 시켜 보세요. "내가 놓친 게 뭐냐"고 되묻는 방식이 사고 근육을 남깁니다.

가르치는 입장이라면

  • 결과물, 즉 제출물만 평가하면 오히려 착시를 부추기게 됩니다. 구두 설명, 즉석 변형 문제, 과정 회고처럼 남에게 떠넘길 수 없는 사고를 평가에 넣어야 합니다.
  • AI 사용 자체를 숨기게 만들기보다, "어디를 AI에 맡기고 어디를 직접 판단했는지"를 드러내게 하는 설계가 훨씬 효과적입니다.

정리

잘 배웠다는 느낌과 실제로 남은 실력은 별개입니다. 그리고 AI는 이 둘을 자꾸 벌려 놓습니다. 실험에서 학습 중 모든 지표가 좋았던 집단이 6주 뒤엔 11%포인트 뒤처졌고, 가장 매끄러운 에세이를 쓴 학생들이 정작 내용은 가장 덜 이해했습니다.

AI 학습 착시를 피하는 방법은 의외로 단순합니다. 좋아진 결과물을 실력의 증거로 믿지 말고, AI 없이 스스로 재현할 수 있는지로 검증하는 것. 힘든 사고를 AI에 떠넘긴 만큼, 딱 그만큼의 배움도 함께 떠나간다는 사실을 기억해야 합니다.

출처 · 참고

참고 문헌