AI로 쓴 글은 좋아졌지만 정작 내용은 기억하지 못했다




생성 인공지능(AI)을 활용하면 짧은 시간 안에 더 매끄럽고 논리적인 글을 만들 수 있지만, 완성된 결과물을 얼마나 이해하고 기억하는지는 별개의 문제일 수 있다는 실험 결과가 나왔다. 대학생을 대상으로 AI 사용 집단과 미사용 집단의 논술 결과를 비교한 결과, AI를 활용한 학생들은 글 자체의 평가에서는 높은 점수를 받았지만 자신이 작성한 글의 근거와 문장 구조를 다시 설명하는 과제에서는 오히려 낮은 점수를 기록했다.

챗GPT와 클로드 같은 생성 AI가 대학생의 자료 검색과 요약을 넘어 과제 작성, 시험 준비까지 빠르게 확산하는 상황에서 주목할 대목이다. 핵심은 AI 사용 자체보다 사고 과정 가운데 어느 부분까지 AI에 맡기고 있는지다. 완성된 문장을 얻는 효율은 높아졌지만 문제를 해석하고 근거를 선택한 뒤 자신의 언어로 논리를 구성하는 과정까지 외부 도구에 넘길 경우 결과물과 실제 학습 사이에 간극이 생길 수 있다는 지적이 나온다.

AI 사용 집단 글쓰기 점수 81.6점, 미사용 집단은 68.8점

중앙일보가 지난 9일 서울 소재 대학 재학생 10명을 대상으로 진행한 실험에서는 참가자들에게 30분 동안 ‘민주사회에서 전문가의 판단과 다수의 판단이 충돌할 때 무엇을 우선해야 하는가’를 주제로 논술하도록 했다. 참가자를 두 집단으로 나눠 한쪽에는 AI 사용을 허용하고 다른 쪽은 AI 없이 스스로 답을 작성하도록 했다.

완성된 글은 국어국문학과와 교육학과 교수 등을 포함한 전문가 5명이 논지의 명확성 등 5개 기준으로 평가했다. 결과물만 놓고 보면 AI를 사용한 A집단의 우위가 뚜렷했다. A집단의 평균 점수는 81.6점으로 AI를 사용하지 않은 B집단의 68.8점보다 12.8점 높았다. 5개 평가 기준 모두에서 A집단이 평균적으로 더 높은 점수를 받았다.

차이가 특히 컸던 부분은 문장 구성과 같은 표현의 적절성이었다. 이 항목에서 AI 사용 집단은 82.7점, 미사용 집단은 61.3점을 기록해 20점 이상의 격차가 발생했다. 생성 AI가 문장을 정돈하고 논리 구조를 갖춘 결과물을 만드는 데 상당한 도움을 줄 수 있다는 점이 실제 과제 평가에서도 드러난 셈이다.

평가에 참여한 노대원 성균관대 국어국문학과 교수는 다소 미완성된 글에서는 사람이 직접 작성했다는 인상을 받은 반면, 논리 구조와 맞춤법이 안정적으로 정리된 글에서는 AI 활용 가능성을 떠올렸으며 실제 평가 결과도 이와 비슷했다고 설명했다.

완성된 글을 다시 물었더니 결과가 뒤집혔다

그러나 실험은 제출된 글의 완성도를 평가하는 것으로 끝나지 않았다. 논술 직후 참가자들에게 자신이 작성한 글의 핵심 문장을 다시 쓰게 하고, 주장에 사용한 근거를 순서대로 복원하도록 하는 추가 과제가 주어졌다. 이 단계에서는 앞선 결과와 반대 현상이 나타났다.

AI 사용 집단의 이해도 평균 점수는 66.9점이었다. 반면 AI를 사용하지 않고 직접 글을 작성한 집단은 82.9점을 받았다. 결과물 평가에서는 AI 사용 집단이 12.8점 앞섰지만, 작성한 내용을 실제로 이해하고 기억했는지를 확인하는 평가에서는 오히려 16점 뒤처진 것이다.

세부 결과에서도 같은 흐름이 나타났다. 자신의 글에 사용한 근거를 복원하는 항목에서 AI 사용 집단은 57.3점, 뒷받침 정보를 확인하는 항목에서는 61.3점, 문단의 논리 구조를 파악하는 항목에서는 64점을 기록했다. 특히 마지막 문장이 무엇이었는지를 묻는 질문에는 AI를 사용하지 않은 참가자 전원이 답을 작성한 반면 AI 사용 집단에서는 절반 이상이 답 자체를 내놓지 못했다.

즉 AI를 활용한 학생들은 제출할 결과물의 핵심 주장 정도는 파악하고 있었지만, 그 주장을 어떤 근거로 뒷받침했는지 또는 문장이 어떤 논리적 순서로 연결됐는지를 상대적으로 충분히 기억하지 못했다. 글의 품질과 작성자의 이해도가 반드시 함께 높아지는 것은 아니라는 점을 보여주는 부분이다.

AI 사용 집단에 참여한 김서은 건국대 학생은 과제가 끝난 뒤 자신이 명확하게 다시 작성할 수 있는 문장이 사실상 없었다며 결과물을 자신의 글이라고 느끼기 어려웠다고 말했다. 서울대 재학생 황현민씨도 직접 작성했다면 내용이 더 잘 기억됐을 것 같다는 취지로 소감을 밝혔다.

AI에 맡긴 것은 문장인가, 생각하는 과정인가

이번 실험에서 확인된 차이는 생성 AI를 교육에 활용할 때 무엇을 평가해야 하는가라는 문제로 이어진다. 결과물만 평가한다면 문장 정리와 구조화에 강점을 가진 AI를 능숙하게 활용하는 학생이 유리할 수 있다. 그러나 학습의 목적이 문제를 이해하고 근거를 검토하며 자신의 논리를 만드는 데 있다면 완성된 문서의 품질만으로 실제 학습 성과를 판단하기 어렵다.

유성호 한양대 국어국문학과 교수는 자신이 작성한 내용을 스스로 말로 설명할 수 없는 부분이 많다면 학습 결과를 충분히 내면화하거나 주체화하지 못했다는 의미로 볼 수 있다고 해석했다.

서울대 심리학과 한소원 교수도 AI에 생각하는 작업 자체를 넘겨주기 시작하면 개인의 능력과 도구가 수행한 능력 사이의 경계가 흐려질 수 있다고 지적했다. 한 교수는 2026년 출간한 저서 『지능 파산』에서도 AI 시대에 인간이 판단과 사고를 도구에 지나치게 맡길 가능성을 주요 문제로 다뤘다. 이는 AI를 사용하지 말자는 주장이라기보다 AI를 사용하면서 인간이 직접 수행해야 할 사고 과정이 무엇인지 구분할 필요가 있다는 문제 제기에 가깝다.

실제로 한 대학생은 여러 생성 AI를 동시에 활용해 한 AI가 작성한 답변을 다른 AI에 평가시키고 그 가운데 적절해 보이는 결과를 선택하는 방식으로 공부한다고 설명했다. 이 방식은 정보를 비교하고 빠르게 결과를 얻는 데 유용할 수 있지만, 사용자가 문제를 직접 해석하고 초안을 만들고 반론을 검토하는 단계까지 AI가 대신한다면 학습 과정에서 사람이 담당하는 영역은 크게 줄어들 수 있다.

PISA 2025도 읽기·수학 하락, AI와 직접 인과관계는 구분해야

학생들의 학업 능력 저하는 국제 교육 지표에서도 확인되고 있다. 경제협력개발기구(OECD)가 2026년 9월 8일 공개한 PISA 2025에는 91개 국가·경제권의 학생 76만명 이상이 참여했다. 이들은 전 세계 약 3300만명의 15세 학생을 대표한다.

OECD 회원국 평균을 기준으로 2022년과 2025년을 비교하면 과학 성취도는 큰 변화가 없었지만 읽기는 약 14점, 수학은 9점 하락했다. 2015년과 비교하면 OECD 평균 읽기 점수는 28점, 수학은 22점 낮아졌다. PISA 2025에서 OECD 평균 성취도는 과학·읽기·수학 세 핵심 영역 모두 지금까지 관측된 가장 낮은 수준을 기록했다.

한국 역시 2025년 과학 평균 526점으로 상위권을 유지했지만 2022년과 비교하면 과학은 2점, 읽기는 15점, 수학은 5점 낮아졌다. OECD는 특히 읽기 영역에서 정보 평가, 여러 출처의 내용을 연결하는 능력, 읽은 내용을 비판적으로 판단하는 능력처럼 디지털·AI 환경에서 중요성이 커진 역량의 하락에 주목했다.

다만 이러한 국제 학업성취도 하락을 생성 AI 사용의 직접적인 결과라고 단정해서는 안 된다. PISA 결과는 여러 국가의 장기적인 교육 성취도 변화를 보여주는 자료이며 특정 기술 하나와 학업 능력 저하 사이의 인과관계를 입증하는 실험이 아니다. 코로나19 이후 교육 환경, 디지털 기기 사용, 교육제도와 사회경제적 조건 등 다양한 변수가 함께 존재하기 때문이다.

미국에서도 디지털 기술이 청소년의 학습에 미치는 영향은 정책 논의의 대상이 됐다. 2026년 1월 15일 미국 상원 상무·과학·교통위원회는 청소년과 기술의 영향을 다룬 청문회를 열었고, 신경과학자 재러드 쿠니 호바스를 비롯한 전문가들이 출석해 디지털 기술과 AI, 스크린 사용, 학습 환경에 관한 견해를 제시했다. AI와 교육의 관계가 단순한 학습 편의성의 문제가 아니라 학생이 어떤 방식으로 사고하고 학습할 것인가의 문제로 확대되고 있는 것이다.

이번 대학생 실험 역시 참가자가 10명인 소규모 실험이라는 점에서 결과를 전체 대학생이나 모든 AI 사용자에게 일반화하기에는 한계가 있다. 그럼에도 동일한 과제를 AI 사용 여부에 따라 수행한 뒤 완성된 글의 품질과 작성자가 실제로 기억하고 이해한 정도를 따로 측정했다는 점은 눈여겨볼 만하다.

생성 AI가 만든 결과물이 더 좋은 평가를 받는 것과 사용자가 그 내용을 자신의 지식으로 습득하는 것은 서로 다른 문제일 수 있다. AI 시대 교육에서 앞으로 확인해야 할 핵심도 여기에 있다. 얼마나 뛰어난 답을 빠르게 얻었는지만 보는 것이 아니라, 그 답을 만든 사람이 근거를 설명하고 반론을 검토하며 자신의 언어로 다시 구성할 수 있는지까지 함께 살펴볼 필요가 있다는 것이다.


관련 기사