지금 AI 분야에는 새로운 흐름이 일고 있는데, 이는 챗봇과는 다른 차원의 이야기입니다. 지난 몇 달 사이 무언가 크게 바뀌었습니다. AI 시스템은 단순히 질문에 답하는 수준을 넘어, 전체 코드베이스를 작성하고, 복잡한 프로젝트를 관리하며, 최소한의 인간 개입만으로 다단계 작업을 수행하는 단계로 진화했습니다. 하룻밤 사이에 폭발적인 인기를 끈 오픈소스 에이전트 프레임워크인 Clawdbot과 같은 도구들은 사용자가 자신의 기기에서 AI를 로컬로 실행하고, 자체 앱과 연결하여 AI가 사용자를 대신해 행동하게 만듭니다. Claude Code는 소프트웨어 개발 방식을 근본적으로 바꾸고 있습니다.
제가 신뢰하는 개발자인 맥케이 리글리(McKay Wrigley)는 Opus 4.5를 두고 "코드 분야에서 Sonnet 3.5가 그랬던 것처럼 에이전트 분야의 변곡점"이라고 평가했습니다. 독립 평가 기관인 METR은 AI가 자율적으로 작업할 수 있는 시간 범위가 4~7개월마다 두 배씩 늘어나고 있다는 사실을 발견했습니다. Brisk의 엔지니어들은 코딩 작업의 거의 전부를 AI에 맡기고, 자신들은 검토하고 지시하며 결정하는 일에 시간을 쏟고 있습니다.
이것은 단순한 과장이 아닙니다. 에이전트 패러다임은 지식 노동 분야에서 효과를 발휘하고 있으며, 앞으로 수많은 산업의 운영 방식을 변화시킬 것입니다.
에이전트 패러다임이 학생들에게는 독이 되는 이유
최근 한 기자가 저에게 이것이 K-12 교육에 어떤 의미가 있는지 물었습니다. 한동안 이 문제에 대해 고민해 왔는데, 제 솔직한 답변은 다음과 같습니다. 아마도 허상일 가능성이 큽니다. 에이전트가 강력하지 않아서가 아니라, 소프트웨어 엔지니어링에서 에이전트가 효과를 내는 논리가 학습 과정에서는 오히려 해가 되기 때문입니다. 교육계에서 이 차이를 명확히 구분하는 사람이 아직 부족한 것 같습니다.
가장 쉽게 이해하는 방법은 '목표가 무엇인가?'라고 자문해 보는 것입니다.
소프트웨어 분야에서 목표는 결과물입니다. 기능을 출시하고, 버그를 수정하고, 시스템을 배포하는 것이죠. 만약 AI 에이전트가 당신보다 더 빠르고 뛰어나게 코드를 작성해 준다면, 그것이 바로 핵심입니다. 에이전트가 작업을 수행하는 것 자체가 곧 제품입니다. 엔지니어의 업무는 AI가 실행을 담당하는 동안 검토하고, 지시하며, 결정하는 역할로 점점 바뀌고 있습니다.
학교에서의 목표는 정반대입니다. 결과물(에세이, 문제 풀이, 실험 보고서)은 사실 부차적인 것에 불과합니다. 중요한 것은 그 결과물을 만드는 과정에서 학생의 뇌 속에서 어떤 일이 일어났느냐 하는 것입니다.
AI 에이전트를 사용해 과제를 끝낸 학생은 도움을 받은 것이 아닙니다. 오히려 가장 중요한 학습의 기회를 빼앗긴 것입니다. 결과물이 더 좋아 보인다는 사실은 오히려 더 나쁜 결과를 초래합니다. 학습이 전혀 이루어지지 않았음에도 학습이 일어난 것 같은 착각을 불러일으키기 때문입니다.
이제 이에 대한 확실한 증거도 있습니다. PNAS에 발표된 터키의 고등학생 약 1,000명을 대상으로 한 무작위 대조 실험이 바로 이 시나리오를 검증했습니다. 학생들은 세 그룹으로 나뉘었습니다. AI를 전혀 사용하지 않는 그룹, 일반적인 ChatGPT와 유사한 도구를 사용하는 그룹, 그리고 교사들의 의견을 반영해 세심하게 가이드라인이 설정된 AI 튜터를 사용하는 그룹입니다.
일반 AI 도구를 사용한 학생들은 연습 문제에서 48% 더 높은 성과를 보였습니다. 하지만 AI를 사용하지 못하게 한 시험에서는 오히려 17% 더 낮은 성적을 기록했습니다. 가장 우려스러운 점은 학생들이 이 사실을 전혀 인지하지 못했다는 것입니다.
그들은 대조군보다 자신이 더 많이 배웠다고 믿었습니다. 불과 몇 주 전 발표된 OECD의 '2026 디지털 교육 전망(Digital Education Outlook)'에서는 이를 '메타인지적 게으름(metacognitive laziness)'이라는 용어로 정의했습니다. 학생들은 단순히 작업만 넘기는 것이 아니라, 자신이 실제로 배우고 있는지조차 파악하지 못하게 된 것입니다.
가이드라인이 설정된 튜터 그룹은 다소 나은 성과(연습 문제에서 127% 향상)를 보였지만, AI의 도움 없이 치른 시험에서는 AI를 전혀 사용하지 않은 학생들과 차이가 없었습니다. 가장 세심하게 설계된 학생용 AI 도구조차도 정작 중요한 평가에서는 측정 가능한 학습 성과를 전혀 내지 못했습니다.
이것은 단순히 학생들이 게을러서가 아닙니다. 에이전트라는 기술의 본질과 K-12 교육의 본질 사이에 존재하는 구조적인 문제입니다.
세 가지 구조적 불일치
불일치 1: 전문가 개입 문제
에이전트는 특정 유형의 업무를 위해 설계되었습니다. 에이전트는 인간이 결과물을 평가할 수 있을 만큼 숙련된, 개방적이고 새로운 문제를 해결하는 데 능숙합니다. Claude Code를 사용하는 엔지니어는 풀 리퀘스트를 읽고, 오류를 찾아내고, 트레이드오프를 이해하며, 방향을 수정할 수 있습니다. 에이전트가 제안하면 전문가가 결정합니다. 이는 인간이 에이전트의 작업을 제대로 검증할 수 있는 도메인 지식을 갖추고 있기 때문에 가능한 일입니다.
중학교 3학년 학생은 이렇게 할 수 없습니다. AI 튜터가 학생에게 수학 문제를 단계별로 설명하거나 에세이 초안을 작성해 줄 때, 학생은 정작 자신이 습득해야 할 바로 그 지식이 부족한 상태입니다. 학생들은 AI의 추론이 타당한지, 생략된 단계는 없는지, 혹은 설명이 유창하더라도 미묘하게 틀린 부분은 없는지 평가할 수 없습니다.
인간 개입 모델은 바로 그 인간이 학습해야 할 대상일 때 무너집니다.
이는 더 나은 프롬프트 엔지니어링이나 더 정교한 안전장치로 해결할 수 있는 문제가 아닙니다. 구조적인 문제입니다. 학생은 정의상 아직 전문가가 아니기 때문입니다.
불일치 2: 일상적인 업무와 새로운 추론
두 번째 불일치가 있습니다. 에이전트는 낯선 영역에서 유연한 추론이 필요한 새롭고 일반화 가능한 작업을 위해 설계되었습니다. 하지만 K-12 교육은 새로운 것이 아닙니다. 180일간의 구조화되고 순차적인 커리큘럼입니다. 휴스턴의 3학년 교사와 멤피스의 3학년 교사는 거의 같은 순서로 거의 같은 기준을 가르칩니다. 이 업무는 가장 좋은 의미에서 일상적입니다. 지식을 점진적으로 쌓을 수 있도록 세심하게 설계되어 있으며, 각 수업은 이전 수업을 기반으로 합니다. 매번 처음부터 추론하는 AI는 필요하지 않습니다. 알려진 범위와 순서에 따라 안정적으로 실행되는 무언가가 필요합니다. 에이전트 패러다임은 잘못된 문제를 겨냥하고 있습니다.
불일치 3: 생산적 고군분투와 비생산적 고군분투
가장 깊은 문제가 하나 더 있습니다. 훌륭한 교사들은 직관적으로 이해하고 있지만, AI 교육 담론에서는 거의 완전히 배제된 문제입니다. 바로 생산적 고군분투와 비생산적 고군분투의 차이입니다.
모든 어려움이 같은 것은 아닙니다. 학생이 어려운 수학 문제와 씨름하며 잘 풀리지 않는 답답함을 느끼는 것, 그것이 바로 생산적 고군분투입니다. 학습은 바로 거기서 일어납니다. 하지만 교사가 40분 동안 세 가지 다른 플랫폼에서 수업 계획안의 서식을 다시 지정하거나, 다섯 가지 읽기 수준에 맞춰 읽기 지문을 수동으로 차별화하거나, LMS에서 태그를 지정할 올바른 기준을 찾느라 시간을 허비하는 것은 비생산적 고군분투입니다. 이는 누구에게도 학습을 제공하지 않습니다. 순수한 오버헤드일 뿐입니다.
범용 AI 에이전트는 생산적 고군분투와 비생산적 고군분투를 구분하지 못합니다. 기본 설정은 둘 다 없애버리는 것입니다.
에이전트를 학생에게 적용하면, 학습이 일어나는 핵심 과정인 생산적 고군분투까지 잡무와 함께 제거해 버립니다. 터키(Turkey) 연구가 보여준 것이 바로 이것입니다. AI는 작업을 더 쉽게 느끼게 만들었습니다. 학생들은 자신이 배우고 있다고 느꼈습니다. 하지만 그 '쉬움'이 바로 문제였습니다.
학생들에게 실제로 효과가 있는 것
학생에게 자율형 에이전트가 적합한 모델이 아니라면, AI를 학생에게 절대 사용해서는 안 된다는 뜻일까요? 그렇지 않습니다. 다만 AI의 방향성은 에이전트 패러다임과는 완전히 달라야 하며, AI가 무엇을 지향하게 할 것인지에 대한 통제권은 반드시 교사가 쥐고 있어야 합니다..
학생 대상 AI 활동을 위한 두 가지 설계를 생각해 봅시다. 첫 번째 설계에서 학생은 범용 AI를 열고 "남북 전쟁의 원인에 관한 에세이를 쓰는 것을 도와줘"라고 요청합니다. 에이전트는 기꺼이 응합니다. 개요를 작성하고, 논지를 제안하며, 다듬을 문단들을 제시하죠. 학생은 결국 그럴듯한 에세이를 완성하지만, 자신이 무언가를 했다는 느낌은 모호합니다. 이것이 학습에 적용된 에이전트 모델이며, 터키 연구에서 측정한 방식입니다. 이는 효과가 없습니다.
두 번째 설계에서는 교사가 이번 주 단원에 기반한 활동을 만듭니다. AI의 역할은 학생의 과제 완성을 돕는 것이 아닙니다. 학생이 특정 학습 성과를 입증하도록 유도하는 것이죠. 학생은 AI에게 대신 생각하게 함으로써 과제를 해결할 수 없습니다. AI는 질문을 던지고, 반문하며, 학생이 자신의 논리를 명확히 설명하도록 요구합니다. 이해했음을 증명해야만 다음 단계로 넘어갈 수 있습니다. 교사가 성과를 정의하고, AI는 그 경로를 강제합니다.
첫 번째 모델에서 AI는 과제를 향해 있고, 성공 지표는 과제 완료입니다. 두 번째 모델에서 AI는 학생을 향해 있고, 성공 지표는 학생이 이해도를 입증했는지 여부입니다.
작은 차이처럼 들리지만 모든 것을 바꿉니다. 하나는 에이전트이고, 다른 하나는 교사의 교수법을 위한 도구입니다. 이것이 바로 우리가 Brisk Boost를 통해 구축한 것입니다. 교사가 학습 목표를 설정하고, AI는 실제 교육 과정에 기반하며, 학생은 스스로 생각해야 하는 학생 대상 AI 활동이죠. AI의 역할은 생산적인 고뇌를 제거하는 것이 아니라, 피할 수 없게 만드는 것입니다.
문제는 "AI를 학생에게 사용해야 하는가"가 아니었습니다. 핵심은 "누가 통제권을 갖는가"와 "AI가 무엇을 최적화하는가"입니다. 과제 완료를 최적화하는 범용 에이전트는 항상 학생 대신 일을 처리하려는 경향이 있습니다. 그것이 에이전트가 만들어진 목적이니까요. 교사가 학습 성과를 정의하고 AI가 그 방향으로 나아가도록 제한하면 역학 관계가 뒤집힙니다. AI는 엄격함을 우회하는 도구가 아니라, 엄격함을 강화하는 도구가 됩니다.
에이전트가 필요한 곳: 교사의 업무 흐름
교사 측면도 똑같이 중요하며, 사실 에이전트 패러다임이 적합한 곳은 바로 여기입니다.
교사들은 가르치는 일 자체가 아니라, 가르침을 둘러싼 업무에 파묻혀 있습니다. 일반적인 교사는 매일 LMS, SIS, 교육 과정 포털, 구글 문서, 이메일, 채점 도구 등 대여섯 개의 플랫폼을 다룹니다. 이러한 시스템을 탐색하고, 콘텐츠 형식을 변환하며, 학생들의 다양한 필요에 맞춰 자료를 수동으로 조정하는 데 드는 오버헤드는 엄청납니다. 데이터에 따르면 매주 AI를 사용하는 교사는 주당 평균 6시간 가까이 시간을 절약합니다. 한 학년으로 치면 6주 분량의 시간을 되찾는 셈입니다.
교사를 지치게 하는 업무들은 에이전트가 잘하는 일들입니다. 세 가지 읽기 수준에 맞춰 단원 차별화하기, 교육구 표준에 맞춰 평가 조정하기, 이번 주 목표에 대한 가정 통신문 작성하기, 수업 범위와 순서에 기반한 소그룹 활동 만들기 등이 그것입니다. 이는 제한적이고 반복 가능하며 검토 가능한 업무 흐름입니다. 개방형도 아니고 새로운 것도 아닙니다. 알려진 교육 과정을 바탕으로 일 년에 수백 번씩 수행되는 동일한 유형의 작업들입니다.
그리고 교사는 그 과정의 전문가입니다. 교사는 AI의 결과물이 학생에게 전달되기 전에 검토합니다. 오류를 잡아내고, 어조를 조정하며, 접근 방식을 수정합니다. 인간이 개입하는 모델이 여기서 효과적인 이유는 인간이 에이전트의 결과물을 평가할 수 있는 도메인 지식을 갖추고 있기 때문입니다.
이것이 바로 K-12 교육에 실제로 필요한 AI입니다. 학생이 다음에 무엇을 배워야 할지 제1원칙부터 추론하는 자율형 에이전트가 아니라, 교육구의 실제 교육 과정에 맞춰 안정적으로 실행되는 시스템, 즉 교육구의 범위와 순서, 채택된 교재, 표준 및 진도 가이드에 충실한 시스템입니다. 지능은 일반적인 추론에 있는 것이 아닙니다. 검색, 근거 제시, 그리고 이 교육구의 이 학년, 이 단원에서 이번 주에 실제로 가르치고 있는 내용에 대한 충실함에 있습니다.
AI 에이전트가 소프트웨어 엔지니어링을 변화시키고 있다고 해서 모든 것을 변화시킬 수 있는 것은 아닙니다. 코드의 논리와 학습의 논리는 다르기 때문입니다. 코드의 경우 AI가 작업을 수행하기를 바라지만, 학교에서는 학생이 직접 학습하는 것 자체가 교육의 핵심입니다. 학습을 자동화해야 할 지식 노동의 일환으로 취급하는 것은 큰 실수입니다. 이는 마치 진보가 이루어지고 있다는 착각을 주면서 한 세대의 학생들을 퇴보시킬 수 있습니다.
기술은 강력합니다. 문제는 우리가 이 기술을 '작업' 그 자체에 적용할 것인지, 아니면 그 작업을 통해 배워야 할 '사람'에게 적용할 것인지에 달려 있습니다.
K-12 교육 분야에서의 기회는 분명히 존재하며 매우 중요합니다. 하지만 그 핵심은 교사가 주도권을 갖게 하는 데 있습니다.. AI가 참조하는 커리큘럼, AI가 지향하는 학습 성과, 그리고 교사를 대신해 수행하는 워크플로우에 대한 통제권 말입니다. 학생들에게 범용 AI 에이전트를 쥐여주고 잘되기를 바라는 방식이 되어서는 안 됩니다.






.webp)