PROCPA.
목차생성형 AI, LLM, 모델

가이드 › 1장. AI 핵심 용어

생성형 AI, LLM, 모델

생성형 AI와 LLM이 무엇이고, AI가 글만 쓰면서도 엑셀 파일을 만드는 원리, 모델과 추론 수준을 고르는 기준을 정리합니다.

이 장에서 할 일

AI, 생성형 AI, LLM이 어떻게 다른지 구분하고, LLM이라는 이름에 담긴 AI의 특성과 한계를 이해합니다. 글만 쓰는 AI가 어떻게 엑셀 파일을 만드는지 살펴보고, 모델과 추론 수준을 고르는 기준을 잡습니다.

1. 용어부터 익숙해져야 하는 이유

저는 AI를 업무에 활용할 때 가장 먼저 할 일이 용어에 익숙해지는 것이라고 생각합니다. 많은 실무자가 AI 도구를 업무에 써 보고 싶어 하면서도 어려움을 느끼는 가장 큰 이유가 바로 '용어의 벽'이기 때문입니다. 기본적으로 AI 관련 도구의 용어들이 '개발자들의 언어'로 채워져 있어서, "컨텍스트 윈도우 100만 토큰", "MCP 커넥터 지원", "할루시네이션" 같은 낯선 기술 용어가 쏟아지다 보니 비개발자 입장에서는 도구를 써 보기도 전에 높은 진입장벽부터 느끼게 됩니다.

처음 세법을 공부할 때 '부당행위계산의 부인' 같은 말 앞에서 한참을 멈춰 있었는데, 생전 처음 듣는 말이라 뜻을 몇 번 읽어도 개념이 도무지 와닿지 않았습니다. 하지만 그 말을 여러 번 보고 입에 붙고 나니, 그제야 내용이 머리에 들어오기 시작했습니다.

AI도 마찬가지로 토큰, 컨텍스트, MCP 같은 말이 낯선 동안에는 설명이 겉돌지만, 말이 익숙해지면 뉴스와 도구 설명서가 읽히기 시작합니다. 저는 용어에 익숙해지는 것만으로 AI 활용 역량의 절반 가까이를 갖추게 된다고 봅니다. 여러 사람이 AI를 업무에 활용하는 과정을 옆에서 도와 보면, 도구가 손에 익지 않아서 못 쓰는 경우보다 용어가 익숙하지 않아서 못 쓰는 경우가 훨씬 많았기 때문입니다.

따라서 1부에서는 개발자의 언어가 아닌 비개발자 실무자의 눈높이에서, 실제 업무에 꼭 필요한 수준으로 엄선한 핵심 개념 아홉 가지를 세 단계로 나눠 익힙니다. 단순한 사전식 정의를 늘어놓기보다, 각 용어가 AI를 활용할 때 갖는 의미를 중심으로 다루겠습니다.

1부에서 익힐 핵심 개념 아홉 가지

순서는 챗봇을 처음 쓸 때 거치는 흐름을 그대로 따랐습니다.

  • 켜기 전(1~3): 이것이 무엇이고 무엇을 골라야 하는지
  • 대화할 때(4~6): 무엇을 쓰고 무엇을 알려 주며, 답이 어떤 형식으로 오는지
  • 쓰다 보면(7~9): 부딪히는 비용과 틀린 답, 그리고 그 해결책

1.1장에서 13을, 1.2장에서 46을, 1.3장에서 토큰과 할루시네이션을, 1.4장에서 스킬과 MCP를 차례로 다룹니다.

처음 듣는 말이 대부분이라면 한 번 읽고 다 이해되지 않는 것이 당연하고, 앞의 용어를 설명하다 보면 뒤의 용어가 먼저 튀어나오기도 합니다. 1부를 한 번 쭉 읽은 뒤 그림 위주로 다시 훑어보면 그때는 내용이 훨씬 잘 들어옵니다.

2. 생성형 AI

2.1. AI, 생성형 AI, LLM

요즘 어딜 가나 'AI'라는 말이 들리지만, 사실 우리 대부분이 AI라는 존재를 처음 접했던 순간은 2016년 이세돌 9단과 바둑 대결을 펼쳤던 구글의 알파고(AlphaGo) 소식을 들으면서였을 겁니다. 그 알파고도 AI이고, 요즘 매체에 쏟아지는 단어 중 '생성형 AI'나 'LLM'도 모두 AI의 한 갈래입니다. 그렇다면 이 단어들은 각각 어떤 차이가 있을까요?

우선 가장 넓은 개념인 AI(인공지능)는 사람처럼 판단하고 예측하도록 만든 컴퓨터 프로그램 전체를 가리킵니다. 우리가 매일 사용하는 메일함의 스팸 필터나 유튜브의 맞춤 동영상 추천 알고리즘 등이 모두 대표적인 AI에 속합니다. 이런 전통적인 AI는 주어진 데이터 속에서 규칙을 찾아 정해진 선택지 중 답을 고르거나 분류·예측합니다.

하지만 챗GPT(ChatGPT)의 등장과 함께 '생성형 AI'(Generative AI)라는 단어가 본격적으로 쓰이기 시작했습니다. 기존 AI가 주어진 보기 중에서 답을 골라냈다면, 생성형 AI는 학습한 방대한 데이터를 바탕으로 글이나 이미지, 음성, 영상처럼 세상에 없던 결과물을 새로 만들어 내는 AI입니다. 알파고가 가능한 바둑 수 중에서 다음 수를 단순히 '선택'하는 AI였다면 생성형 AI는 백지 위에 무언가를 직접 '창작'하는 AI인 셈이며, 요즘 우리가 그냥 'AI'라고 부르는 것은 대부분 이쪽입니다.

그리고 LLM(대규모 언어 모델)은 이 다양한 생성형 AI 중에서도 오직 '글(언어)'만 만들어 내는 도구입니다. 흔히 "AI는 글만 쓸 줄 안다"고 하는데, 엄밀하게 정의하자면 "LLM은 글만 쓸 줄 안다"가 훨씬 정확한 표현일 겁니다. 우리가 쓰는 챗GPT, 클로드(Claude), 제미나이(Gemini) 같은 챗봇 도구는 대부분 LLM을 기반으로 만들어졌고, 이 시리즈에서 쓰는 클로드 엑셀도 LLM입니다.

정리하자면 AI ⊃ 생성형 AI ⊃ LLM의 포함 관계가 성립합니다. 알파고는 AI이지만 새로운 결과물을 만들지 못하므로 생성형 AI는 아니고, 이미지를 만드는 AI인 미드저니, 나노바나나는 생성형 AI이지만 글을 쓰는 도구가 아니므로 LLM은 아닙니다.

AI ⊃ 생성형 AI ⊃ LLM

그림에서 가장 바깥 원이 판단하고 예측하는 AI 전체, 그 안이 새로 만드는 생성형 AI, 가장 안쪽이 글을 만드는 LLM입니다.

2.2. 무엇을 만드느냐로 나뉜다

생성형 AI는 '무엇을 만들어 내느냐'에 따라 종류가 나뉩니다.

생성형 AI는 무엇을 만드느냐로 나뉜다

  • 글(텍스트): 글을 이해하고 작성하는 LLM입니다. 오픈AI의 챗GPT, 앤트로픽의 클로드, 구글의 제미나이 등이 대표적입니다.
  • 이미지: 그림을 만드는 이미지 생성 AI입니다. 한때 크게 유행했던 '디즈니풍 이미지 만들기'에 쓰인 AI가 바로 여기에 해당하며, 미드저니(Midjourney), 오픈AI의 GPT-image, 구글의 나노바나나(Nanobanana), 스테이블 디퓨전 등이 대표적입니다.
  • 영상: 비디오를 만드는 동영상 생성 AI입니다. 최근 유튜브 쇼츠나 SNS에 쏟아져 나오는 화제의 'AI 숏폼 영상'들이 바로 오픈AI의 소라(Sora), 구글의 Veo, Runway, Kling 같은 동영상 생성 AI를 활용한 결과물입니다.

요즘 이미지 모델 중에는 LLM 계열 모델을 바탕으로 만든 것도 있어 경계가 조금씩 흐려지고 있지만, 무엇을 만드느냐(글·그림·영상)로 구분하면 됩니다.

이 중 우리 실무에 직결되는 것은 결국 LLM입니다. 회계·재무 실무자가 다루는 기준서와 법령 같은 전문 지식은 물론, 이를 바탕으로 만들어야 하는 결산 자료, 검토 의견서, 재무제표 등은 모두 글과 숫자로 이루어져 있습니다. 게다가 4절에서 살펴보겠지만, AI가 엑셀 파일을 만들고 편집하는 것조차 실은 파이썬 코드라는 '글'을 작성해 컴퓨터로 실행하는 과정입니다. 그렇기 때문에 앞으로 이 시리즈에서 편의상 'AI'라고 부르는 것도 모두 LLM을 가리킵니다.

3. LLM이라는 이름

LLM(Large Language Model)은 우리말로 대규모 언어 모델입니다. 이 이름을 세 단어로 나눠 읽으면 AI의 특성과 한계가 고스란히 드러납니다.

LLM이라는 이름에 담긴 세 가지 뜻

그림은 한 줄씩 왼쪽에서 오른쪽으로 읽으며, 각 줄에는 이름과 그 뜻, 그리고 그 때문에 실무에서 무엇이 달라지는지를 적었습니다.

3.1. Large(대규모): 방대한 데이터를 사전학습

'Large'는 모델이 사전에 학습한 데이터가 방대하다는 뜻입니다. LLM은 뉴스나 웹 문서는 물론 도서, 학술 논문, 오픈소스 코드, 공개 법령 등 인터넷에 공개된 사실상 모든 텍스트를 미리 학습했으며, 이 과정을 '사전학습'이라고 합니다.

여기서 우리가 기억해야 할 특성은 학습이 끝난 시점 이후의 정보나 공개되지 않은 데이터는 전혀 알지 못한다는 점입니다. 예를 들어 AI는 올해 개정된 세법이나 회계기준은 학습하지 못했고, 인터넷에 올라와 있지 않은 우리 회사의 계정과목표나 결산 양식도 알지 못합니다.

물론 요즘 AI는 사람처럼 자신이 기존에 알지 못하는 내용이 있으면 웹 검색을 통해 스스로 찾아보기도 합니다. 하지만 인터넷에 우리 실무에 필요한 모든 정보가 다 올라와 있는 것도 아니며, 웹상에는 부정확하거나 검증되지 않은 정보도 많습니다.

따라서 AI가 알지 못하거나 검색할 수 없는 정보를 우리가 직접 정확하게 알려 주는 작업이 필수적입니다. 이처럼 AI에게 건네주는 정보를 '컨텍스트(Context)'라고 부르며, 이는 AI 실무 활용의 성패를 가르는 핵심 개념으로 1.2장에서 자세히 다룹니다.

3.2. Language(언어): AI는 글만 읽고 쓸 줄 안다

'Language'는 글(텍스트)을 읽고 쓰는 도구라는 뜻으로, 입력도 글이고 출력도 글입니다. 앞에서 말한 "AI는 글만 쓸 줄 안다"는 명제가 바로 이 단어에서 나옵니다.

실무에서 기억해야 할 사실은 AI는 컴퓨터를 직접 조작하지 못한다는 점입니다. AI는 스스로 마우스를 쥐고 엑셀 창을 띄워 셀을 클릭하거나 서식을 바꿀 능력이 없습니다. 우리가 내려받는 깔끔한 엑셀 파일은 LLM이 컴퓨터가 이해할 수 있는 '파이썬 코드라는 글'을 작성하고, 컴퓨터의 실행 엔진이 그 코드를 대신 실행해 만들어 준 결과물이며, 이 과정은 4절에서 자세히 살펴보겠습니다.

최근 화면을 보고 마우스를 대신 클릭해 주는 '컴퓨터 유즈(Computer Use)' 같은 기술이 주목받고 있지만, 이 역시 AI가 직접 마우스를 잡지는 않습니다. 화면을 보고 컴퓨터에게 "어느 좌표를 클릭하라"는 명령어를 텍스트(JSON) 형태로 건네면, 운영체제의 자동화 프로그램이 대신 마우스를 움직여 주는 구조입니다. 결국 AI가 하는 일은 처음부터 끝까지 '글을 쓰는 것'뿐입니다.

3.3. Model(모델): 같은 말을 해도 매번 결과가 다르다

마지막 'Model'은 수학적인 확률 모델을 뜻하며, 같은 요청에도 결과가 매번 조금씩 달라지는 AI의 '불확정성'의 근본 원인입니다.

LLM은 문장의 뜻을 사람처럼 온전히 이해하고 한 번에 답을 완성하지 않습니다. 앞선 문맥을 보고 "다음에 올 가장 그럴듯한 단어"를 확률표에서 하나씩 골라 이어 붙입니다. 예를 들어 AI가 "대손충당금을 ___"까지 읽었다면, 내부에서는 '설정'(62%), '계상'(25%), '환입'(9%) 같은 확률표를 펼쳐 놓고 그중 하나를 골라 다음 단어로 이어 붙입니다. 이 확률적 단어 뽑기를 수천 번 되풀이한 결과가 우리가 받는 답변입니다.

AI가 반복 작업에서 흔들리는 이유가 바로 여기에 있습니다. 항상 1등 단어만 고르지는 않기 때문에, 프롬프트를 아무리 정교하게 써도 같은 프롬프트를 넣으면 매번 답이 조금씩 달라집니다. 나아가 모르는 질문을 받아도 어떻게든 다음에 올 그럴듯한 단어를 확률로 이어 붙이다 보니, 자신만만하게 거짓말을 하는 '할루시네이션(Hallucination)'이 필연적으로 생겨납니다.

이런 차이와 오답은 결함으로 볼 일이 아니며, LLM이 동작하는 방식 그 자체에서 나옵니다. 할루시네이션은 1.3장에서 다루고, 결과가 달라지는 성질을 실무에서 어떻게 다룰지, 곧 '반복은 결정론으로, 판단은 AI에게'라는 원칙은 7.1장에서 정리합니다.

결국 LLM이란 "사전에 학습한 방대한(Large) 데이터로, 확률상 가장 그럴듯한 글(Language)을 쓰는 언어 모델(Model)"이며, 그림 맨 아래 줄이 이 문장입니다. 챗GPT의 GPT도 같은 원리를 담고 있습니다. GPT는 Generative(생성하는), Pre-trained(사전학습된), Transformer(모델 구조 이름)의 머리글자로, 결국 미리 학습한 데이터를 바탕으로 글을 생성한다는 뜻입니다. 이 세 가지 본질만 기억해도, 실무에서 AI가 왜 실수를 저지르고 이를 어떻게 통제해야 하는지 명확한 기준을 잡을 수 있습니다.

4. AI는 어떻게 엑셀 파일을 만드나

앞에서 LLM은 글만 쓴다고 했지만, 클로드에게 "이 표를 엑셀로 만들어 줘"라고 요청하면 몇 초 뒤 깔끔한 xlsx 파일이 만들어집니다. 얼핏 보면 AI가 직접 엑셀 프로그램을 띄워 셀에 값을 하나씩 채워 넣은 것처럼 보이지만, 실제로는 다음 세 단계를 거쳐 파일이 만들어집니다.

  1. AI가 코드를 씁니다. "새 시트를 만들고, B2에 1월, C2에 이 수식을 넣어라"라는 지시를 파이썬 같은 프로그래밍 언어로 옮겨 적습니다. 한국어로 답변을 작성하듯 코드도 텍스트로 써 내려가므로, 코드도 결국 글이고 LLM이 쓸 수 있습니다.
  2. 컴퓨터가 그 코드를 실행합니다. 클로드 앱 같은 웹 챗봇 서비스라면 서버 뒤편의 격리된 실행 환경이 코드를 한 줄씩 그대로 실행하고, 내 PC에서 돌아가는 에이전트 도구라면 내 PC에서 직접 실행합니다.
  3. 실행된 코드가 파일을 만듭니다. openpyxl 같은 파이썬 라이브러리가 실제로 셀에 값을 넣고 서식을 입혀 xlsx 파일로 저장합니다. 우리가 내려받는 파일은 이 결과물입니다.

AI는 코드를 쓰고, 실행은 컴퓨터가 한다

그림을 왼쪽부터 보면, 우리가 "월별 집계표 만들어 줘"라고 할 때 AI는 make_sheet.py라는 코드에 '월별집계 시트를 만들고, B2에 1월, C2에 SUMIFS 수식을 넣어라'를 적습니다. 컴퓨터는 이 코드를 한 줄씩 그대로 실행하고, 그 결과로 오른쪽의 월별집계 시트가 생깁니다. 그림 아래의 두 칸은 역할 분담을 나타내며, AI가 하는 일은 글(코드)을 쓰는 데까지이고 실행은 컴퓨터가 맡습니다.

즉, 실제로 파일을 만드는 주체는 코드이며, AI는 그 코드를 글로 씁니다. PPT나 워드 문서, 차트가 만들어지는 원리도 같습니다.

여기서 기억해 둘 점은 AI가 쓰는 코드 역시 글이라는 사실입니다. 글이기 때문에 매번 확률로 생성되고, 요청할 때마다 조금씩 다른 코드가 만들어집니다. 엑셀을 만드는 코드가 요청할 때마다 새로 쓰이니 결과도 매번 조금씩 달라질 수밖에 없습니다.

요리에 비유하면 AI는 레시피를 적는 요리사, 코드는 레시피, 컴퓨터는 레시피대로 요리하는 주방입니다. 요리사는 레시피를 새로 쓸 줄 알지만 매번 조금씩 다르게 쓰고, 주방은 받은 레시피를 오차 없이 따르지만 스스로 바꾸지는 못합니다. 둘이 잘하는 일이 다르다는 점은 7.1장에서 다시 다룹니다.

이는 실제 화면에서도 쉽게 확인할 수 있습니다. 클로드에게 엑셀 파일을 요청한 뒤 진행 메시지를 펼쳐 보면 AI가 실시간으로 작성한 파이썬 코드가 그대로 나타나며, 그 안에는 헤더 색상을 지정하고 테두리를 긋는 명령어가 들어 있습니다. 클로드 엑셀도 같은 방식으로 일하며, 그 모습은 4.4장에서 살펴보겠습니다.

덧붙여 AI가 글을 읽고 쓸 때는 사용량(토큰)이 들지만, 작성된 코드를 컴퓨터가 실행하는 동안에는 코드가 1초를 돌든 10분을 돌든 토큰이 들지 않습니다. 그 작업은 AI 모델이 관여하지 않고 컴퓨터가 처리하는 영역이기 때문이며, 토큰은 1.3장에서 자세히 다룹니다.

이렇게 코드를 쓰는 AI, 곧 채팅창 너머에서 우리 말을 받는 쪽이 다음 절에서 다룰 모델입니다. 같은 클로드 앱이라도 어떤 두뇌가 답하느냐에 따라 결과가 달라집니다.

5. 모델

5.1. 모델, AI의 두뇌

많은 분이 챗GPT나 클로드, 제미나이를 AI 그 자체로 생각하지만, 사실 이들은 사용자와 대화하는 인터페이스이자 서비스 껍데기, 즉 '앱'에 불과합니다. 그 앱 안에서 실제로 질문을 읽고, 판단하고, 답을 써 내려가는 두뇌에 해당하는 것이 바로 모델(Model)입니다.

클로드 앱의 입력창 근처에는 Opus, Sonnet 같은 이름을 고르는 목록이 있는데, 처음에는 무엇인지 몰라 기본값 그대로 두기 쉬운 이 목록이 바로 모델입니다. 모델은 만든 회사와 세대가 다르고, 한 회사 안에서도 등급이 나뉩니다.

앱은 그릇, 모델은 그 안에서 생각하는 두뇌

그림 왼쪽은 claude.ai라는 앱(그릇) 안에서 고를 수 있는 모델 목록이고, 오른쪽은 등급마다 어울리는 일입니다(2026년 9월 기준, 모델 이름은 수시로 바뀝니다).

  • Fable 5.1(최상위): 가장 어렵고 무거운 판단에 씁니다.
  • Opus 5.5·Opus 5(상위): 정밀 검토와 복잡한 판단에 어울리며, 느리고 비싸지만 똑똑합니다. Opus 5.5는 Opus 5의 후속 모델입니다.
  • Sonnet 5(표준): 일상 실무 대부분은 여기서 합니다.
  • Haiku 4.5(경량): 대량의 단순 작업을 빠르고 싸게 처리합니다.

서비스마다 여러 모델을 제공하는데, 선택 기준은 단순합니다. 상위 모델일수록 복잡한 논리를 이해하고 정밀한 판단을 내리는 능력은 뛰어나지만, 응답 속도가 느리고 비용이 많이 듭니다. 반대로 하위(경량) 모델일수록 지능은 상대적으로 낮지만 처리 속도가 빠르고 비용이 저렴합니다. 예를 들어 리스 계약서 몇 건을 읽고 기준서상 리스에 해당하는지 따지는 일은 상위 모델에 맡기고, 수백 줄의 적요에서 거래처명만 뽑아 정리하는 일은 경량 모델로도 충분할 뿐 아니라 오히려 더 빠릅니다.

상위 모델이 항상 좋은 것은 아닙니다. 결산 시즌처럼 짧은 질문과 답변을 수십 번씩 주고받거나 대량의 전표 적요를 정리할 때는 빠른 응답 속도가 곧 생산성이기 때문입니다. 게다가 상위 모델일수록 같은 구독 한도 안에서 쓸 수 있는 양이 줄어듭니다. 제 경험으로는 우리 실무의 대부분은 최상위 모델까지 필요하지 않고 표준 모델로 충분하며, 특히 최상위 모델은 깊게 생각하느라 답이 늦지만 표준 모델은 곧바로 답하므로 일의 흐름이 끊기지 않는다는 점도 큽니다.

따라서 일상적인 정리나 요약은 가벼운 모델로 빠르게 처리하고, 복잡한 회계 기준서 해석이나 검토 의견서 작성처럼 정밀한 판단이 필요할 때만 상위 모델을 꺼내 드는 것이 실무적인 요령입니다. 클로드 엑셀 뒤에도 같은 모델들이 있어서, 그 안에서도 응답 속도와 작업 분량을 함께 보고 모델을 골라 쓸 수 있습니다.

5.2. 추론(노력) 수준

두뇌(모델)를 골랐다면, 또 하나 조절할 수 있는 옵션이 바로 추론(노력) 수준(Reasoning Level)입니다. 추론 수준은 AI가 답하기 전에 얼마나 생각하게 할지를 고르는 설정으로, 서비스에 따라 '생각 모드', '추론 강도' 같은 이름이나 슬라이더 형태로 제공됩니다. 이 수준을 높여 두면 답이 나오기 전에 '생각 중…'이라는 표시가 한참 떠 있는데, AI가 답하기 전에 스스로 따져 보는 과정을 거치기 때문입니다.

추론 수준은 얼마나 생각할지를 고르는 것

추론 수준의 선택 원리는 모델 선택과 완전히 같습니다. 생각을 깊게 시킬수록(추론 수준을 높일수록) 복잡한 판단의 정답률은 확연히 올라가지만, 그만큼 응답 시간이 길어지고 비용(토큰)이 더 듭니다. 그림 위쪽 막대의 왼쪽 끝은 바로 답하는 쪽으로 빠르고 싸며, 오른쪽 끝은 따져 보고 답하는 쪽으로 느리고 비싸지만 정확합니다.

따라서 그림 아래 두 칸처럼 요약, 분류, 서식 정리, 단순 변환처럼 답이 뻔한 일은 추론 수준을 '낮게' 두고 빠르게 처리하고, 회계 판단, 검토 의견, 복잡한 재무모델 수식 설계처럼 여러 변수를 따져 봐야 하는 일은 '높게' 설정해 신중한 답을 얻는 것이 합리적입니다.

실제로 같은 모델도 생각을 더 시키면 시험 점수가 오르는데, 다음 5.3절의 종합 벤치마크에서 숫자로 확인할 수 있습니다. 생각에도 비용이 드는 이유는 1.3장의 토큰에서 다루고, 클로드 엑셀 채팅창에서 이 수준을 고르는 자리는 4.4장에서 살펴보겠습니다.

5.3. 글로벌 3대장

현시점 기준 수많은 AI 모델이 있지만, 가장 주류로 평가받는 모델을 만드는 곳은 앤트로픽, 오픈AI, 구글 세 곳입니다(2026년 9월 기준, 수시로 바뀜).

회사서비스대표 모델강점
앤트로픽(Anthropic)클로드Fable 5.1, Opus 5.5, Opus 5, Sonnet 5, Haiku 4.5코딩, 엑셀 실무, 회계·재무 분야
오픈AI(OpenAI)챗GPTGPT-6(Astra·Sol·Luna), GPT-5.6가장 넓은 사용자, 범용성
구글(Google)제미나이Pro, Flash(최신 3.8 Flash)긴 문서, 속도, 구글 서비스 연동

이 밖에 xAI의 그록, 딥시크, 메타의 라마 등이 있는데, 이름만 알아 두면 충분합니다.

모델의 실력은 벤치마크로 비교합니다. 벤치마크(Benchmark)는 정해진 문제 세트로 채점한 표준 시험 점수로, 독립 평가 기관 Artificial Analysis는 수학, 과학, 코딩, 실무 과제 등 10개 평가를 합친 종합 지능 지수를 발표합니다(Artificial Analysis Intelligence Index v4.3.2, 2026.9.28 조회). 최근 공개된 Claude Opus 5.5가 58점으로 단독 1위이고, Claude Fable 5.1과 GPT-6 Astra가 53점으로 뒤를 잇습니다.

모델회사 · 추론 수준점수
Claude Opus 5.5앤트로픽 · 최대58
Claude Fable 5.1앤트로픽 · 최대53
GPT-6 Astra오픈AI · 최대53
GPT-6 Sol오픈AI · 최대48
Gemini 3.8 Flash구글 · 높음41
Claude Sonnet 5앤트로픽 · 최대38
GPT-6 Luna오픈AI · 최대37

구글은 최상위 Pro 모델의 출시가 늦어지고 있어 Flash가 대표로 올라와 있습니다. 같은 모델도 추론 수준에 따라 점수가 달라지는데, Claude Opus 5.5는 max 58, xhigh 56, high 54이고 GPT-6 Astra는 max 53, xhigh 52, high 51입니다. 5.2절에서 설명한 '생각을 더 시키면 답이 좋아진다'는 점이 숫자로 드러나는 대목입니다.

하지만 우리에게 더 중요한 것은 수학, 과학, 코딩 등을 아우르는 일반 종합 점수보다 "과연 우리가 매일 하는 회계·재무 실무에서 얼마나 일을 잘하는가?"입니다. 이 기준으로 보면 순위가 또 달라집니다.

5.4. (참고) 회계·재무 벤치마크

독립 AI 평가 기관 Vals AI는 실제 현업 과제를 부여해 모델의 실무 능력을 채점합니다. 회계·재무와 가장 밀접한 두 시험의 최신 결과는 다음과 같습니다(Vals AI, Excel Modeling 2026.9.22 · Tax Agent Bench 2026.9.23 갱신, 정답률 %).

엑셀 재무모델링점수세무 리서치점수
Claude Fable 5.176.7Claude Fable 5.177.6
Claude Opus 5.575.9Claude Opus 575.1
Claude Fable 573.7Claude Opus 5.570.5
Claude Opus 573.6GPT-5.6 Sol68.0
GPT-5.6 Sol72.3Gemini 3.8 Flash66.8
Gemini 3.8 Flash72.2GPT-6 Astra63.3
GPT-6 Astra71.7Claude Sonnet 562.3
Claude Sonnet 566.3

엑셀 재무모델링(Excel Modeling)은 실적 추정, 3대 재무제표 연동, 가치평가 모델을 엑셀로 완성하는 시험으로 투자은행·사모펀드의 주니어 수준 과제이고, 세무 리서치(Tax Agent Bench)는 미국 법인세, 파트너십, 이전가격 등 복잡한 세무 질문에 법령을 찾아 적용하는 시험입니다.

벤치마크 순위는 새로운 모델이 등장할 때마다 수시로 바뀌지만, 이 결과가 실무적으로 시사하는 핵심은 두 가지입니다.

첫째, 회계·재무 영역에서는 앤트로픽의 클로드가 벤치마크와 실무 체감 모두에서 가장 높은 평가를 받고 있습니다. 엑셀 재무모델링(Claude Fable 5.1 76.7%, Opus 5.5 75.9%)과 세무 리서치(Claude Fable 5.1 77.6%, Opus 5 75.1%) 모두 클로드 모델군이 최상위권을 차지했습니다. 이는 앤트로픽이 회계·재무 시장에 가장 많은 관심을 갖고 투자해 온 결과로 보이며, 실제로 많은 현업 실무자들의 체감 역시 일관되는 편이고, 이 시리즈가 클로드를 쓰는 이유도 여기에 있습니다. 두 표를 나란히 보면 분야마다 순위가 다르다는 점도 보이는데, 예를 들어 GPT-6 Astra는 앞의 종합 점수에서 공동 1위지만 세무 리서치에서는 63.3%로 중위권입니다.

둘째, 최고 성능 모델도 뚜렷한 한계를 갖고 있으며, 반드시 검증이 필요합니다. 1위를 차지한 최고 모델조차 정답률은 70%대 중후반에 머물러, 평가 항목의 20~30%는 여전히 놓친다는 뜻입니다. 특히 엑셀 재무모델링에서는 1위 모델도 수식 점검은 89%, 서식 점검은 81%를 통과하는 반면 숫자가 맞는지는 64%만 통과해, 숫자 정확도가 병목입니다. 따라서 아무리 뛰어난 최신 AI 모델이 만든 결과물이라 할지라도 AI가 작성한 분석이나 수식에는 반드시 사람의 비판적인 검토와 검증이 수반되어야 합니다. 업무의 최종 완성도와 책임은 오롯이 검증하는 사람의 몫이기 때문이며, 이 시리즈가 7.1장에서 '숫자는 수식과 코드로 고정하고 사람이 검증한다'는 결론을 내리는 이유도 여기에 있습니다.

5.5. (참고) 국내 모델과 소버린 AI

해외 3사 외에 국내 모델도 있으며, 이런 흐름을 흔히 소버린 AI(Sovereign AI)라고 부릅니다. 소버린 AI는 한 나라의 데이터와 법률, 문화의 주권을 지키는 독자적인 AI를 뜻하며, 쉽게 말해 우리 데이터를 우리 땅 안에서 처리하자는 취지입니다.

회사모델특징
LG AI연구원엑사원(EXAONE)한국어·영어 이중 언어, 오픈소스, 사내 설치에 강점
네이버하이퍼클로바X(HyperCLOVA X)국내 법령·행정 데이터 학습, 국내 제도·세무 문맥
업스테이지솔라(Solar)작고 빠른 경량 모델, 영수증·계약서 문서 인식

한국 특화 모델이 따로 주목받는 이유는 두 가지입니다. 첫째, 우리 고유의 세법, 회계 관행, 행정 서식 같은 국내 맥락은 해외 빅테크 모델이 충분히 이해하기 어렵습니다. 둘째, 망분리 같은 보안 규제 때문에 해외 서버로 보낼 수 없는 민감한 재무 자료와 내부 원장이 있는데, 국내 모델은 이런 자료를 사내 서버 안에서 처리할 길을 열어 줍니다.

정리

  • AI 안에 생성형 AI가, 그 안에 글을 만드는 LLM이 있습니다. 알파고가 고르는 AI라면 생성형 AI는 만드는 AI입니다.
  • LLM은 사전학습한 방대한 데이터(Large)로 글(Language)을 쓰는 확률 모델(Model)이라, 최신·사내 정보를 모르고 같은 요청에도 답이 매번 조금씩 다릅니다.
  • AI는 엑셀에 직접 손대지 않고 코드를 글로 쓰며, 실행은 컴퓨터가 합니다. 그 코드도 요청할 때마다 새로 쓰이므로 결과가 조금씩 달라집니다.
  • 모델은 앱 뒤의 두뇌이고, 일의 무게에 맞춰 모델 등급과 추론 수준을 고릅니다. 일상 실무는 대부분 표준 모델로 충분합니다.
  • 회계·재무 벤치마크에서는 클로드가 앞서지만, 최고 모델도 숫자 정확도에 한계가 있어 사람의 검증이 반드시 필요합니다.

결국 AI는 스스로 정답을 내 주는 도구라기보다 사람이 올바른 정보를 쥐여 주고 결과를 검증해야 하는 도구입니다. 다음 1.2장에서는 이 도구에게 어떻게 말을 걸고 모르는 것은 어떻게 알려 주는지, 채팅창 위에서 쓰는 세 가지 말인 프롬프트와 컨텍스트, 마크다운을 살펴보겠습니다.

이 가이드 그대로 팀·조직 교육이 필요하신가요? 실무자 눈높이의 강의·워크숍으로 진행합니다.

강의·워크숍 문의