|
초기 |
|
|---|---|
|
GPT-4 계열 |
GPT-4 · GPT-4 Turbo · GPT-4o · GPT-4.1 |
|
GPT-5 계열 |
|
|
GPT-6 계열 |
GPT-6 · GPT-6 Astra · GPT-6 Sol · GPT-6 Luna |
GPT(Generative Pre-trained Transformer)는 OpenAI가 개발한 트랜스포머 기반의 생성형 대규모 언어 모델 계열이다.
이름 그대로
Generative - 생성형 Pre-trained - 사전학습된 Transformer - 트랜스포머
의 약자다.
대량의 텍스트에서 다음에 등장할 토큰을 예측하는 방식으로 먼저 학습한 뒤 다양한 방법으로 추가 학습·조정해 문장 생성, 질문 답변, 번역, 요약, 코딩 등의 작업을 수행한다.
2018년 OpenAI가 논문 《Improving Language Understanding by Generative Pre-Training》에서 첫 모델을 공개하면서 시작됐다.[1] 이후 GPT-2, GPT-3, GPT-3.5, GPT-4, GPT-5 등으로 발전했다.
2022년 공개된 ChatGPT 역시 처음에는 GPT-3.5 계열 모델을 대화형으로 추가 학습해 만든 서비스였다.[2]
다만 GPT와 ChatGPT는 같은 뜻이 아니다.
GPT는 모델 또는 모델 계열이고 ChatGPT는 그러한 AI 모델을 사용해 사람과 대화하고 각종 도구를 사용할 수 있게 만든 OpenAI의 서비스다.
개요
| 항목 | 내용 |
|---|---|
| 명칭 | GPT |
| 풀네임 | Generative Pre-trained Transformer |
| 개발 | OpenAI |
| 최초 공개 | 2018년 |
| 종류 | 대규모 언어 모델, 생성형 AI |
| 기반 구조 | 트랜스포머 |
| 기본 구조 | Decoder-only Transformer |
| 기본 학습방식 | 자기회귀적 다음 토큰 예측 |
| 주요 세대 | GPT, GPT-2, GPT-3, GPT-3.5, GPT-4, GPT-5 |
| 대표 서비스 | ChatGPT, OpenAI API |
GPT 계열은 현대 생성형 인공지능 붐을 일으킨 대표적인 모델 계열 가운데 하나다.
특히 GPT-3와 ChatGPT 이후에는 일반인에게도 GPT라는 이름 자체가 AI 챗봇과 비슷한 의미로 사용될 정도로 알려졌다.
하지만 기술적으로는 모든 AI 챗봇이 GPT인 것은 아니다.
Google의 Gemini, Anthropic의 Claude, Meta의 Llama 등도 대규모 언어 모델이지만 OpenAI의 GPT 모델은 아니다.
이름
Generative
생성형이라는 뜻.
GPT는 문장을 단순히 분류하거나 검색하는 데 그치지 않고 새로운 텍스트를 만들어낼 수 있다.
예를 들어
대한민국의 수도는
이라는 입력이 들어오면 학습한 확률분포를 바탕으로 다음 토큰으로
서울
이 등장할 가능성이 높다고 판단하는 식이다.
그리고 다시 지금까지 생성된 모든 토큰을 입력으로 사용해 그 다음 토큰을 예측한다.
이를 반복하면 문장이 만들어진다.
쉽게 말하면
다음 글자를 존나 잘 맞히는 일을 엄청난 규모로 반복했더니 글도 쓰고 코딩도 하고 문제도 풀기 시작했다.
물론 실제로는 글자 하나가 아니라 토큰 단위이며 현대 GPT의 동작은 이 한 문장만으로 설명하기에는 훨씬 복잡하다.
Pre-trained
사전학습.
GPT가 등장하기 전 자연어처리에서는 특정 문제를 해결하기 위해 그 문제에 맞는 데이터와 모델을 별도로 만드는 방식이 일반적이었다.
번역 모델 따로, 감정분석 모델 따로, 질문답변 모델 따로 만드는 식이었다.
GPT의 핵심 아이디어는 먼저 방대한 텍스트를 이용해
언어 자체를 다루는 능력
을 학습한 뒤 필요한 작업에 맞춰 추가 학습하거나 지시를 제공하는 방식이다.[3]
2018년 최초 GPT에서는
비지도 사전학습 → 지도 파인튜닝
구조를 사용했다.
후대에는 프롬프트, few-shot learning, instruction tuning, RLHF 등 다양한 방법이 추가됐다.
Transformer
GPT의 T.
트랜스포머는 2017년 Google 연구진이 논문
《Attention Is All You Need》
에서 발표한 신경망 구조다.[4]
기존 자연어처리에서 널리 사용하던 RNN이나 LSTM과 달리 Attention 메커니즘을 중심으로 문장 내 토큰들의 관계를 계산한다.
원래 논문에서는 인코더와 디코더를 모두 가진 번역 모델로 제안됐지만 GPT는 여기서 주로 디코더 부분에 해당하는 구조를 사용한다.
이를 흔히
Decoder-only Transformer
라고 한다.
후대의 수많은 대규모 언어 모델도 이 구조 또는 이를 변형한 구조를 사용한다.
작동 방식
토큰
GPT가 텍스트를 그대로 한 글자씩 읽는 것은 아니다.
입력된 문장을 작은 단위인 토큰으로 분해한다.
예를 들어 문장 하나가
나는 오늘 학교에 갔다.
라고 해도 내부적으로 반드시
나는 / 오늘 / 학교에 / 갔다
처럼 단어 단위로만 나뉘는 것은 아니다.
자주 사용되는 문자열은 하나의 토큰이 될 수 있고 드문 단어는 여러 토큰으로 쪼개질 수 있다.
모델은 이 토큰을 숫자로 변환해 처리한다.
다음 토큰 예측
GPT 사전학습의 기본 목적은
지금까지의 토큰이 주어졌을 때 다음 토큰이 무엇일지 예측
하는 것이다.
예를 들어
대한민국의 수도는
까지 입력받으면
- 서울
- 부산
- 대한민국
- 수도
등 가능한 다음 토큰에 각각 확률을 부여한다.
학습과정에서는 실제 정답과 모델의 예측을 비교해 수많은 매개변수를 조금씩 수정한다.
이걸 인터넷과 책, 문서, 코드 등 엄청난 양의 데이터에서 반복한다.
자기회귀
GPT는 앞에서 생성한 결과를 다시 입력으로 사용한다.
오늘 날씨가 → 오늘 날씨가 매우 → 오늘 날씨가 매우 좋다
처럼 한 토큰씩 이어나간다.
이를 자기회귀적 생성이라고 한다.
Attention
Attention은 입력 안에서 어떤 부분이 현재 토큰을 처리하는 데 중요한지 계산하는 구조다.
예를 들어
철수는 영희에게 책을 줬다. 그녀는 책을 읽었다.
같은 문장에서 `그녀`가 누구를 의미하는지를 판단할 때 앞부분의 여러 토큰 사이의 관계를 참고할 수 있다.
GPT가 앞의 문맥을 고려해 다음 내용을 생성할 수 있는 핵심 기술 가운데 하나다.
사전학습과 후처리
GPT 모델은 대량의 텍스트로 사전학습했다고 곧바로 ChatGPT처럼 행동하는 것이 아니다.
Base model
사전학습만 끝난 기본 언어 모델.
이 모델의 근본적인 목표는
사용자의 부탁을 들어준다
가 아니라
다음 토큰을 예측한다
이다.
그래서 사용자가
달 착륙을 여섯 살 아이에게 설명해줘
라고 입력했다고 해서 반드시 친절한 설명을 시작한다는 보장이 없다.
문장 자체를 이어서 또 다른 질문을 생성할 수도 있다.
Instruction tuning
사용자의 명령을 실제로 따르도록 추가 학습하는 과정.
OpenAI는 GPT-3을 기반으로 인간이 작성한 예시와 인간 선호도 데이터를 활용한 InstructGPT를 개발했다.[5]
RLHF
Reinforcement Learning from Human Feedback, 즉 인간 피드백을 통한 강화학습.
여러 모델 답변을 사람이 비교해
이 답변이 더 좋다
고 평가한 데이터를 이용해 인간이 원하는 방향의 응답을 생성하도록 모델을 조정한다.
InstructGPT와 초기 ChatGPT에서 핵심적인 역할을 했다.
OpenAI는 초기 ChatGPT 역시 지도 파인튜닝과 RLHF를 이용해 GPT-3.5 계열 모델을 대화형으로 조정했다고 밝혔다.[6]
역사
트랜스포머 등장
2017년 Google 연구진이 《Attention Is All You Need》를 발표했다.
오늘날 GPT뿐 아니라 수많은 대규모 언어 모델의 기반이 된 Transformer 구조가 여기서 등장했다.
OpenAI는 이 구조와 대규모 비지도 사전학습 방식을 결합했다.
GPT
후대와 구분하기 위해 흔히 GPT-1이라고 부른다.
다만 최초 공개 당시 공식 논문에서는 `GPT-1`이라는 이름보다 그냥 GPT 또는 generative pre-training model이라는 표현을 사용했다.
2018년 6월 공개됐다.[7]
모델 규모는 약 1억 1,700만 개(117M) 매개변수였다.
현재 기준으로 보면 존나 작아 보이지만 당시에는 대규모 모델이었다.
12개의 Transformer 레이어를 사용했으며 BookCorpus를 이용해 먼저 언어 모델을 사전학습했다.
이후
- 자연어 추론
- 질문답변
- 문장 유사도
- 문서분류
등 각 작업에 맞춰 파인튜닝했다.[8]
핵심은 모델 하나를 처음부터 각 문제별로 새로 만들지 않고
대량의 텍스트로 먼저 공부시켜 놓고 나중에 필요한 문제를 가르친다
는 방식이 실제로 잘 작동한다는 것을 보여준 것이다.
GPT-2
2019년 2월 14일 공개.[9]
최대 모델은 15억 개(1.5B) 매개변수.
GPT보다 매개변수가 10배 이상 많아졌다.
약 800만 개 웹페이지, 40GB 규모의 WebText 데이터셋으로 학습했다.
GPT-2에서 특히 주목받은 것은 별도의 작업별 학습을 하지 않아도
- 질문답변
- 요약
- 번역
- 독해
등 여러 작업을 어느 정도 수행한다는 점이었다.
이를 zero-shot 능력이라고 표현했다.
즉
번역용 모델이 아닌데 번역을 시켰더니 어쨌든 한다.
라는 현상이 본격적으로 나타나기 시작했다.
공개를 안 했다
GPT-2가 유명해진 이유 가운데 하나.
OpenAI는 2019년 처음 GPT-2를 발표하면서 가장 큰 15억 매개변수 모델을 바로 공개하지 않았다.
자동 가짜뉴스, 스팸, 피싱 등 악용 가능성을 우려했기 때문이다.[10]
처음에는 작은 1억 2,400만 매개변수 버전만 공개했고 이후
- 355M
- 774M
- 1.5B
순서로 단계적으로 공개했다.
2019년 11월 5일 결국 1.5B 전체 모델과 가중치까지 공개했다.[11]
이른바 staged release 방식의 대표 사례가 됐다.
GPT-3
2020년 발표.
논문 《Language Models are Few-Shot Learners》가 2020년 5월 공개됐다.[12]
최대 모델의 매개변수는
1,750억 개(175B)
였다.
GPT-2의 15억 개에서 또 100배 넘게 커졌다.
Few-shot learning
GPT-3의 가장 중요한 특징.
모델 자체를 다시 학습하지 않고 프롬프트 안에 몇 개의 예시만 제공해도 새로운 작업을 수행하는 능력이 크게 향상됐다.
예를 들어
영어: hello 한국어: 안녕하세요
영어: apple 한국어: 사과
영어: computer 한국어:
라고 입력하면 별도 번역학습 없이도
컴퓨터
라고 이어갈 수 있는 식이다.
예시가 하나도 없는 경우를 zero-shot, 하나만 있는 경우를 one-shot, 몇 개 있는 경우를 few-shot이라고 한다.
OpenAI는 GPT-3가 모델 규모를 크게 키우면서 이런 task-agnostic few-shot 성능이 크게 증가했다고 설명했다.[13]
API
GPT-3부터 OpenAI의 상용 API 사업도 본격화됐다.
GPT-2까지는 모델 가중치를 직접 공개하는 방식이 중심이었지만 GPT-3은 모델 자체를 내려받게 하지 않고 OpenAI 서버에 요청을 보내 결과를 받는 API 방식을 택했다.[14]
현재 생성형 AI 서비스에서 흔한
모델은 회사 서버에 있고 개발자는 API로 호출
하는 사업모델이 본격적으로 자리잡는 계기가 됐다.
InstructGPT
GPT-3의 능력은 강력했지만 문제가 하나 있었다.
사람 말을 잘 안 들었다.
정확히는 GPT-3의 학습목표 자체가 사용자의 요구를 만족시키는 것이 아니라 다음 토큰 예측이었기 때문이다.
OpenAI는 이를 해결하기 위해 인간이 원하는 답변을 학습시키는 InstructGPT를 개발했다.
2022년 1월 연구결과가 공개됐다.[15]
과정은 대략
- 사람이 좋은 답변 예시를 만든다.
- 모델을 지도학습한다.
- 여러 모델 답변을 사람이 비교하고 순위를 매긴다.
- 인간의 선호도를 예측하는 보상 모델을 만든다.
- 강화학습을 이용해 모델을 추가 조정한다.
식이다.
OpenAI 연구에서는 매개변수가 13억 개인 InstructGPT가 사람의 선호도 평가에서 1,750억 매개변수 GPT-3보다 선호되기도 했다.[16]
단순히 모델을 크게 만드는 것뿐 아니라 사람이 원하는 방향으로 학습시키는 것 역시 중요하다는 것을 보여준 사례다.
GPT-3.5
GPT-3 이후 GPT-4 이전에 등장한 모델 계열.
정확히 하나의 모델 이름이라기보다 여러 개선 모델을 묶어 GPT-3.5 series라고 불렀다.
OpenAI에 따르면 GPT-3.5 계열의 학습은 2022년 초 완료됐다.[17]
GPT-3.5는 텍스트뿐 아니라 코드 데이터 등을 활용하고 지시수행 능력을 크게 개선한 계열이었다.
그리고 이 모델이 역사적으로 존나 중요한 이유가 있다.
ChatGPT
2022년 11월 30일 OpenAI가 ChatGPT를 공개했다.
최초의 ChatGPT는 GPT-3.5 계열 모델을 대화 형식에 맞춰 추가 학습한 모델이었다.[18]
사용자는 복잡한 API 코드 없이 그냥
야 이거 설명해줘
라고 채팅창에 입력하면 됐다.
후속 질문도 가능했고 이전 대화의 맥락도 이용했다.
GPT 기술 자체는 이미 몇 년 전부터 있었지만 ChatGPT가 등장하면서 일반인들이 처음으로 대규모 언어 모델을 대규모로 직접 사용하기 시작했다.
GPT라는 이름이 기술계 밖으로 폭발적으로 퍼진 시점도 사실상 이때다.
GPT-4
2023년 3월 14일 공개된 후속 세대.[19]
GPT-3 계열과 달리 텍스트뿐 아니라 이미지 입력도 처리할 수 있는 멀티모달 모델로 공개됐다.
이후 GPT-4 Turbo, GPT-4o, GPT-4.1 등 여러 후속 모델과 파생 계열이 등장했다.
자세한 내용은 GPT-4 참고.
GPT-5
2025년 8월 7일 공개된 후속 세대.[20]
일반적인 빠른 응답과 더 긴 추론을 하나의 시스템에서 적절하게 선택하는 방향으로 발전했다.
자세한 모델 계열과 파생형, 후속 버전에 대해서는 GPT-5 참고.
세대
| 모델 | 공개 | 최대 공개 매개변수 | 주요 특징 |
|---|---|---|---|
| GPT | 2018년 | 약 117M | 사전학습 후 파인튜닝 |
| GPT-2 | 2019년 | 1.5B | zero-shot 능력, 대규모 텍스트 생성 |
| GPT-3 | 2020년 | 175B | few-shot learning, API |
| GPT-3.5 | 2022년 | 비공개 | 지시수행·코드 능력 향상, 초기 ChatGPT 기반 |
| GPT-4 | 2023년 | 비공개 | 멀티모달, 추론·성능 향상 |
| GPT-5 | 2025년 | 비공개 | 추론 시스템 통합 및 후속 GPT 계열 |
GPT-4 이후 OpenAI는 이전처럼 정확한 전체 매개변수 수나 학습 데이터 규모를 공개하지 않고 있다.
따라서 인터넷에서 흔히 보이는
GPT-4는 ○조 개 매개변수 GPT-5는 ○조 개
같은 숫자는 OpenAI가 공식적으로 확인한 값이 아닌 경우가 많다.
크면 무조건 좋은가?
초기 GPT 역사만 보면 거의
117M → 1.5B → 175B
로 모델을 미친 듯이 크게 만들었다.
실제로 GPT-3 논문도 모델 규모가 커질수록 few-shot 성능이 크게 향상되는 현상을 보여줬다.
하지만 현대 대규모 언어 모델의 성능은 단순히 총 매개변수 숫자 하나로 비교할 수 없다.
- 학습데이터 품질
- 데이터 양
- 모델 구조
- 학습량
- 후처리
- RL
- 추론 시 사용하는 계산량
- 컨텍스트 길이
- 도구 사용
- 모델 라우팅
등 여러 요소가 영향을 준다.
매개변수가 적은 후속 모델이 오래된 대형 모델보다 훨씬 좋은 성능을 보이는 것도 가능하다.
InstructGPT에서도 13억 매개변수 모델이 사람의 선호 평가에서 1,750억 GPT-3보다 높은 평가를 받는 경우가 있었다.
그래서
매개변수 많은 놈 = 무조건 더 똑똑함
이라고 단순 비교하면 안 된다.
GPT와 ChatGPT
가장 많이 헷갈리는 부분.
| GPT | ChatGPT |
|---|---|
| AI 모델 계열 | AI 서비스 |
| OpenAI가 개발 | OpenAI가 운영 |
| 텍스트·이미지 등을 처리하는 모델 | 사용자가 모델과 대화하는 인터페이스 |
| 개발자가 API 등으로 사용할 수 있음 | 웹·앱 등으로 일반 사용자가 이용 |
| 여러 세대와 변형이 존재 | 여러 종류의 모델을 사용할 수 있음 |
예를 들어 컴퓨터로 비유하면 정확하지는 않지만 대충
GPT = 엔진 ChatGPT = 그 엔진을 이용하는 완성된 서비스
에 가깝다.
2022년 최초 ChatGPT는 GPT-3.5 기반이었다.
이후 ChatGPT에는 GPT-4 계열뿐 아니라 OpenAI의 여러 종류의 모델과 도구가 추가됐다.
따라서
ChatGPT 버전 = GPT 버전
으로 항상 대응되는 것은 아니다.
GPT와 GPTs
이름 때문에 또 헷갈리는 것.
ChatGPT에는 사용자가 특정 목적에 맞게 설정할 수 있는 GPTs라는 기능도 존재한다.
여기서 GPT는 사용자가 별도의 거대 언어 모델을 처음부터 직접 학습한다는 뜻이 아니다.
기존 모델에
- 사용자 지침
- 참고자료
- 기능
- 외부 서비스
등을 연결해 특정 목적의 ChatGPT를 만드는 개념이다.
따라서
GPT-4 GPT-5
같은 기반 모델과
여행 일정 만들어주는 GPT 논문 찾아주는 GPT
같은 커스텀 GPT는 개념이 다르다.
GPT와 검색엔진
GPT는 기본적으로 검색엔진도 아니다.
언어 모델 자체는 학습한 매개변수를 바탕으로 다음 토큰을 생성한다.
따라서 사용자가 질문했다고 반드시 인터넷을 검색한 뒤 답하는 것이 아니다.
다만 ChatGPT 같은 서비스에서는 별도의
- 웹 검색
- 파일 검색
- 계산기
- 코드 실행
- 외부 서비스
등의 도구를 GPT 계열 모델과 연결할 수 있다.
이 경우 모델이 검색결과를 읽고 이를 바탕으로 답할 수 있다.
즉
GPT 자체가 인터넷 = X GPT가 인터넷 검색 도구를 사용할 수 있음 = O
이다.
환각
GPT 계열의 대표적인 문제.
모델은 기본적으로
사실인 문장을 검색해서 복사
하는 것이 아니라
문맥상 다음에 올 가능성이 높은 토큰
을 생성한다.
따라서 실제로 존재하지 않는
- 사람
- 논문
- 책
- 판례
- URL
- 뉴스
- 통계
등을 그럴듯하게 만들어낼 수 있다.
이를 흔히 환각 또는 hallucination이라고 한다.
OpenAI도 2022년 ChatGPT 공개 당시부터 모델이 그럴듯하지만 틀리거나 무의미한 답변을 생성할 수 있다는 점을 주요 한계로 명시했다.[21]
모델 성능이 발전하면서 감소하고는 있지만 생성형 언어 모델의 근본적인 문제 가운데 하나로 계속 연구되고 있다.
지식과 기억
GPT가 책이나 인터넷 페이지를 데이터베이스처럼 통째로 내부에 저장한 뒤 필요한 문장을 검색한다고 생각하면 정확하지 않다.
학습과정에서 데이터의 패턴이 모델의 수많은 매개변수에 분산된 형태로 반영된다.
그래서 학습한 정보에 대해 대답할 수 있지만
- 정확히 어느 문장에서 배웠는지
- 출처가 무엇이었는지
- 원문의 정확한 문구가 무엇인지
를 모델 자체가 항상 알고 있는 것은 아니다.
이 때문에 정확한 출처가 필요한 작업에서는 검색·문서검색 등의 외부 시스템과 결합하는 것이 중요하다.
학습과 사용
학습
모델을 처음 만드는 단계.
엄청난 양의 데이터와 고성능 GPU 등의 계산자원이 필요하다.
대규모 모델 하나를 학습시키는 데는 막대한 비용과 시간이 들어간다.
추론
이미 학습된 모델을 실제로 사용하는 단계.
사용자가
세종대왕에 대해 설명해줘
라고 입력했을 때 학습된 매개변수를 이용해 답을 생성하는 것이 추론이다.
AI 문맥에서
모델이 추론한다
와
inference 서버에서 모델을 실행한다
의 `추론`은 문맥에 따라 약간 다른 의미로 사용될 수 있다.
컨텍스트
GPT는 현재 대화 전체를 무한히 기억하는 것이 아니다.
한 번에 모델에 입력할 수 있는 토큰의 최대 범위를 컨텍스트 윈도우라고 한다.
초기 GPT는 수백 토큰 수준이었고 GPT-2도 1,024 토큰 규모였다.
후대 모델에서는 이 길이가 대폭 증가했다.
컨텍스트가 길어지면
- 긴 문서 읽기
- 긴 대화 유지
- 코드베이스 분석
- 여러 자료 비교
등이 쉬워진다.
다만 컨텍스트 안에 내용이 들어 있다고 해서 모델이 그 모든 내용을 항상 완벽하게 이용하는 것은 또 다른 문제다.
프롬프트
GPT에 입력하는 명령 또는 문맥을 흔히 프롬프트라고 한다.
GPT-3 이후 모델이 별도의 재학습 없이도 프롬프트에 따라 다양한 작업을 수행하면서 프롬프트 작성법 자체가 중요해졌다.
예를 들어
프랑스에 대해 써줘
보다
중학생을 대상으로 프랑스 혁명의 원인을 정치·경제·사회로 나눠 800자로 설명해줘
처럼 원하는 작업과 형식을 명확히 지정하면 일반적으로 더 적절한 답변을 얻기 쉽다.
한때 이를 전문적으로 다루는 프롬프트 엔지니어링이라는 표현도 크게 유행했다.
영향
GPT 이전에도 자연어 생성 모델과 챗봇은 당연히 존재했다.
하지만 GPT 계열은
- 대규모 사전학습
- 하나의 모델로 여러 작업 수행
- 자연어 프롬프트
- few-shot learning
- 인간 피드백 기반 정렬
- 범용 대화형 인터페이스
등을 발전시키면서 현대 생성형 AI 산업에 막대한 영향을 줬다.
특히 2022년 ChatGPT 공개 이후
등이 대규모 언어 모델과 생성형 AI 서비스를 본격적으로 경쟁 개발하기 시작했다.
문서 작성, 프로그래밍, 검색, 교육, 고객지원, 데이터분석 등 수많은 분야에 생성형 AI가 빠르게 도입되는 계기가 됐다.
한계
틀릴 수 있다
말을 존나 자연스럽게 한다고 내용이 맞는 것은 아니다.
최신 정보를 자동으로 아는 것은 아니다
모델이 언제 학습됐는지와 외부 검색기능 사용 여부에 따라 최신 사건을 모를 수 있다.
편향
학습데이터에 존재하는 사회적·문화적 편향이 모델 출력에 반영될 수 있다.
GPT-2 공개 당시부터 OpenAI 역시 성별·인종·종교 등에 관한 편향 연구가 필요하다고 지적했다.[22]
계산비용
대형 모델의 학습뿐 아니라 실제 서비스에도 상당한 GPU·전력·서버 자원이 필요하다.
입력을 이해하는 방식이 인간과 같지 않다
겉보기에는 사람이 문장을 이해하고 생각하는 것처럼 보일 수 있지만 내부 작동방식이 인간의 사고과정과 동일하다고 볼 근거는 없다.
여담
- GPT는 Generative Pre-trained Transformer의 약자다.
- 한국어로는 보통 생성형 사전학습 트랜스포머 정도로 번역한다.
- OpenAI가 2018년 최초 모델을 공개했다.
- 최초 모델은 당시 그냥 GPT라고 불렸으며 후속모델이 등장한 뒤 구분을 위해 GPT-1이라고 부르는 경우가 많다.
- GPT-1의 매개변수는 약 1억 1,700만 개.
- GPT-2는 최대 15억 개.
- GPT-3은 최대 1,750억 개.
- GPT-1에서 GPT-3까지 2년 만에 공개 매개변수 수가 약 1,500배 늘었다.
- GPT-4 이후 정확한 전체 매개변수 수는 공식적으로 공개되지 않았다.
- 인터넷에서 떠도는 GPT-4·GPT-5의 정확한 매개변수 숫자는 공식 자료가 아닐 수 있으므로 주의해야 한다.
- GPT가 사용하는 Transformer 자체는 OpenAI가 발명한 것이 아니다. 2017년 Google 연구진이 발표했다.
- OpenAI의 핵심 기여 가운데 하나는 Transformer와 대규모 생성형 사전학습을 결합하고 이를 계속 확장한 것이다.
- GPT-2는 처음에는 너무 위험할 수 있다는 이유로 최대 모델을 공개하지 않았다.
- 결국 약 9개월 뒤 전부 공개했다.
- GPT-3은 모델을 다운로드시키기보다 API로 제공하는 전략을 택했다.
- GPT-3에서 few-shot prompting이 크게 주목받았다.
- InstructGPT에서는 인간이 선호하는 답변을 학습시키기 위해 RLHF가 사용됐다.
- 초기 ChatGPT도 같은 계열의 방법을 사용했다.
- 최초 ChatGPT의 기반은 GPT-3.5였다.
- ChatGPT와 GPT는 동의어가 아니다.
- ChatGPT 안에서 사용하는 모델이 항상 GPT라는 이름을 가진 것도 아니다.
- GPT의 기본적인 사전학습 원리는 다음 토큰 예측이다.
- 그래서 아주 단순하게 말하면 초거대 자동완성이라고 할 수도 있지만, 실제 능력 전체를 설명하기에는 지나치게 단순한 표현이다.
- GPT는 검색엔진이 아니다.
- 다만 검색 도구를 연결하면 웹을 검색할 수 있다.
- GPT 자체가 계산기는 아니지만 계산도 어느 정도 할 수 있고 외부 계산 도구를 사용할 수도 있다.
- GPT가 아주 자신 있게 말한다고 사실이라는 보장은 없다.
- 존재하지 않는 정보를 만들어내는 AI 환각 문제가 있다.
- GPT-3.5라는 모델 하나가 딱 존재했다기보다 여러 모델을 묶은 계열 명칭에 가깝다.
- GPT-4와 GPT-5는 별도 문서 참고.
- GPT 계열의 확산으로 `GPT`라는 단어 자체가 일반적인 생성형 AI를 뜻하는 것처럼 오용되는 경우도 많다.
- 모든 대규모 언어 모델이 GPT인 것은 아니다.
- 반대로 GPT는 대규모 언어 모델의 대표적인 한 계열이다.
- OpenAI 이외에도 Transformer decoder 구조와 생성형 사전학습을 사용하는 수많은 모델이 등장했지만 그렇다고 전부 OpenAI GPT 계열이 되는 것은 아니다.
같이 보기
외부 링크
각주
- ↑ OpenAI, 「Improving language understanding with unsupervised learning」, 2018년 6월 11일
- ↑ OpenAI, 「Introducing ChatGPT」, 2022년 11월 30일
- ↑ Alec Radford 외, 「Improving Language Understanding by Generative Pre-Training」
- ↑ Ashish Vaswani 외, 「Attention Is All You Need」, 2017
- ↑ OpenAI, 「Aligning language models to follow instructions」, 2022년 1월 27일
- ↑ OpenAI, 「Introducing ChatGPT」
- ↑ OpenAI, 2018년 6월 11일
- ↑ OpenAI, 「Improving Language Understanding by Generative Pre-Training」
- ↑ OpenAI, 「Better language models and their implications」, 2019년 2월 14일
- ↑ OpenAI, 「Better language models and their implications」
- ↑ OpenAI, 「GPT-2: 1.5B release」, 2019년 11월 5일
- ↑ OpenAI, 「Language models are few-shot learners」, 2020년 5월 28일
- ↑ OpenAI
- ↑ OpenAI, 「OpenAI's comment to the NTIA on open model weights」
- ↑ OpenAI, 「Aligning language models to follow instructions」
- ↑ Long Ouyang 외, 「Training language models to follow instructions with human feedback」
- ↑ OpenAI, 「Introducing ChatGPT」
- ↑ OpenAI, 2022년 11월 30일
- ↑ OpenAI, 「GPT-4」, 2023년 3월 14일
- ↑ OpenAI, 「Introducing GPT-5」, 2025년 8월 7일
- ↑ OpenAI, 「Introducing ChatGPT」
- ↑ OpenAI, 「GPT-2: 1.5B release」