메뉴 여닫기
환경 설정 메뉴 여닫기
개인 메뉴 여닫기
로그인하지 않음
만약 지금 편집한다면 당신의 IP 주소가 공개될 수 있습니다.

💬 같이 떠들 사람? 노바위키 디스코드

ChatGPT · 주요 GPT 모델

초기

GPT-3.5

GPT-4 계열

GPT-4 · GPT-4 Turbo · GPT-4o · GPT-4.1

GPT-5 계열

GPT-5 · GPT-5.1 · GPT-5.2 · GPT-5.4 · GPT-5.6

GPT-6 계열

GPT-6 · GPT-6 Astra · GPT-6 Sol · GPT-6 Luna

GPT-3.5는 OpenAI가 GPT-3 이후 개발한 GPT 계열의 인공지능 모델군이다. 하나의 특정 모델 이름이라기보다는 GPT-3을 기반으로 코드 학습, 지시 수행, RLHF 등을 발전시키면서 만들어진 여러 모델을 묶어 부르는 세대명에 가깝다. 2022년 11월 30일 공개된 최초의 ChatGPT가 바로 GPT-3.5 계열 모델을 기반으로 만들어졌다. OpenAI는 당시 ChatGPT가 2022년 초 학습을 마친 GPT-3.5 계열 모델을 추가 학습한 것이라고 밝혔다.[1] 이 때문에 GPT-3.5 자체보다 ChatGPT를 통해 훨씬 유명해졌다. 2023년에는 대화형 API 모델 GPT-3.5 Turbo가 출시되면서 OpenAI API의 주력 저가 모델로 사용됐으며, 이후 함수 호출, 16K 컨텍스트, JSON 출력, 파인튜닝 등의 기능이 추가됐다.[2] 그러나 2023년 GPT-4, 2024년 GPT-4o와 GPT-4o mini가 등장하면서 점차 구형 모델이 됐다. 2024년 7월 GPT-4o mini가 ChatGPT에서 GPT-3.5를 공식적으로 대체했고,[3] 2026년 현재 API에서도 마지막 GPT-3.5 Turbo 모델들이 퇴역 절차에 들어갔다. 생성형 AI 역사에서 보면 최신 모델보다 성능은 한참 떨어졌지만, ChatGPT를 세상에 처음 터뜨린 모델이라는 점 때문에 역사적 의미는 존나 크다.

개요

항목 내용
명칭 GPT-3.5
개발 OpenAI
계열 GPT
이전 세대 GPT-3
후속 세대 GPT-4
주요 시기 2022년 ~ 2024년
주요 모델 code-davinci-002, text-davinci-002, text-davinci-003, GPT-3.5 Turbo
대표 서비스 초기 ChatGPT, OpenAI API
입력 텍스트
주요 기술 Transformer, instruction tuning, RLHF
매개변수 수 비공개

GPT-3.5란 무엇인가

GPT-3.5라는 이름 때문에

GPT-3.0
→ GPT-3.5
→ GPT-4.0

처럼 하나의 모델이 순서대로 업그레이드된 것으로 생각하기 쉽다. 실제로는 조금 복잡하다. GPT-3 이후 OpenAI는 원래의 단순한 다음 토큰 예측 모델에

  • 코드 학습
  • 지시 수행 학습
  • 인간 피드백
  • 대화 최적화

등을 계속 추가했다. 그 결과 등장한 여러 개선 모델을 GPT-3.5 계열이라고 묶어 부르게 됐다. 따라서

GPT-3.5라는 모델 딱 하나

가 있었던 것은 아니다. 특히

  • `code-davinci-002`
  • `text-davinci-002`
  • `text-davinci-003`
  • 초기 ChatGPT 모델
  • `gpt-3.5-turbo`

등이 서로 같은 이름의 단일 모델은 아니지만 GPT-3.5 시대에 속한다. 그래서 GPT-3.5의 정확한

출시일

하나를 정하는 것도 애매하다. 보통 대중적으로는 최초 ChatGPT가 공개된 2022년 11월 30일을 GPT-3.5가 본격적으로 알려진 시점으로 본다.

GPT-3에서 GPT-3.5로

2020년 공개된 GPT-3는 최대 1,750억 개 매개변수를 가진 당시 기준 초대형 언어 모델이었다. GPT-3의 가장 인상적인 특징은 모델을 다시 학습하지 않고 프롬프트에 예시 몇 개만 넣어도

  • 번역
  • 요약
  • 질문답변
  • 글쓰기

등의 작업을 수행할 수 있다는 것이었다. 하지만 문제가 있었다. 말을 존나 안 들었다. 정확히는 GPT-3의 학습목표가

사용자가 원하는 일을 한다

가 아니라

다음에 나올 토큰을 예측한다

였기 때문이다. 사용자가

이 문장을 세 줄로 요약해줘

라고 입력하더라도 모델 입장에서는 그것을 명령으로 받아들여야 할 이유가 없다. 명령 뒤에 또 다른 명령문을 생성할 수도 있고 이상한 방향으로 문장을 이어갈 수도 있었다. GPT-3.5로 이어지는 발전과정에서는 이 문제를 해결하는 것이 중요한 목표가 됐다.

InstructGPT

GPT-3.5로 넘어가는 데 가장 중요한 중간단계. 2022년 1월 27일 OpenAI는 InstructGPT 연구결과를 발표했다.[4] 기존 GPT-3에 인간의 피드백을 이용해

사람의 명령을 잘 따르는 모델

을 만드는 연구였다. OpenAI가 사용한 대표적인 방법이 RLHF다.

학습 방식

대략 다음 과정을 거쳤다.

  1. 사람이 질문과 좋은 답변 예시를 작성한다.
  2. 이를 이용해 GPT 모델을 지도학습한다.
  3. 하나의 질문에 여러 답을 생성한다.
  4. 사람이 어느 답이 더 좋은지 순위를 매긴다.
  5. 인간의 선호를 예측하는 보상모델을 만든다.
  6. 강화학습을 통해 높은 보상을 받는 답을 생성하도록 모델을 조정한다.

논문에서는

  • 1.3B
  • 6B
  • 175B

규모의 InstructGPT 모델을 시험했다.[5] 흥미롭게도 인간 평가자들은 13억 매개변수 InstructGPT의 답변을 1,750억 매개변수 원본 GPT-3보다 더 선호했다.[6] 모델을 무조건 크게 만드는 것보다 사람 말을 듣게 가르치는 것도 존나 중요하다는 것을 보여준 것이다.

code-davinci-002

GPT-3.5 계열의 초기 기반모델 가운데 하나. 이름 그대로 코드 데이터를 적극적으로 활용해 학습된 Davinci 계열 모델이다. 기존 Codex와 GPT-3 연구의 흐름을 잇는 모델로 코드뿐 아니라 자연어 능력도 상당히 강화됐다. 후속 `text-davinci-002`의 기반이 됐다. OpenAI는 이후 구형 Completions API를 정리하면서 `code-davinci-002`를 2023년 3월 퇴역시켰다.[7]

text-davinci-002

`code-davinci-002`를 기반으로 사용자의 지시를 따르도록 추가 학습한 InstructGPT 계열 모델. 일반 GPT-3보다

  • 질문답변
  • 요약
  • 글쓰기
  • 형식 맞추기
  • 명령 수행

등에서 훨씬 사용하기 쉬웠다. 과거 OpenAI Playground와 API에서 대표적인 텍스트 생성모델 가운데 하나였다.

text-davinci-003

2022년 말 등장한 `text-davinci-002`의 개선 모델. 초기 ChatGPT 직전에 등장한 대표적인 GPT-3.5 계열 모델이었다. 명령 수행과 글쓰기, 추론능력 등이 개선됐다. 이 시기 OpenAI API를 사용하던 개발자들에게는 사실상 최고급 범용 텍스트 모델 역할을 했다. API 가격은 1,000토큰당 약 0.02달러, 즉 100만 토큰당 20달러 수준이었다.[8] 하지만 몇 달 뒤 GPT-3.5 Turbo가 등장하면서 가격이 말도 안 되게 떨어진다. 2024년 1월 4일 `text-davinci-003`을 비롯한 기존 Completions 모델은 공식적으로 퇴역했다.[9]

ChatGPT

GPT-3.5의 역사에서 가장 중요한 사건. 2022년 11월 30일 OpenAI는 ChatGPT라는 연구 프리뷰를 공개했다.[10] OpenAI는 당시 ChatGPT가

2022년 초 학습이 끝난 GPT-3.5 계열의 모델

을 기반으로 만들어졌다고 밝혔다. 이를 다시 대화에 맞게 지도학습하고 RLHF를 사용해 추가 조정했다.

대화 데이터

인간 AI 트레이너가

  • 사용자
  • AI 어시스턴트

양쪽 역할을 모두 수행하면서 대화 예시를 만들었다. 기존 InstructGPT 데이터도 대화형식으로 변환해 함께 사용했다.[11]

후속 질문

기존 GPT API는 기본적으로

입력 하나 → 출력 하나

형태로 사용하는 경우가 많았다. ChatGPT는 대화 이력을 함께 제공해

아까 말한 거 다시 설명해줘
그중 두 번째 것만 자세히

같은 후속 질문을 자연스럽게 처리했다.

틀린 전제 지적

OpenAI는 ChatGPT가

  • 후속 질문에 답하고
  • 자신의 실수를 인정하고
  • 잘못된 전제에 이의를 제기하고
  • 부적절한 요청을 거절

할 수 있도록 설계됐다고 소개했다.[12] 지금 보면 너무 당연한 챗봇 기능처럼 느껴지지만 2022년에는 일반 사용자가 이런 수준의 언어모델을 무료 웹사이트에서 바로 쓸 수 있다는 것 자체가 충격이었다.

생성형 AI 대중화

GPT-3도 이미 매우 유명한 AI 연구였지만 일반인이 API 키 만들고 프롬프트 엔지니어링하면서 놀 정도로 대중적인 서비스는 아니었다. ChatGPT는 그냥 사이트 들어가서

안녕

하면 됐다. 그래서 GPT-3.5는 기술적으로 가장 강력했던 기간보다 ChatGPT를 통해 수억 명에게 대규모 언어 모델이라는 개념을 처음 체험시킨 모델이라는 의미가 더 크다.

GPT-3.5 Turbo

2023년 3월 1일 공개된 GPT-3.5 계열의 대화형 API 모델.[13] 모델명은

`gpt-3.5-turbo`

였다. 출시 당시 ChatGPT에서 사용되던 모델 계열을 개발자도 API로 사용할 수 있게 한 것이다. OpenAI는 GPT-3.5 Turbo가 채팅뿐 아니라 많은 일반 텍스트 작업에서도 `text-davinci-003`보다 좋은 선택이라고 설명했다.

가격

출시가격은

1,000토큰당 $0.002

였다.[14] 당시 기존 GPT-3.5 모델보다 약 10배 저렴했다. `text-davinci-003`의 100만 토큰당 약 20달러와 비교하면 GPT-3.5 Turbo는 같은 양을 대략 2달러 수준에 처리할 수 있었다. 성능만 중요한 것이 아니라

AI를 실제 서비스에 쓸 수 있을 만큼 싸게 만든 것

도 상당히 중요한 변화였다.

Chat Completions API

GPT-3 계열의 기존 Completions API는 기본적으로 하나의 문자열 프롬프트를 사용했다. GPT-3.5 Turbo에서는

`system`
`user`
`assistant`

같은 역할이 붙은 메시지 배열을 사용하는 Chat Completions API가 본격적으로 도입됐다.[15] 예를 들어 내부적으로

사용자: 안녕
어시스턴트: 안녕하세요.
사용자: 아까 질문 기억해?

같은 대화구조를 명시적으로 전달할 수 있게 됐다.

ChatML

OpenAI는 당시 ChatGPT 계열 모델의 내부 메시지 형식을 Chat Markup Language(ChatML)라고 설명했다.[16] 개발자가 문자열 하나에

`User:`
`Assistant:`

를 직접 집어넣는 대신 역할별 메시지를 API에 전달하는 방식이 됐다. 현대 대화형 LLM API의 일반적인 형태가 여기서 대중화됐다.

gpt-3.5-turbo-0301

2023년 3월 처음 공개된 GPT-3.5 Turbo의 고정 스냅샷. `gpt-3.5-turbo`라는 이름은 OpenAI가 권장하는 최신 안정버전을 가리키는 별칭이었고, 개발자가 출력 동작이 갑자기 달라지는 것을 원하지 않으면

`gpt-3.5-turbo-0301`

처럼 날짜가 붙은 버전을 고정해서 사용할 수 있었다. OpenAI는 이런 방식을 model snapshot으로 운영했다. 2024년 9월 13일 퇴역했다.[17]

함수 호출

2023년 6월 13일 GPT-3.5 Turbo에 Function Calling 기능이 추가됐다.[18] 모델에게

이런 함수가 있다

라고 함수명과 인자 구조를 알려주면 사용자의 요청에 맞춰 호출해야 할 함수와 인자를 구조화된 형태로 반환할 수 있었다. 예를 들어 사용자가

서울 날씨 알려줘

라고 하면 GPT가 직접 날씨를 알고 있는 척하는 대신

`get_weather(location="Seoul")`

같은 호출을 생성하도록 만들 수 있다. 실제 함수 실행은 개발자의 프로그램이 담당한다. 이 기능은 후대의

  • 도구 사용
  • 웹 검색
  • 데이터베이스 조회
  • AI 에이전트

의 기초가 됐다. GPT가 단순히 글을 생성하는 모델에서 다른 프로그램을 조종하는 모델로 발전하기 시작한 중요한 시점이다.

gpt-3.5-turbo-0613

함수 호출과 함께 나온 2023년 6월 버전. 기존 버전보다 system message를 더 잘 따르고 Function Calling 기능을 지원했다.[19] 동시에 별도의

`gpt-3.5-turbo-16k`

계열도 공개됐다.

16K 컨텍스트

초기 GPT-3.5 Turbo의 컨텍스트는 약 4K 토큰 수준이었다. 2023년 6월

GPT-3.5 Turbo 16K

버전이 등장하면서 약 네 배로 늘어났다.[20] 긴

  • 문서
  • 대화기록
  • 코드

를 한 번에 처리하기 쉬워졌다. 당시에는 16K도 상당히 긴 컨텍스트였다. 후대에는 GPT-4.1의 100만 토큰, GPT-6 계열의 100만 토큰 이상까지 늘어나면서 지금 보면 귀엽다.

gpt-3.5-turbo-1106

2023년 11월 6일 OpenAI DevDay에서 공개된 개선버전.[21] 중요한 변화는 16K 컨텍스트가 별도 모델이 아니라 기본값이 됐다는 점이다. 또

  • 개선된 instruction following
  • JSON mode
  • parallel function calling

기능이 추가됐다. OpenAI 내부 평가에서는 JSON·XML·YAML 등 지정된 출력형식을 따르는 작업에서 기존보다 38% 개선됐다고 발표했다.[22]

JSON mode

모델에게

JSON으로 줘

라고 부탁하는 수준을 넘어 API에서 유효한 JSON 출력을 만들도록 제어할 수 있게 됐다. AI 출력을 프로그램이 다시 읽어야 하는 서비스에서 매우 유용했다.

Parallel Function Calling

한 번에 하나의 함수만 요청하는 것이 아니라 여러 도구를 동시에 호출하도록 할 수 있게 됐다. 예를 들어

서울과 도쿄 날씨 비교해줘

라고 하면

서울 날씨 조회
도쿄 날씨 조회

를 각각 순차적으로 기다리는 대신 동시에 요청할 수 있다. 후대 AI 에이전트들의 병렬 도구 사용으로 이어지는 기능이다.

gpt-3.5-turbo-0125

GPT-3.5 Turbo의 마지막 대표 버전. 2024년 1월 25일 발표됐고 실제 API에는 2월 1일 출시됐다.[23] 개선점으로

  • 지정된 출력형식 준수 향상
  • 비영어권 Function Calling에서 발생하던 텍스트 인코딩 오류 수정

등이 있었다.

가격 인하

이 버전에서 API 가격이 다시 내려갔다. 출시 당시

입력 1,000토큰당 $0.0005
출력 1,000토큰당 $0.0015

였다.[24] 100만 토큰 기준으로는

입력 $0.50
출력 $1.50

이다. 2023년 초 GPT-3.5 Turbo 출시가격보다도 훨씬 싸졌다.

GPT-3.5 Turbo의 최종 사양

2026년 현재 OpenAI가 구형 GPT-3.5 Turbo 문서에 표시하는 주요 사양은 다음과 같다.[25]

항목 내용
입력 텍스트
출력 텍스트
컨텍스트 16,385 토큰
최대 출력 4,096 토큰
지식 기준시점 2021년 9월
API 입력가격 $0.50 / 100만 토큰
API 출력가격 $1.50 / 100만 토큰
파인튜닝 지원
이미지 미지원
음성 미지원

현재 문서에는 모델 자체가 Deprecated로 표시돼 있다.

파인튜닝

2023년 8월 GPT-3.5 Turbo에 파인튜닝 기능이 제공됐다. 개발자가 자체적인

  • 질문·답변
  • 특정 문체
  • 출력형식
  • 업무 예시

등을 학습시켜 용도별 모델을 만들 수 있었는데, 예를 들어 고객센터에서 회사 고유의 응답형식을 지속적으로 사용해야 한다면 매번 긴 프롬프트를 입력하는 대신 파인튜닝할 수 있었다.

GPT-3.5 Turbo는 비교적 저렴한 가격 덕분에 대량 서비스에서 파인튜닝용 모델로 오랫동안 사용됐다. 2026년 10월 23일에는 GPT-3.5 Turbo 기반 파인튜닝 모델도 함께 종료될 예정이다.[26]

GPT-4 등장

2023년 3월 14일 GPT-4가 공개됐다.

GPT-3.5보다

  • 복잡한 추론
  • 코딩
  • 수학
  • 지시 수행
  • 이미지 이해

등이 크게 개선됐다.

이로써 2022년 11월부터 ChatGPT를 대표했던 GPT-3.5는 약 1년 8개월 만에 ChatGPT의 현역 모델 자리에서 물러났다.

API에서는 더 오래 살았다

ChatGPT에서 사라진 뒤에도 GPT-3.5 Turbo API는 오랫동안 유지됐다. 이미 수많은 서비스가 GPT-3.5 API에 의존하고 있었기 때문이다. 개발자가 모델 하나 바꾸는 것이 보기에는

`gpt-3.5-turbo`

를 다른 이름으로 바꾸면 끝인 것 같지만 실제 서비스에서는

  • 출력형식
  • 프롬프트
  • 비용
  • 응답시간
  • 함수 호출
  • 테스트

등이 전부 달라질 수 있다. 그래서 OpenAI는 구형 모델을 바로 삭제하지 않고 긴 퇴역기간을 제공했다.

퇴역

2026년 들어 GPT-3.5 계열도 마지막 정리에 들어갔다.

gpt-3.5-turbo-instruct

구형 Completions API에서 `text-davinci-003`을 대체했던 모델. 2026년 9월 28일 종료됐다.[27]

gpt-3.5-turbo-1106

2023년 DevDay에서 나온 버전. 역시 2026년 9월 28일 종료됐다.[28]

gpt-3.5-turbo-0125

마지막 대표 GPT-3.5 Turbo 스냅샷. 2026년 10월 23일 종료 예정이다.[29] 2026년 10월 현재 아직 남아 있지만 사실상 퇴역 직전이다. OpenAI는 대체모델로 GPT-5.6 계열을 권장하고 있다. 즉 GPT-3.5 계열이 세상에 등장한 지 약 4년 만에 API에서도 역사 속으로 들어가는 단계다.

GPT-3.5와 GPT-4

GPT-3.5 GPT-4
주요 등장 2022년 2023년
대표 서비스 초기 ChatGPT ChatGPT Plus
입력 텍스트 텍스트·이미지
추론능력 상대적으로 낮음 크게 향상
속도 빠름 초기에는 느림
API 비용 저렴 높음
대표 역할 대중화·저비용 대화 고성능 모델

GPT-3.5에서 GPT-4로 넘어갈 때 가장 크게 체감되는 차이는 복잡한 문제의 안정성이었다. 간단한

메일 하나 써줘
이 문장 번역해줘

에서는 GPT-3.5도 충분히 잘했다. 하지만

  • 긴 조건 여러 개 지키기
  • 복잡한 코드
  • 논리문제
  • 정교한 분석
  • 긴 문서

등에서는 GPT-4가 훨씬 안정적이었다.

GPT-3.5와 GPT-3

GPT-3 GPT-3.5
공개시기 2020년 2022년경
주요 특징 few-shot learning 지시 수행·대화
인간 피드백 핵심구조 아님 적극 활용
코드 학습 제한적 크게 강화
대화 최적화 X O
ChatGPT 기반 X O

GPT-3의 중요한 발견이

모델을 크게 만들면 예시 몇 개만 보고도 새로운 작업을 한다

였다면 GPT-3.5의 중요한 변화는

그 강력한 모델을 실제 사람이 쓰기 편하게 만들자

였다. 결국 ChatGPT의 성공에는 모델 크기뿐 아니라 InstructGPT와 RLHF 같은 정렬기술이 상당히 중요한 역할을 했다.

매개변수 수

GPT-3.5의 정확한 매개변수 수는 공개되지 않았다. 인터넷에서는 종종

GPT-3.5 = 1,750억 파라미터

라고 단정하는 글을 볼 수 있다. GPT-3의 최대 모델이 1,750억 매개변수였고 InstructGPT 연구에서도 175B 모델을 사용했기 때문에 나온 추정이다. 하지만 GPT-3.5 Turbo나 최초 ChatGPT 모델의 정확한 매개변수 수를 OpenAI가 공식적으로 공개한 것은 아니다. 따라서

GPT-3.5는 정확히 175B

라고 적으면 안 된다. 후대 GPT-4와 GPT-5도 정확한 매개변수 수는 공개되지 않았다.

코딩

GPT-3.5에서는 GPT-3보다 코드 능력이 크게 개선됐다. GPT-3.5 초기 계보에 `code-davinci-002`가 포함됐다는 것부터 코드 데이터의 중요성을 보여준다. 초기 ChatGPT가 공개되자 사람들이 가장 놀란 기능 중 하나도

코드를 써준다

는 것이었다.

  • Python
  • JavaScript
  • SQL
  • HTML/CSS

등을 자연어로 요청하면 코드를 생성하고 기존 코드의 오류도 어느 정도 설명할 수 있었다. 지금 기준으로는 GPT-6 같은 모델과 비교할 수도 없지만 2022년에는

챗봇한테 코드 짜달라 했더니 진짜 돌아가는 코드가 나옴

자체가 상당한 충격이었다.

환각

GPT-3.5의 가장 악명 높은 문제. 모르는 것을

모른다

고 말하기보다 그럴듯한 답을 만들어내는 경우가 많았다. 특히

  • 논문 제목
  • 저자
  • URL
  • 판례
  • 책
  • 통계

를 물으면 존재하지 않는 자료를 굉장히 자연스럽게 만들어낼 수 있었다. 초기 ChatGPT 공개문에서도 OpenAI는 모델이

그럴듯하게 들리지만 틀리거나 무의미한 답

을 생성할 수 있다고 명시했다.[30] 후속 GPT 모델에서 환각률은 계속 감소했지만 이 문제가 완전히 사라진 것은 아니다.

수학

GPT-3.5는 글은 굉장히 자연스럽게 쓰는데 단순 계산이나 논리문제에서 엉뚱하게 틀리는 것으로도 유명했다. 언어모델은 기본적으로 계산기가 아니라 다음 토큰 예측 모델이므로

12345 × 6789

같은 계산도 언어패턴으로 처리하려다 틀릴 수 있었다. 지금은 ChatGPT가 계산기나 코드실행 같은 도구를 사용할 수 있지만 초기 GPT-3.5 ChatGPT는 이런 외부도구도 훨씬 제한적이었다.

지식 기준시점

초기 ChatGPT에는

Knowledge cutoff: 2021

이라는 한계가 유명했다. 현재 OpenAI API 문서의 최종 GPT-3.5 Turbo 역시 지식 기준시점을 2021년 9월로 표시한다.[31] 따라서 2022년 이후 사건을 물으면 모델 자체의 학습지식만으로는 답할 수 없는 경우가 많았다. 초기 ChatGPT가

2021년 이후 정보는 알 수 없습니다

라는 말을 존나 많이 했던 이유다. 후대 ChatGPT에는 웹검색이 연결되면서 이 한계가 상당 부분 해결됐다.

영향

GPT-3.5는 역사적으로 GPT-4보다 더 중요한 모델이라고 평가할 여지도 있다. 최고 성능을 기록한 모델이라서가 아니다. 일반 대중이 처음으로 대규모 언어 모델을 매일 사용하는 시대를 열었기 때문이다. ChatGPT 이전에도

  • GPT-3
  • BERT
  • LaMDA
  • 각종 챗봇

이 존재했다. 하지만 일반인이 아무 설명 없이 웹사이트에 들어가 질문 하나만 입력해

  • 글쓰기
  • 번역
  • 요약
  • 코딩
  • 아이디어
  • 공부

를 한 서비스에서 처리할 수 있게 된 것은 ChatGPT가 결정적인 전환점이었다. 그 ChatGPT의 최초 엔진이 GPT-3.5였다.

생성형 AI 경쟁

ChatGPT와 GPT-3.5의 폭발적인 성공 이후 세계 주요 IT기업들이 생성형 AI 경쟁에 본격적으로 뛰어들었다. Microsoft는 OpenAI와의 협력을 확대하고 Bing과 Office 제품군에 생성형 AI를 통합했다. Google은 Bard를 공개했고 이후 Gemini로 발전시켰다. Anthropic은 Claude를 내놓았다. Meta는 Llama 계열을 공개했다. 결국 2022년 말부터 시작된 생성형 AI 붐에서 GPT-3.5와 ChatGPT는 사실상의 기폭제 역할을 했다.

여담

  • 이름은 GPT-3와 GPT-4 사이의 3.5.
  • 하지만 단일 모델명이라기보다 여러 모델을 묶은 계열명이다.
  • 정확한 GPT-3.5의 출시일 하나를 정하기 애매하다.
  • 일반 대중에게 알려진 시점은 2022년 11월 30일 ChatGPT 공개.
  • 최초 ChatGPT는 GPT-3.5 계열을 기반으로 했다.
  • 해당 기반모델은 2022년 초 학습이 끝났다고 OpenAI가 밝혔다.
  • GPT-3.5 시대에는 `code-davinci-002`, `text-davinci-002`, `text-davinci-003` 등이 사용됐다.
  • `text-davinci-003`은 ChatGPT 공개 직전 OpenAI API의 대표적인 고성능 모델이었다.
  • 2023년 3월 1일 `gpt-3.5-turbo` API가 공개됐다.
  • 출시가격은 1,000토큰당 0.002달러.
  • 기존 GPT-3.5 계열 모델보다 약 10배 저렴했다.
  • GPT-3.5 Turbo와 함께 Chat Completions API가 본격적으로 도입됐다.
  • `system`, `user`, `assistant` 역할을 가진 메시지를 보내는 지금의 익숙한 구조가 여기서 널리 퍼졌다.
  • 내부 메시지 포맷을 ChatML이라고 불렀다.
  • 2023년 6월 Function Calling이 추가됐다.
  • 같은 시기 16K 컨텍스트 버전도 등장했다.
  • 2023년 11월부터 GPT-3.5 Turbo 자체가 기본적으로 16K 컨텍스트를 지원했다.
  • GPT-3.5 Turbo 1106에는 JSON mode와 parallel function calling이 추가됐다.
  • 마지막 대표 스냅샷은 `gpt-3.5-turbo-0125`.
  • 최종 버전의 컨텍스트는 16,385토큰.
  • 최대 출력은 4,096토큰.
  • GPT-3.5 Turbo는 이미지 입력을 지원하지 않는다.
  • 음성도 모델 자체가 처리하지 않는다.
  • 초기 ChatGPT 음성 기능은 별도의 음성인식·음성합성 모델과 연결되는 방식이었다.
  • GPT-3.5의 정확한 매개변수 수는 공개되지 않았다.
  • `GPT-3.5 = 175B`라고 확정적으로 적으면 안 된다.
  • 2023년 GPT-4가 나왔지만 GPT-3.5는 무료 ChatGPT와 저가 API용으로 계속 살아남았다.
  • GPT-4가 훨씬 똑똑했지만 GPT-3.5가 훨씬 빨랐다.
  • 그래서 간단한 질문은 오히려 GPT-3.5를 선호하는 사람도 있었다.
  • 초기 GPT-4 메시지 제한을 다 쓰면 다시 GPT-3.5로 돌아가야 했다.
  • 2024년 5월 무료 ChatGPT에도 GPT-4o가 제공되기 시작했지만 사용량 한도를 넘으면 GPT-3.5로 전환됐다.
  • 2024년 7월 18일 GPT-4o mini가 GPT-3.5를 ChatGPT에서 완전히 대체했다.
  • GPT-4o mini는 GPT-3.5보다 더 똑똑하면서 더 싸고 이미지도 볼 수 있었다.
  • OpenAI 입장에서 이제 GPT-3.5를 계속 기본모델로 쓸 이유가 거의 없어졌다.
  • 그래도 API에서는 기존 서비스 호환성 때문에 2년 넘게 더 살아남았다.
  • `gpt-3.5-turbo-instruct`와 `gpt-3.5-turbo-1106`은 2026년 9월 28일 종료됐다.
  • `gpt-3.5-turbo-0125`와 기본 GPT-3.5 Turbo 계열은 2026년 10월 23일 종료 예정이다.
  • 따라서 2026년 10월 현재 진짜 퇴역까지 약 보름 남았다.
  • AI 기준으로는 화석에 가까운 모델인데 불과 4년 전에는 전 세계 사람들을 충격에 빠뜨린 최신기술이었다.
  • GPT-3.5가 답을 틀리면 사용자가 "역시 AI는 멍청하네"라고 했고 몇 년 뒤에는 AI가 실제 컴퓨터를 조작하고 프로그램을 통째로 만드는 시대가 왔다.
  • 생성형 AI 발전속도가 얼마나 미친 수준인지 보여주는 모델이기도 하다.

같이 보기

외부 링크

각주