AI의 발전과 함께 이 질문에 답하기가 점점 더 어려워지고 있습니다. ChatGPT, Claude, Gemini와 같 AI 챗봇들이 일상에 들어오면서, 종종 화면 너머에 있는 존재가 인간인지 인공지능인지 구분하기 어려운 경험을 합니다.
이는 70년도 더 전에 한 천재 수학자 앨런 튜링(Alan Turing)이 던진 질문과 직접 연결됩니다.
"기계가 생각할 수 있는가?" "우리는 어떻게 그것을 판단할 수 있는가?"
이 질문을 던진 그는 그 해답을 찾기 위해 '튜링 테스트'를 고안했습니다.
인공지능의 시초라고 할 수 있는 튜링 테스트에 대해 알아보고, 그것이 현대 AI 기술과 우리의 일상에 어떤 의미를 갖는지 살펴보겠습니다.
튜링 테스트란?
튜링 테스트(Turing Test)는 기계가 인간과 구별할 수 없는 지능적 행동을 보일 수 있는지 평가하는 방법입니다. 1950년 영국의 천재 수학자이자 컴퓨터 과학자인 앨런 튜링이 "Computing Machinery and Intelligence" 논문에서 제안했으며, 원래는 "모방 게임(Imitation Game)"이라고 불렸습니다.
이 테스트는 단순하지만 강력한 개념을 바탕으로 합니다.
만약 인간 평가자가 텍스트 기반 대화를 통해 기계와 인간을 구별할 수 없다면, 그 기계는 '지능적'이라고 간주할 수 있다는 것입니다.
테스트 진행 방식
튜링 테스트는 다음과 같이 간단한 구조로 진행됩니다.
•
[참가자 구성] 인간 심사위원(평가자), 인간 응답자, 그리고 AI 시스템이 각각 별도의 공간에 배치됩니다.
•
[대화 진행] 심사위원(인간)은 모니터에 나오는 텍스트만으로 기계(아래 그림의 A, AI)와 인간(아래 그림의 B)와 대화하며 누가 인간이고 누가 기계인지 판단합니다.
•
[판정] 심사위원이 답변 텍스트만 보고 인간이 답한 건지 기계가 답한 건지 구별하지 못한다면, AI는 테스트를 "통과"한 것으로 간주합니다.
단순화된 접근: 지능의 다양한 측면(문제 해결, 감정 이해, 윤리적 추론 등)을 포괄하지 못함
현대적 의의와 응용
오늘날 튜링 테스트는 실용적인 AI 평가 도구보다는 철학적 사고실험으로 더 많이 인용됩니다. 그러나 그 영향력은 여전히 강력합니다.
•
CAPTCHA 시스템: 인터넷에서 인간과 봇을 구별하는 역튜링 테스트로 활용
•
AI 윤리 논의: 기계의 의식과 권리에 관한 철학적 토론의 기반
•
새로운 평가 방법론: 위노그라드 스키마 챌린지 등 더 정교한 AI 평가 방법 개발에 영감 제공
최근 ChatGPT와 같은 최신 대형 언어 모델들은 튜링 테스트를 통과했습니다. 특히, 2024년에는 GPT-4와 같은 대형 언어 모델들이 현대적이고 엄격한 튜링 테스트 변형을 통과했다는 보고도 있습니다. 한 연구에 따르면 GPT-4는 참가자들을 54%의 확률로 속여 인간이라고 생각하게 만들었습니다*. 이는 초기 ELIZA 챗봇이 참가자들을 22%만 속일 수 있었던 것과 비교할 때 상당한 발전입니다.
이제 우리는 "기계가 생각할 수 있는가?"라는 질문을 넘어 "기계의 사고가 인간의 사고와 어떻게 다른가?"라는 더 깊은 질문을 해야할 때가 도래했습니다.