Sign In

NotebookLM Deep Research: 아키텍처를 알면 프롬프트가 달라진다

AI Infrastructure · Research Tools · June 2026
컨텍스트 엔지니어링, 단계별 사고(CoT) 전략, 다중 에이전트 설계까지 — 에이전틱 AI를 실제로 쓸 수 있는 수준으로 이해하기
Google이 NotebookLM에 Deep Research 기능을 올린 이후 여러 팀에서 써봤다는 얘기를 들었다. 반응이 엇갈렸다. 한쪽은 "결국 구글 검색 짜깁기"라 했고, 다른 쪽은 "50개 문서를 30분 만에 교차 분석했다"며 실제 업무에 쓰고 있었다. 같은 도구를 쓰고 결과가 이렇게 다른 건, 대부분 도구가 어떻게 작동하는지 이해하고 있느냐의 차이다.
이 글은 NotebookLM Deep Research의 아키텍처와 프롬프트 설계 원칙을 정리한다. "어떻게 입력해야 좋은 결과가 나오는가"의 문제는 결국 "이 시스템이 어떻게 작동하는가"를 이해해야 풀린다.

01 — Architecture

소스 기반 AI가 일반 챗봇과 다른 이유

일반 LLM 챗봇은 사전 학습된 파라미터를 바탕으로 응답을 생성한다. 인터넷 전체를 학습한 모델이 내놓는 답은 광범위하지만, 특정 도메인의 내부 문서를 근거로 답변하게 할 방법이 없다.
NotebookLM은 다른 설계 원칙으로 만들어졌다. 사용자가 업로드한 문서만을 근거로 작동하는 Source-Grounded AI 아키텍처다. 이 설계가 중요한 이유는 두 가지다. 첫째, 환각(Hallucination)을 구조적으로 억제한다. 답변에 사용한 소스 구절로 직접 연결되는 인라인 인용이 제공되어 생성된 내용을 원문과 대조할 수 있다. 둘째, 기밀 문서를 외부에 노출시키지 않고도 AI 분석에 활용할 수 있다.
무료 플랜 기준 최대 50개, 유료 플랜 기준 최대 300개의 소스를 단일 노트북에 올릴 수 있다. PDF, Google Docs, 슬라이드, YouTube URL(공개 캡션 추출), MP3·WAV 오디오 파일까지 처리하며, PDF 내부의 차트와 그래프도 의미론적으로 해석하는 멀티모달 처리가 지원된다.
💡
최근 업데이트
이번 대규모 업데이트에서 Gemini 3.5 모델과 Google의 Antigravity 시스템이 통합되었다. Antigravity는 각 노트북에 클라우드 컴퓨팅 환경을 할당하여 Python 코드를 직접 실행할 수 있게 한다. 설문 데이터나 재무 스프레드시트를 올리면 외부 IDE 없이 추세 분석과 변수 간 상관 관계 계산이 가능하다. 분석 결과물은 PNG, SVG, CSV, JSON, Excel, PowerPoint 파일로 내보낼 수 있다.

02 — How It Works

Deep Research의 4단계 루프

Deep Research는 단순한 검색 증강 생성(RAG)과 다르다. 사용자 질의를 받아 즉시 답변을 생성하는 방식이 아니라, 연구 계획 수립 → 데이터 탐색 → 반복적 추론 → 합성 및 보고의 4단계를 독립적으로 순환하는 에이전틱 워크플로우다.
1.
계획 수립 (Research Planning). 프롬프트를 받으면 즉시 검색에 들어가지 않는다. 모델이 먼저 하위 연구 계획을 작성한다. 모호한 주제를 입력해도 모델 내부 지식을 바탕으로 원인, 결과, 시장 동향, 기술적 병목 등으로 주제를 세분화한다. 이 계획 개요를 사용자가 검토하고 관점을 추가하거나 배제를 지시할 수 있다.
2.
탐색 (Searching). 계획이 확정되면 비동기적으로 웹과 내부 문서를 탐색한다. Google Workspace(Gmail, Drive, Chat)와 연동이 허용된 경우, 외부 공개 데이터와 조직 내부의 이메일, 전략 문서, 회의록을 동시에 스캔하여 교차 참조한다.
3.
반복적 추론 (Iterative Reasoning). 수집된 데이터는 사고 패널(Thinking Panel)을 통해 처리된다. 출처 간 충돌이 발견되면 신뢰도를 스스로 평가하고, 초기 계획에서 누락된 데이터가 있으면 추가 검색을 실행한다. 이 자기 반성(Self-reflection) 과정이 반복된다.
4.
합성 및 보고 (Synthesis & Reporting). 모든 추론 결과가 구조화된 다장(Multi-page) 보고서로 합성된다. 모든 주장은 추적 가능한 인용구로 뒷받침된다.
빠른 질의(Fast Search)가 평균 13초 내외로 완료되는 반면, Deep Research는 복잡도에 따라 수십 분이 소요된다. 대신 수십 개 출처를 자율적으로 조합한 높은 신뢰도의 보고서가 결과물이다. Asynchronous Task Manager 아키텍처 덕분에 브라우저를 닫거나 다른 작업을 해도 연구는 클라우드에서 계속 진행되며, 완료 시 알림이 온다.

03 — Tool Selection

어떤 도구를 언제 써야 하는가

심층 연구를 수행하는 AI 에이전트는 NotebookLM에 국한되지 않는다. 도구 선택은 데이터의 기밀성 요구도, 실시간성, 학술적 엄밀성 기준으로 결정해야 한다. "가장 똑똑한 모델"을 찾기보다 과제 성격에 맞춰 교차 활용하는 게 현실적으로 더 효율적이다.
도구
핵심 메커니즘
최적 활용
한계
NotebookLM
업로드 문서 내에서만 작동 (최대 300개), 심층 교차 분석
기밀 문서 분석, 특정 소스 기반 학습 가이드, 보안이 중요한 독점 데이터
라이브 웹 검색 없음, 외부 문헌 자율 추가 불가
ChatGPT
Deep Research
동적 웹 검색, 30페이지+ 서사형 보고서 (15~30분 소요)
광범위 주제 탐색, 일반 비즈니스 동향 조사, 경쟁사 다각도 분석
월 $200 Pro 구독, 결과물 과부하 유발 가능
Claude
Deep Research
20만 토큰 컨텍스트, Projects로 연구 환경 유지, 5페이지 내외 압축 보고서
학술 연구 요약, 방대한 자료에서 핵심만 간결하게 추출
구독 모델에서도 메시지·속도 제한
Gemini
Deep Research
Workspace 통합, 200만 토큰, 멀티모달(이미지·영상) 분석
내부 데이터 + 외부 웹 결합 복합 실무, 시각 데이터 포함 리서치
포괄성 치중, 간결성 부족
Perplexity AI
실시간 웹 검색 + 인라인 인용, 답변 엔진에 가깝게 작동
즉각적 사실 확인, 특정 도메인 신속 정보 획득
다단계 대규모 연구 프로젝트 부적합
Elicit
1억 2,500만 건 학술 논문 DB 전용, 논문 리뷰 자동화
엄격한 학술 문헌 리뷰, peer-reviewed 기반 선행 연구 조사
학술 DB 외 사용 불가, 비즈니스 트렌드 분석 불가

04 — Context Engineering

프롬프트가 아니라 프로토콜

여기서 중요한 개념 구분이 있다. 프롬프트 엔지니어링은 AI에게 "무엇을 할지(What)"를 지시하는 것이다. 컨텍스트 엔지니어링(Context Engineering)은 AI가 "무엇을 알아야 하는지(What to Know)"를 설계하는 것이다. 단편적인 질문을 던지는 게 아니라, 모델이 올바른 판단을 내리기 위한 배경 정보 전체를 설계해 주는 작업이다.
실질적으로 효과 있는 프롬프트는 다음 네 요소를 명시적으로 담는다.

역할 (Role / Persona)

"이 문서를 요약해"가 아니라 "당신은 20년 경력의 시장 분석가이자 기술 전략가입니다"라고 정체성을 부여한다. 어떤 전문 용어 수준으로, 어떤 분석 렌즈로 접근해야 할지를 모델이 스스로 결정할 수 있게 된다.

작업 (Task)

추상적 질문 대신 핵심 목표를 구체적으로 좁힌다. "전고체 배터리 기술의 대량 생산을 가로막는 제조 공정상의 병목 현상을 2026~2030년 투입 비용 예측 관점에서 분석하십시오."

맥락과 제약 (Context & Constraints)

모델이 무관한 정보에 토큰을 낭비하지 않도록 통제선을 긋는다. "2024년 이전의 언론 기사와 일반 소비자 리뷰는 배제하고, 공급망 분석 관련 peer-reviewed 논문만 참조하십시오."

출력 형식 (Output Format)

"경영진용 1장 요약, 주요 경쟁사 간 기술 비교표, 양산 예상 타임라인 형태로 구조화하십시오." 형식을 미리 지정하면 후속 편집 작업이 줄어든다.
💡
지식 공백 탐지기 패턴
NotebookLM의 소스 그라운딩 능력을 역으로 활용하는 방식이다. "업로드된 소스들을 교차 검증하여 내가 제안한 방법론에서 누락된 전제 조건이나 모순점을 정확한 페이지 번호와 인용구를 포함하여 지적하라"고 요구하면, 모델이 분석의 약점을 찾아 스스로 보완하게 된다.

메타 프롬프팅

프롬프트를 작성하는 행위 자체를 AI에게 위임하는 방식이다. 거칠게 정리된 아이디어를 던지면 AI가 이를 분석하여 자신에게 최적화된 구조화된 프롬프트로 재작성해 준다. 먼저 AI에게 "이 연구의 목적이 무엇인가, 대상 독자는 누구인가, 어떤 소스 유형을 선호하는가, 정보 충돌 시 어떻게 처리할 것인가" 등을 역으로 질문하게 한 뒤 그 문답을 거쳐 프롬프트를 완성하는 구조다. 반복적인 수정 지시에 낭비되는 시간을 첫 번째 시도에서 줄일 수 있다.

05 — Chain-of-Thought

CoT 전략과 그 한계

단계별 사고(Chain-of-Thought, CoT)는 LLM에게 중간 추론 단계를 명시적으로 출력하게 하여 논리 오류를 줄이는 기법이다. 다단계 수학 연산이나 복합 논리 퍼즐처럼 순차적 추론이 필수인 과제에서 효과가 크다. LLM은 근본적으로 텍스트의 통계적 상관관계를 바탕으로 다음 단어를 예측하는 확률 모델이다. 즉각적인 답변을 강제하면 여러 단계의 논리적 조작을 단일 포워드 패스에 압축하려다 치명적인 계산 오류나 환각을 일으킨다.
전략
핵심 메커니즘
트레이드 오프
Zero-shot CoT
별도 예시 없이 프롬프트 끝에 "단계별로 생각해보자"를 추가
구현 간단, 토큰 비용 저렴. 이 문구 추가만으로 초등 수학 문제 정확도가 10.4% → 40.7%로 상승한 연구 결과가 있다.
Few-shot CoT
이상적인 논리 전개 과정이 담긴 문제-정답 쌍을 예시로 포함
의료 기록 분류, 재무 지표 분석 등 도메인 특화 작업에서 정확도 극대화. 단, 완벽한 예시 작성이 어렵고 입력 토큰 비용 상승.
Self-Consistency
동일 질문에 여러 CoT 경로를 병렬 생성 후 다수결로 답안 선택
수학 문제 정확도 74.4%까지 가능. API 비용과 지연 시간이 기하급수적으로 증가하는 단점.
Tree-of-Thoughts
매 결정 지점마다 여러 가능성을 탐색하고 평가하는 트리 구조
신약 후보 탐색, 장기 전략 수립 등 창의적 과제에 적합. 기존 대비 토큰 10~50배 이상 소모.
Tabular CoT
중간 추론 과정을 Markdown 표 형식(단계·근거·결론)으로 출력
가독성 향상, 에이전트 환경에서 로그 디버깅 용이. 에이전트 파이프라인 설계에 적합.
⚠️
주의: CoT가 역효과를 내는 경우
OpenAI o1이나 Gemini 2.0 Flash Thinking처럼 추론 토큰을 자체 소모하여 백그라운드에서 이미 CoT를 수행하도록 설계된 추론 전문 모델에는 프롬프트에 "단계별로 생각해라"를 추가하면 오히려 성능이 저하될 수 있다. 모델의 내장된 추론 프로세스를 불필요하게 복잡하게 만들기 때문이다.
또한 CoT는 파라미터가 충분히 큰 모델에서만 효과를 보이는 창발적 특성(Emergent behavior)이다. 소규모 모델에 적용하면 겉보기에 그럴싸하지만 논리적으로 붕괴된 텍스트를 장황하게 생성하는 역효과가 난다. 작업의 복잡도와 모델의 특성을 매칭하는 설계가 필요하다.

06 — Multi-Agent Design

콘텍스트 윈도우 과부하와 다중 에이전트 설계

단일 에이전트에게 연구 계획 수립, 웹 탐색, 메모리 저장, 보고를 모두 맡기면 콘텍스트 윈도우가 급격히 포화된다. 이 상태에서 모델은 이전 지시를 잊거나 탐색을 건너뛰고 결과를 꾸며낸다.
이를 해결하는 접근이 다중 에이전트 아키텍처(Multi-Agent Architecture)다. 전략적 사고와 연구 계획은 파라미터가 크고 추론에 특화된 Planner Agent에 맡기고, 검색어를 바탕으로 텍스트를 수집하는 반복 작업은 지연 시간이 짧고 비용이 낮은 Search Worker Agent에 위임한다. 작업자 에이전트에게는 전체 연구 맥락 대신 "순수 검색어"만 전달하므로 토큰 낭비가 줄고 시스템 신뢰성이 올라간다.
장기 실행 프로젝트에서 누적되는 검색 결과와 추론 로그는 벡터 스토어 기반 단기 메모리에 저장된다. 유사한 질문이 반복될 때는 새로운 검색 대신 RAG로 기존 결과를 끌어와 처리 속도와 API 비용을 최적화한다. 시스템 프롬프트에 현재 날짜를 동적으로 주입하여 모델이 "최근 동향"이나 "올해의 데이터"를 정확히 인지하도록 시간적 문맥을 보정하는 것도 이 레이어에서 처리된다.

Closing

결국 시스템 설계 역량의 문제

NotebookLM Deep Research가 보여주는 방향은 단일 프롬프트 최적화에서 시스템 설계로의 전환이다. 어떤 소스를 어떤 우선순위로 배치할 것인지, 어떤 역할과 제약을 줄 것인지, CoT를 적용할지 말지, 단일 에이전트로 충분한지 다중 구조가 필요한지 — 이 판단들이 결과의 품질을 결정한다.
도구는 계속 바뀌겠지만, 이 판단 구조 자체는 다른 에이전틱 AI 시스템에도 그대로 적용된다. 좋은 프롬프트를 쓰는 것과, AI가 작동하는 방식을 이해하고 시스템을 설계하는 것은 다른 종류의 역량이다.
BLOGGER
Subscribe to 'BLOGGER'
Subscribe to my site to be the first to receive notifications and emails about the latest updates, including new posts.
Join Slashpage and subscribe to 'BLOGGER'!
Subscribe
👍