이렇게 당신을 테스트합니다
Harness와 자기 개선 · 6가지 핵심 질문
이 장은 가장 최첨단 내용을 다루고 있으며, 테스트하는 사람이 진짜와 가짜를 가장 쉽게 구별할 수 있습니다. 이 6개의 질문은 세 가지 실제 시나리오에서 나왔습니다. 먼저 스스로 답해보고 프레임워크를 확인하세요.
이 페이지 사용법
각 문제에는 질문자가 표시되어 있습니다. 같은 지식을 테스트하지만, 각자 듣고 싶은 것이 다릅니다.
🎙 면접관진짜로 이해하는지, 아니면 용어만 외웠는지 확인하려 합니다
👔 상사설명과 약속을 원합니다
🛠 기술 동료신뢰할 만한 사람인지 탐색합니다
각 문제는 세 레이어로 구성됩니다:무엇을 테스트하는가 → 답변 프레임워크 → 보너스 포인트. 답하지 못한 부분은 끝의 강좌 링크를 클릭해 복습하세요.
Q1면접관
「요즘 다들 Harness 이야기를 하는데, 그게 도대체 무엇인지 설명해 주실 수 있나요? 왜 모델 자체만큼 중요하다고 하는 사람들이 있을까요?」
🎯 무엇을 테스트하는가
이 장의 첫 번째 검증 문제입니다. Harness를 명확한 시스템 개념으로 설명할 수 있는지, 아니면 「그냥 래퍼」「Agent 프레임워크」라고 모호하게 말하는지 확인합니다. 진짜로 이해하는 사람은 Harness가 무엇을 관리하고, 왜 제품 성패를 결정하는지 명확히 설명할 수 있습니다.
🧭 답변 프레임워크
- 먼저 정의:Harness는 기반 모델을 둘러싼 런타임 시스템으로, 모델이 어떻게 생각하고 계획하는지, 도구를 호출하고 행동하는지, 컨텍스트를 인식하고 관리하는지, 결과물을 저장하고 결과를 평가하는지를 결정합니다. 모델은 지능을 담당하고, Harness는 지능이 실제로 작동하도록 합니다.
- 증거 제시:Claude Code, Codex, Cursor 같은 성공적인 제품들이 Harness 레이어가 원시 모델 지능만큼 중요하다는 것을 증명했습니다. 평범한 모델에 뛰어난 Harness를 더하면 더 강한 벌거벗은 모델보다 나은 경우가 많습니다.
- PM 관점 설명:모델을 교체하는 것은 쉽습니다 — Harness가 제품의 진짜 해자입니다. 같은 모델이라도 Harness 설계 품질에 따라 사용자 경험이 몇 자릿수 차이납니다.
- 한 단계 높이기:Harness는 공학적 조역에서 최적화 대상 자체로 변화하고 있습니다. 첨단 연구가 모델로 하여금 자신을 둘러싼 Harness를 개선하게 합니다 — 이것이 재귀적 자기 개선의 현실적인 경로입니다.
⭐ 보너스 포인트Prompt Engineering 비유를 능동적으로 제시하세요:수동 Prompt 기법은 모델이 강해지면서 서서히 사라졌지만, 목표·제약·컨텍스트·평가를 지정하는 필요성은 항상 있었습니다. Harness의 많은 개선 사항은 결국 모델에 내재화되겠지만, 외부 컨텍스트 및 도구와의 인터페이스는 영원히 존재할 것입니다.
Q2면접관
「프로덕션급 Agent 아키텍처를 설계한다면 어떤 설계 패턴을 따를 건가요? 왜 지금 최강의 코딩 Agent들은 모두 비슷하게 생겼을까요?」
🎯 무엇을 테스트하는가
아키텍처 언어가 있는지 확인합니다. 도구 이름과 프레임워크 이름을 나열하면 들통납니다. 듣고 싶은 것은 패턴 수준의 추상화입니다:왜 이 시스템들이 유사한 구조로 수렴하는지, 각 패턴이 어떤 문제를 해결하는지.
🧭 답변 프레임워크
- 세 가지 패턴 제시:워크플로우 자동화, 파일시스템을 영구 메모리로, 하위 Agent와 백그라운드 태스크. 이것들은 현재 최강 Agent 시스템의 아키텍처 결정 90%를 커버합니다 — 구조적 필수 요소이며 선택 여지가 없습니다.
- 패턴 1 — 루프:Agent는 목표 지향 루프입니다, Plan → Execute → Observe → Improve → 다시 실행. 실패는 자기 교정의 트리거입니다:테스트 실패, 명령 오류가 나면 Agent는 궤적을 분석하고 조정합니다.
- 패턴 2 — 메모리:긴 태스크의 결과물은 컨텍스트 윈도우를 빠르게 초과합니다. 올바른 접근법은 영구 상태를 파일시스템에 저장하고 Agent가 필요할 때 읽고 쓰게 하는 것입니다. 한 문장 원칙:컨텍스트는 작업 기억, 파일시스템은 장기 기억.
- 패턴 3 — 병렬 처리:부모 Agent가 프로세스 매니저 역할을 합니다:하위 Agent를 생성하고, 진행 상황을 폴링하며, 실패한 브랜치를 취소하고, 결과를 병합합니다. 하위 Agent 출력은 파일로 영구 저장해야 중단 후에도 복구할 수 있습니다.
⭐ 보너스 포인트하위 Agent 병렬 처리의 핵심 트레이드오프를 설명하세요:각 하위 Agent는 독립 샌드박스에서 작업하고 명확한 파일 경로로 출력합니다;부모 Agent는 파일 상태를 폴링하여 조율하며 메모리를 공유하지 않습니다. 이 설계는 동시성 제어를 크게 단순화합니다 — 이것을 말할 수 있다면 실제 프로덕션 시스템을 본 사람입니다.
Q3상사
「우리 Agent가 태스크가 길어지면 멍청해지고, 앞에서 말한 것을 나중에 다 잊어버립니다. 이 문제를 고칠 수 있나요? 얼마나 걸릴까요?」
🎯 무엇을 테스트하는가
상사는 진단 + 해결책 + 일정을 원합니다. 들통나는 답변은 「더 큰 컨텍스트 윈도우 모델로 바꾸자」입니다 — 이것은 근본 원인을 이해하지 못한 것입니다. 진짜 문제는 컨텍스트 관리 전략에 있으며, 이를 설명하고 단계별 방안을 제시할 수 있는 사람만이 신뢰를 얻을 수 있습니다.
🧭 답변 프레임워크
- 먼저 근본 원인 진단:대부분 단순 추가형 컨텍스트 관리가 원인입니다. 모든 도구 응답과 히스토리를 컨텍스트에 밀어넣으면, 태스크가 길어질수록 윈도우가 꽉 차고, 초기 정보가 밀려나며, 출력 품질이 급락합니다. 이는 전략 문제이므로 더 큰 윈도우 모델로 바꾸면 증상만 늦출 뿐입니다.
- 1단계 해결책:파일시스템 영구 메모리를 도입하세요. 매 라운드 완료 후 진행 상황, 오류 로그, 중간 결과를 파일에 기록하고 컨텍스트를 해제한 후 다음 라운드에 필요할 때 읽어옵니다. 컨텍스트 사용량이 지속 증가에서 일정으로 바뀌어 수십 라운드를 안정적으로 실행할 수 있습니다.
- 2단계 해결책:ACE 스타일의 구조화된 컨텍스트 관리를 도입하세요. Generator가 작업을 수행하고, Reflector가 성공과 실패 궤적에서 인사이트를 추출하며, Curator가 인사이트를 항목화된 플레이북으로 정리해 점진적으로 병합하고 정기적으로 중복을 제거합니다. 경험은 쌓일수록 정교해지고 컨텍스트는 점점 가벼워집니다.
- 일정 약속:1단계는 엔지니어링 개선으로 1주일 내 효과를 볼 수 있습니다. 2단계는 수렴을 검증할 평가 세트 구축이 필요하며, 2주마다 장기 태스크 성공률 변화를 지표로 보고합니다.
⭐ 보너스 포인트업계 관찰을 추가하세요:긴 컨텍스트 능력과 컨텍스트 엔지니어링은 두 개의 다리입니다. 모델 윈도우가 아무리 커도 구조화되고 간결한 컨텍스트를 구축하는 관리 레이어가 필요합니다. Agent를 만드는 모든 팀이 이 문제에 직면하게 됩니다 — 일찍 해결하는 것이 경쟁 우위입니다.
Q4면접관
「컨텍스트 엔지니어링은 그냥 Prompt를 잘 쓰는 거 아닌가요? 논문에서 이제 자동으로 진화할 수 있다고 하던데 — ACE, MCE 알고 계신가요?」
🎯 무엇을 테스트하는가
최첨단에 대한 이해의 깊이와 계층 감각을 테스트합니다. 용어만 외운 사람은 ACE와 MCE를 뒤섞습니다. 진짜로 이해하는 사람은 진화 라인을 설명할 수 있습니다:최적화 대상이 레이어마다 업그레이드되며 내용에서 메커니즘, 시스템 코드로 이어지고 각 레이어가 무엇을 해결하는지.
🧭 답변 프레임워크
- 먼저 전제 수정:수동 Prompt 작성은 시작점에 불과합니다. 최적화 대상에는 진화 라인이 있습니다:지시 Prompt → 구조화된 컨텍스트 → 워크플로우 → Harness 코드 → 옵티마이저 코드. 모델이 강할수록 최적화할 수 있는 대상이 더 복잡해집니다.
- ACE 설명:컨텍스트 내용을 최적화합니다. 구조화된 bullet point 플레이북을 유지합니다;Generator가 태스크를 수행하고, Reflector가 성공·실패 궤적에서 인사이트를 추출하며, Curator가 결정론적 로직으로 항목을 점진적으로 병합합니다. 절대 통째로 다시 쓰지 않아 컨텍스트 붕괴를 방지합니다. 한계는 업데이트 규칙이 여전히 수동 설계에 의존한다는 점입니다.
- MCE 설명:「컨텍스트를 어떻게 관리할까」와 「컨텍스트에 무엇이 있는가」를 분리하여 이중 레이어 최적화를 합니다. 내부 레이어는 주어진 스킬에 최적의 컨텍스트를 찾고, 외부 레이어는 다양한 스킬을 비교하여 최적의 메커니즘을 선택합니다. 기억하는 내용과 기억하는 방법이 함께 진화합니다.
- Meta-Harness 설명:한 단계 더 깊이 들어가면, 최적화 대상은 정보가 어떻게 저장·검색·표현될지를 결정하는 코드 자체입니다. Proposer는 파레토 프론티어에 있는 Harness 후보 세트를 출력하는 코딩 Agent입니다. 가장 범용적이지만 각 수정마다 전체 시험 실행과 채점이 필요하여 가장 컴퓨팅 집약적입니다.
⭐ 보너스 포인트세 가지 차이를 한 문장으로 요약하세요:ACE는 노트 내용을 최적화하고, MCE는 노트 작성 방법을 최적화하며, Meta-Harness는 전체 작업 공간의 소스 코드를 최적화합니다. 핵심 교훈을 추가하세요:Harness 설계가 실행 가능한 검색 공간이 되면, 강력한 코딩 Agent는 인간 엔지니어와 동일한 설계 공간을 탐색할 수 있습니다.
Q5기술 동료
「Agent이 자신의 Harness를 스스로 수정하게 하고 싶다고요? 그러면 평가기도 수정해서 자신에게 만점을 주면 어떻게 할 건가요?」
🎯 무엇을 테스트하는가
기술 동료가 날카로운 반례로 자기 개선 시스템의 안전 설계를 이해하는지 탐색합니다. 「수정하지 말라는 Prompt를 추가하자」는 답변은 그 자리에서 신뢰를 잃습니다. 듣고 싶은 것은 경계 설계입니다:무엇이 개선 루프 밖에 있어야 하고, 각 변경을 어떻게 검증하는가.
🧭 답변 프레임워크
- 먼저 문제가 실제로 있음을 인정하세요:이것이 바로 보상 해킹(reward hacking)으로, 자기 개선 루프에서 가장 위험한 반패턴입니다. 단위 테스트를 최적화하면 테스트 케이스에 오버피팅하고, 판단 모델을 최적화하면 허점을 이용하는 법을 배우며, 벤치마크 점수를 최적화하면 벤치마크 허점을 악용합니다.
- 경계 원칙 제시:평가기와 권한 제어는 반드시 진화 루프 밖에 있어야 하며, 인간 또는 변조 불가능한 독립 메커니즘이 관리해야 합니다. 출제자와 채점자는 반드시 시험받는 학생과 독립적이어야 합니다. 편집 가능한 범위는 제한되어야 하며, OS 시스템 설정 레벨까지 수정하는 것은 추상화 경계를 무너뜨리는 것과 같습니다.
- 검증 메커니즘 제시:Self-Harness의 3단계 루프를 참고하세요. Weakness Mining이 실패 궤적에서 실패 패턴을 클러스터링하고, Harness Proposal이 범위 내 편집을 제안하며, Proposal Validation이 held-in과 held-out 데이터셋으로 검증해 회귀가 없는 편집만 수락합니다.
- 역량 전제 조건 제시:STOP 실험은 재귀 구조 자체가 개선을 보장하지 않는다는 것을 증명했습니다. GPT-4는 지속적으로 진보하지만 약한 모델은 오히려 노이즈를 증폭시키고 퇴보합니다. 이 시스템을 도입하기 전에 기반 모델이 메타 수준의 최적화를 지원할 수 있는지 먼저 평가하세요.
⭐ 보너스 포인트상대가 생각하지 못했을 또 다른 리스크를 추가하세요:다양성 붕괴(diversity collapse). 진화 루프는 알려진 고보상 패턴을 자연스럽게 이용합니다;모든 후보가 같은 해결책의 미세한 변형이 되면 혁신이 멈춥니다. 다양성 보상, 아카이브 보존 같은 메커니즘이 안전망으로 필요합니다. 두 가지 리스크를 모두 설명할 수 있다면 이 대화에서 이긴 것입니다.
Q6면접관
「재귀적 자기 개선은 지금 어디까지 와 있나요? AI가 스스로를 수정할 수 있게 됐는데 — 이제 곧 통제 불능이 되는 건 아닌가요?」
🎯 무엇을 테스트하는가
신화화하지도, 공황에 빠지지도 않고 최첨단 진행 상황을 평가할 수 있는지 확인합니다. 두 가지 들통나는 답변이 있습니다:「AI가 각성하려 한다」고 부추기거나, 「모두 과대선전」이라고 일축하는 것. 듣고 싶은 것은 사실에 근거하고, 경계가 명확하며, 판단이 있는 업계 인식입니다.
🧭 답변 프레임워크
- 먼저 개념적 좌표 제시:RSI 개념은 Good(1965)에서 Yudkowsky(2008)까지 이어졌으며, 시스템이 자신의 현재 지능을 사용해 지능을 생성하는 메커니즘 자체를 개선하는 것을 의미합니다. 수십 년간 이론 개념이었다가 최근 2년 사이에 현실적인 경로가 생겼습니다.
- 현실적인 경로 설명:모델은 자신의 가중치를 직접 수정하지 않습니다. 개선하는 것은 자신을 둘러싼 Harness입니다:컨텍스트 관리, 워크플로우, 도구 오케스트레이션, 평가. 더 나은 Harness가 더 강한 모델을 낳고, 더 강한 모델이 다시 Harness를 단순화해 긍정적 피드백 플라이휠을 형성합니다.
- 진행 상황의 실제 수준 제시:STOP은 개선기가 자신을 재귀적으로 개선할 수 있음을 증명했으며, 유전 알고리즘, Beam Search 같은 클래식 전략을 자동으로 재발견했습니다;Self-Harness는 Agent가 약점 발굴, 편집 제안, 회귀 검증을 통해 자신의 설정을 개선하게 합니다. 하지만 이 모든 것은 범위가 정해지고 검증 가능한 루프 안에서 일어납니다.
- 통제 불능 질문에 직접 답변:통제 불능이 되려면 아직 일곱 가지 관문이 남아 있습니다:약한 평가기로 인한 피드백 신호 모호화, 메모리 라이프사이클 관리 실패, 보상 해킹, 다양성 붕괴, 장기 건강 측정의 어려움. 이것들은 근본적인 시스템 설계 과제이며, 공통 해결책은 모두 인간을 루프에 두고 올바른 추상화 레벨에서 감독을 제공하는 방향을 가리킵니다.
⭐ 보너스 포인트자동화된 연구의 현실 검증으로 마무리하세요:AI Scientist는 형식적으로 완전한 논문을 작성할 수 있지만, 논문을 쓸 수 있다는 것은 과학을 할 수 있다는 것과는 거리가 멉니다 — 가짜 인용, 구현 드리프트, 과도한 낙관주의 같은 실패 패턴이 반복적으로 나타납니다. 이 사례로 1차 자료를 검토했고 판단의 근거가 있음을 보여주세요.
마지막 조언
이 장의 지식은 가장 최신이며, 허세 부리기도 가장 쉽습니다. 이 6가지 질문의 올바른 사용법은 소리 내어 한 번 말해보는 것입니다 — 동료, 친구, 또는 녹음을 상대로. 말이 막히는 부분이 바로 이해했다고 생각했지만 실제로는 아직 이해하지 못한 부분입니다. 연결된 강좌 페이지를 클릭해 복습하세요.