PART 5 · Harness와 자기 개선

비계에서 자기 개선 시스템으로

Harness는 모델을 감싸는 껍데기가 아닙니다. AI 재귀적 자기 개선의 핵심 엔진이 되어가고 있습니다.

Recursive Self-Improvement

현재 자신의 지능을 사용하여 지능을 생성하는 메커니즘 자체를 개선할 수 있는 시스템

I. J. Good(1965)는 "초지능 기계"를 정의했습니다: 모든 지적 활동에서 인간을 능가하고 더 나은 기계를 설계하여 스스로를 개선할 수 있는 기계. Yudkowsky(2008)는 이를 "재귀적 자기 개선"(RSI)으로 정식화했습니다.
Lilian Weng
이 편의 모든 아이디어는 Lilian Weng의 블로그 글에서 왔습니다
제5편의 전체 프레임워크와 개념, 사례는 모두 Lilian Weng이 2026년 7월에 발표한 글 "Harness Engineering for Self-Improvement"에서 비롯되었습니다. 제가 여기서 한 일은 이를 강의에 맞게 다시 풀어낸 것뿐이며, 관점과 공로는 원저자에게 있습니다.

그는 제가 깊이 존경하는 선배 연구자로, AI 안전과 Agent 최전선에 관한 그의 글은 오랫동안 이 분야의 필독서로 여겨져 왔습니다. 그의 X(트위터) 팔로우를 적극 추천합니다. 이 챕터를 다 읽은 뒤에는 꼭 원문도 읽어보시길 권합니다.
RSI의 진화
1965 · Good
"초지능 기계": 더 나은 기계를 설계할 수 있는 기계. 이론적 구상.
2008 · Yudkowsky
"재귀적 자기 개선" 공식 제안: AI가 자신의 지능을 사용하여 지능을 생성하는 인지 메커니즘을 개선합니다.
2023–2024
Self-play, 합성 데이터, test-time training 등 초기 시도. 모델이 자체 학습 데이터를 개선하기 시작합니다.
2025–2026
Harness 엔지니어링이 RSI의 핵심 경로가 됩니다: 모델은 가중치를 직접 재작성하지 않고, 자신을 둘러싼 배포 시스템, 워크플로 및 컨텍스트 관리를 개선합니다.
Harness란 무엇인가?
Harness = 모델 주변의 모든 편성 시스템
Harness는 기반 모델을 둘러싼 런타임 시스템으로, 모델이 어떻게:

사고하고 계획하는지 · 도구를 호출하고 행동하는지 · 컨텍스트를 인식하고 관리하는지 · 결과물을 저장하는지 · 결과를 평가하는지를 결정합니다.

성공적인 AI 제품(예: Claude Code, Codex, Cursor)이 증명했습니다: Harness 레이어는 원시 모델 지능만큼 중요합니다. 평범한 모델에 뛰어난 Harness를 더하면 더 강력한 베어 모델보다 자주 앞섭니다.
Codex Agent Loop
단순화된 Codex Agent 루프: Agent가 도구를 호출하고 도구 응답이 다음 생성 라운드에 영향을 미칩니다. (출처: OpenAI)
왜 Harness가 근미래 RSI의 실질적 경로인가?
근미래 RSI를 위한 세 단계 예측
1. 모델은 자신의 가중치를 직접 재작성하지 않겠지만, 학습 파이프라인과 배포 시스템을 개선하여 다음 세대 모델을 더 강하게 만들 수 있습니다.

2. Harness 엔지니어링은 메타 방법론으로 나아갑니다: 개선의 대상이 답변 자체에서 더 나은 답변을 얻는 메커니즘으로 바뀝니다. Harness 자체가 최적화 목표가 됩니다.

3. 성숙한 Harness + 지능 모델 = 긍정적 피드백 루프: 더 나은 Harness가 더 강한 모델을 만들고, 더 강한 모델은 Harness를 과도하게 엔지니어링할 필요가 없게 합니다.
Prompt Engineering과의 유사점
우리는 이미 더 부드러운 버전을 봤습니다: 명령어 미세조정과 추론 능력이 향상됨에 따라 수동 Prompt 기법은 덜 핵심적이 됐지만, 목표·제약·컨텍스트·평가를 지정해야 하는 필요는 사라지지 않았습니다.

마찬가지로, 많은 Harness 개선이 결국 모델 행동으로 내재화되겠지만, 외부 컨텍스트 및 도구와의 인터페이스는 항상 존재할 것입니다.
핵심 관점: 재귀적 자기 개선은 모델 가중치를 직접 수정하는 것에서 시작할 필요가 없습니다. 더 현실적인 경로는 모델이 자신을 둘러싼 Harness 시스템(컨텍스트 관리, 워크플로, 도구 편성, 평가)을 개선하여 지속적으로 개선되는 플라이휠을 형성하게 하는 것입니다. 이것이 Harness Engineering for Self-Improvement의 핵심 논거입니다.