방방구석컴퍼니
← 이야기 목록
AI 자동화·워크플로우2026-10-01

CLAUDE.md 작성법, 늘릴 것은 규칙이 아니라 확인할 방법이다

CLAUDE.md 작성법을 고민한다면 규칙 문장보다 AI가 결과를 확인할 수단을 먼저 챙기는 편이 낫습니다. 오퍼스 5.5·소넷 5.5로 직접 돌린 켬·끔 실험과 앤트로픽 공식 문서로 이유를 정리했습니다.

방

방구석컴퍼니

혼자 일하는 사람 · 작업 기록

"클로드 코드 규칙 파일, CLAUDE.md라는 거 지워야 하나요?"

클로드 코드가 내장 지시문을 80% 지웠다는 소식이 나온 뒤, 이번 영상을 준비하며 제가 가장 먼저 답해야 했던 질문입니다. 제 답은 반쯤만 그렇다는 겁니다. 지울 것은 "확인해라" 같은 규칙 문장이고, 오히려 늘려야 하는 건 AI가 자기 결과를 확인할 수단이에요.

같은 과제를 확인 수단 없이 맡겼을 때 오퍼스 5.5는 75.2점, 수단을 쥐여 주자 90.6점이었습니다. 규칙 파일엔 한 글자도 손대지 않은 채로요. 규칙 파일을 늘릴지 지울지 아직 못 정한 분, AI의 "다 했습니다"를 믿어도 되는지 헷갈리는 분께 그 차이가 어디서 나왔는지 순서대로 보여 드리려고 합니다.

이 글은 클로드 코드 설치나 요금제 비교는 다루지 않습니다.

80%를 지운 건 내 규칙 파일이 아니다

앤트로픽은 2026년 7월 24일, 오퍼스 5와 함께 클로드 코드 시스템 프롬프트(모든 대화 맨 앞에 깔리는 기본 지시문)를 80% 넘게 지웠다고 밝혔습니다. 근거로 든 건 자사 코딩 평가에서 "측정 가능한 손실이 없었다"는 것이고, 성능이 올랐다는 말은 아니었어요.

사용자가 쓰는 규칙 파일은 이 기본 지시문과 다른 곳에 들어갑니다. 클로드 코드 메모리 문서에 따르면 규칙 파일은 시스템 프롬프트 뒤에 사용자 메시지로 따로 붙어요. 80%라는 숫자를 내 파일에 그대로 옮기면 안 되는 이유입니다.

그리고 5.5가 나온 뒤에 또 지웠다는 공식 기록은 제가 찾은 범위에선 없었습니다. 커뮤니티가 릴리스마다 재는 기록을 보면 오히려 순증이었어요.

지우라는 것은 '확인하라'는 문장이다

오퍼스 5용 공식 프롬프트 안내서에는 지워도 되는 문장이 구체적으로 나옵니다. 프롬프트에 "작업을 스스로 확인하라" 같은 지시가 있다면 빼라는 겁니다. 모델이 이미 알아서 제 작업을 점검하니까요.

여기서 많이들 한 단계를 건너뜁니다. 빼라는 건 확인하라는 문장이지, 확인할 수단이 아니에요. 브라우저를 열 도구도, 비교할 원본도 없으면 모델은 확인하고 싶어도 못 합니다.

확인 수단은 바깥에 둔다

오퍼스 5.5 공식 안내서는 여기서 더 나아갑니다. 글로만 끝난 답은 일이 끝났다는 증거가 아니라 보고로 다루라고 적어 두었어요. 끝났는지는 모델의 말이 아니라 바깥의 무언가로 확인하라는 뜻입니다.

클로드 코드의 창시자 보리스 체르니도 2026년 7월 스타트업 스쿨(와이콤비네이터 주최) 무대에서 같은 쪽을 짚었습니다. 조금 벅찬 일을 주고 스스로 확인할 방법을 같이 주라고, 그게 아마 가장 중요한데 사람들이 가장 못 하는 것이라고요.

수단을 쥐여 주자 75점이 90점이 됐다

저희가 직접 돌린 실험은 이렇습니다. 흐름도 화면 한 장을 보여 주고, 마지막 장면이 그 화면과 같아지는 5초 애니메이션을 웹 페이지 파일(HTML) 하나로 만들게 했어요. 한쪽엔 읽기·쓰기 도구만, 다른 쪽엔 저장된 화면을 6초 시점에 촬영해 원본과의 겹침을 0~100으로 매기는 검사기를 줬습니다. 끝나는 조건은 90점 이상 또는 확인 12번이었어요.

조건오퍼스 5.5소넷 5.5
확인 수단 없음75.2점, 53초75.4점, 50초
검사기 줌90.6점, 확인 3번90.2점, 확인 9번
걸린 시간(검사기)4분 7초20분 33초

두 모델 사이의 차이는 0.4점을 넘지 않았고, 수단이 있느냐에 따라 15점 안팎이 움직였습니다. 눈금으로 치면 빈 화면이 0, 원본 복사가 100이고, 원본을 가로로 60픽셀만 옮겨도 57.4까지 떨어집니다.

오퍼스 5.5 검사기 없이(위)와 검사기 주고(아래) — 원본, 결과, 차이 그림

위가 수단 없이, 아래가 검사기를 준 결과입니다. 맨 오른쪽은 차이를 밝기로 그린 그림이라 하얄수록 많이 다른 곳입니다. 위쪽에선 손글씨 메모가 하얗게 떠 있고 아래쪽은 거의 까맣습니다.

하지만 점수가 가장 많이 오른 곳은 배경이었다

오퍼스가 받은 점수를 차례로 적으면 75.5, 77.1, 90.6입니다. 가장 큰 상승(77.1→90.6) 때 손댄 것은 상자도 화살표도 아닌 배경 격자 줄이었어요.

이건 제 채점 방식의 허점이었습니다. 채점기가 바탕과 색이 다른 점은 모두 내용으로 쳤거든요. 검사기를 만들 때 저는 배경 무늬가 점수에 거의 안 걸릴 거라고 잘못 생각했어요. 오퍼스는 검사 결과를 보고 이 사실을 스스로 알아냈고, 가는 줄은 약 28픽셀, 굵은 줄은 약 140픽셀 간격으로 원본에 맞춰 다시 그렸습니다. 같은 길을 간 소넷도 "점수가 배경 밝기와 모눈 줄 위치에 매우 민감하다"고 보고했어요.

모눈 줄 부분 확대 — 원본 배경, 검사기 없이, 검사기 주고

소넷 5.5 검사기 없이(위)와 검사기 주고(아래) — 원본, 결과, 차이 그림

소넷의 90.2는 합격선을 고작 0.2 넘긴 점수입니다. 그런데 아래 줄 가운데 화면을 보면 손글씨 메모가 원본의 손글씨 서체가 아니라 컴퓨터 기본 글씨체예요. 합격 판정과 사람 눈의 판정이 여기서 엇갈렸습니다.

재는 것이 곧 결과가 된다

여기서 원리 하나가 나옵니다. 확인 수단을 주면 AI는 나아지지만, 그 수단이 점수를 많이 주는 부분부터 고칩니다. 검사기가 배경을 세면 배경을 고치고, 서체를 안 세면 서체는 그대로 둬요.

그래서 저는 확인 방법 옆에 채점이 놓치는 곳을 1~3군데 적어 둡니다. 이번 과제였다면 "손글씨 서체"와 "메모 위치"였을 거예요. 보리스도 같은 강연 끝부분에서 화면이 한 픽셀 어긋난 정도를 찾아내는 데는 클로드가 아직 부족하다고 인정했습니다.

규칙을 켜도 문서는 열리지 않았다

규칙 파일 쪽도 같은 날 따로 재 봤습니다. 저희 레포의 규칙(규칙 파일·스킬·자동 실행 설정)을 켠 쪽과 빈 폴더에서 돌린 쪽으로 같은 60초 쇼츠 대본을 쓰게 했어요.

실행사전 적재 토큰("OK" 한마디 기준)대본 검사기 하드 위반
소넷 규칙 켬 / 끔34,770 / 21,7500 / 1
오퍼스 규칙 켬 / 끔35,902 / 22,2801 / 1

켠 쪽 두 실행 모두 안내 문서를 아예 펼치지 않았습니다. 읽고, 쓰고, 끝났어요. 품질은 사실상 같았고, 남은 차이는 호출 한 번마다 규칙 묶음 몫으로 약 13,000토큰이 먼저 들어간다는 점이었습니다. 실제로 글을 고쳐 준 건 규칙 문서가 아니라 사후에 돌린 대본 검사기였어요. 첫 번째 실험과 같은 결론입니다.

규칙 파일이 비싼 이유는 매번 통째로 실리기 때문이다

메모리 문서를 보면 규칙 파일은 대화를 새로 열 때마다 전부 다시 들어갑니다. 파일 하나는 200줄을 넘기지 말라는 게 문서의 권고예요. 길어지면 문맥을 더 먹고 덜 지킨다고요.

외부 연구도 같은 방향입니다. 스위스 취리히 연방공대 연구진의 이런 안내 파일 평가 논문은 안내 파일을 넣어 줘도 과제 성공률이 대체로 오르지 않았고, AI를 돌리는 비용은 평균 20% 넘게 늘었다고 보고했어요.

한 줄은 두 번째 실수에서 되살린다

그렇다면 언제 적느냐. 보리스는 반년마다 규칙 파일과 스킬, 자동 실행 설정까지 지워 보고, 같은 데서 반복해서 걸릴 때만 다시 넣으라고 했습니다. 공식 문서의 기준도 같아요. 클로드가 같은 실수를 두 번째 할 때 추가하라고 적혀 있습니다.

한 번 틀린 건 넘어가고, 되풀이될 때 비로소 적습니다. 미리 걱정해서 넣은 줄은 매번 읽히는 비용만 남겨요.

내가 틀릴 수 있는 곳

  • 두 실험 모두 조건마다 1회씩 돌렸습니다. 편차를 재지 않았으니 경향으로만 읽어야 합니다.
  • 점수는 제가 만든 겹침 점수입니다. 모눈 줄 사례가 보여 주듯 이 척도 자체에 허점이 있어요.
  • 규칙 실험은 짧은 대본 한 종류였습니다. 스킬을 부르는 긴 작업에서 규칙 파일의 효과는 재지 않았어요.
  • 요금·정책 정보는 2026-09-29 시점이고 자주 바뀝니다.

사례를 원리로 접으면 다섯 줄이다

  • "브라우저에서 열어 보지 못했다"던 보고는 → 확인 수단이 없으면 일이 보고로 끝난다는 증거가 됐고
  • 검사기를 주자 오른 15점은 → 문장보다 수단이 결과를 바꾼다는 근거가 됐고
  • 모눈 줄과 손글씨는 → 수단이 재는 것만 좋아진다는 경고가 됐고
  • 열리지 않은 규칙 문서는 → 매번 실리는 줄은 비용이라는 계산이 됐습니다.
  1. 규칙 파일에서 "확인해라" 같은 문장은 지운다.
  2. 대신 일마다 확인 수단(열어 보기·캡처 비교·검사기)을 붙인다.
  3. 그 수단이 안 재는 곳을 사람이 볼 곳으로 1~3개 적는다.
  4. 규칙 파일은 200줄 아래로, 두 번째 실수에서만 한 줄 늘린다.
  5. 반년에 한 번 지워 보고, 다시 걸리는 것만 되살린다.

처음 질문으로 돌아가면, 75점에서 90점으로 간 건 규칙 파일을 지워서도 늘려서도 아니었습니다. 확인할 방법 하나를 준 덕분이었어요. 지금 규칙 파일에서 "확인해라"로 끝나는 줄 하나를 찾아, 그 일에 줄 수 있는 확인 수단으로 바꿔 보세요.

실험 과정은 9분 14초 영상에 담았고, 네 줄 틀·지시문·검사기는 카카오 오픈톡 '방구석모각코'(바로 가기) 공지 글에서 받으실 수 있습니다. 지금 쓰시는 규칙 파일은 몇 줄인가요?

새 글 알림

이런 작업 기록, 계속 받아보실래요?

네이버 블로그 이웃추가하면 새 글이 피드로 바로 떠요. 광고 없이 진짜 이야기만.