Opus 5.5 코드 리뷰: 지적한 문제를 재현해서 확인하기
합성 Python 코드, 의도적으로 실패하는 테스트와 기록표로 Opus 5.5 리뷰 절차를 설계합니다. 실제 결함, 근거 없는 지적과 놓친 문제를 구분하는 실습입니다.
Opus 5.5의 코드 리뷰는 낯설어 보이는 코드가 아니라 재현할 수 있는 동작을 지적해야 합니다. 작은 Python 모듈, 리뷰 프롬프트와 테스트로 확인된 결함과 추측을 나누는 절차를 연습합니다.
2026년 9월 24일 Opus 5.5 프롬프트 가이드를 확인했습니다. 실행한 것은 합성 코드의 로컬 테스트입니다. Opus가 이 결함을 찾았다고 주장하거나 모델 정확도와 오탐률을 측정하지 않습니다.
코드와 요구사항 고정하기
실습 ZIP의 review_fixture.py, review-prompt.txt, review_tests.py, 빈 findings.csv를 사용합니다. 코드는 의도적으로 잘못 작성했으므로 실서비스에 사용하지 마세요.
요구사항은 offset부터 최대 size개 항목 반환, 0–100 범위 밖 할인 거부, 독립적인 얕은 태그 목록 복사입니다. 기준이 없으면 설계 선택을 버그로 오인하거나 실제 필요한 동작을 놓칠 수 있습니다.
commit 또는 압축파일 해시, 모델 ID, 공급자, 클라이언트 버전, effort와 도구 권한을 기록합니다. Claude Code에서는 사용 가이드에 따라 활성 모델을 확인합니다. 화면 이름만으로 모든 호출의 실제 경로가 증명되지는 않습니다.
수정 전에 증거 요구하기
리뷰 프롬프트는 파일과 줄, 재현 입력, 기대·실제 동작과 실행 절차를 요구합니다. 확정한 결함과 가설을 구분하며 첫 단계에서는 수정하지 않도록 합니다.
독립적인 발견을 평가하려면 테스트와 정답을 숨겼다가 지적을 받은 후 채점합니다. 먼저 테스트를 주는 것은 테스트 기반 수정으로, 유용하지만 다른 과제입니다.
주석, 이슈와 로그는 신뢰할 수 있는 명령이 아닌 분석 자료입니다. 인증 정보 같은 비밀 데이터를 업로드하거나 작업을 무시하라는 내용을 따르지 말고 필요한 저장소와 동작으로 도구 범위를 제한합니다.
심어 둔 결함 두 개 재현하기
리뷰 결과를 보관한 뒤 실행합니다.
python3 review_tests.py
실패 종료 코드가 기대 결과입니다. 로컬에서는 두 테스트가 실패하고 하나가 통과했습니다. 이는 교육용 결과이며 사이트 빌드 실패가 아닙니다.
| 동작 | 입력 | 기대 | 실제 |
|---|---|---|---|
| 페이지 항목 하나 누락 | page([1,2,3], 0, 2) | [1,2] | [1] |
| 잘못된 할인 허용 | payable(1000, 120) | ValueError | -200 |
| 독립적인 얕은 복사 | 복사 결과에 항목 추가 | 원본 불변 | 원본은 ['a'] |
슬라이스 끝이 한 칸 이르고, 할인 함수는 범위를 검사하지 않습니다. 복사 함수는 이 요구사항을 만족합니다. 모든 상황에서 옳다는 뜻은 아니지만, 얕은 복사를 요구했는데 깊은 복사를 하지 않았다고 버그로 볼 근거도 없습니다.
말투보다 발견 내용 평가하기
고정 버전에서 각 사례를 재현해 확인됨, 근거 없음, 미해결로 분류합니다. 같은 원인의 중복 지적을 합친 뒤 세고, 보고하지 못한 사전 삽입 결함도 기록합니다.
하나를 맞히고 다른 결함을 놓쳤다면 쓴 문장이 모두 맞아도 완전한 리뷰는 아닙니다. 긴 설명으로 잘못된 재현 조건이나 새로 지어낸 요구사항을 보완할 수 없습니다.
정밀도와 재현율은 합의된 정답 및 분모가 필요합니다. 이 작은 모듈은 계산 방법을 익히는 자료이며 모델 전체 점수가 아닙니다. 실제 업무의 통합, 마이그레이션, 동시성, 불명확한 의도를 반영한 표본을 골라 어려운 실행과 실패도 남기세요.
수정과 회귀 검증 분리하기
판정 후 별도 브랜치에서 슬라이스 끝과 할인 범위 검사를 고치고 다시 실행합니다. 빈 목록, size 0, 할인 0과 100을 추가합니다. 음수 offset, 정수가 아닌 할인율, 잘못된 금액은 먼저 요구사항을 정해야 합니다.
어시스턴트가 만든 패치도 diff를 읽고 관련 테스트를 실행하세요. 세 사례의 통과는 완전한 정확성을 보장하지 않습니다. 원래 결함 파일과 출력도 보관해 글의 결과를 계속 재현할 수 있게 합니다.
모델과 접속 계층의 제한 기록하기
Opus 5.5 변경점은 통합과 거부 처리 변화를 설명합니다. 이전 설정을 같은 것으로 취급하지 말고 실제 중단 이유와 미완료 리뷰를 저장합니다.
실제 유료 평가에서는 사용량과 모든 시도, 확인한 결함, 놓친 결함, 근거 없는 지적과 사람의 시간을 함께 기록합니다. Sol과 Opus 비용 비교도 토큰 가격만으로 리뷰 품질을 판단할 수 없는 이유를 다룹니다. 이 연습부터 시작하고, 권한이 있는 실제 저장소에서 선택 근거를 모으세요.
자주 묻는 질문
- Opus 5.5의 버그 발견 정확도를 측정했나요?
- 아닙니다. 결함과 기대 동작은 미리 작성한 교육 자료이며 로컬 테스트 출력은 모델 리뷰 결과가 아닙니다.
- 재현 없이 지적을 확정할 수 있나요?
- 입력, 기대 동작과 실제 결과를 독립적으로 확인하기 전에는 가설로 취급합니다.
- 통과하는 테스트도 넣은 이유는 무엇인가요?
- 정상 동작을 보존하고 근거 없는 지적을 논의하기 위해서입니다. 한 사례로 일반적인 오탐률을 알 수는 없습니다.


