결과를 못 낸 다섯 번의 실험
설치가 된다는 사실과 우리 언어를 검사할 수 있다는 사실은 다른 이야기였다.
사용한 모델과 범위2026-08-02 기준 macOS 로컬 설치와 로그인 없는 공개 화면만 확인했고, 외부 모델 호출은 DeepL 대조용 격리 Codex 기준선 한 건뿐이다.
근거
편집부가 직접 쓴 실험기, 공개 경험을 묶은 주제별 후기, 조건과 한계를 남긴 실험 기록을 서로 섞지 않고 나눠 둡니다.
한 편마다 어떤 모델을 언제 썼는지, 무엇이 안 됐는지까지 함께 적었습니다.
설치가 된다는 사실과 우리 언어를 검사할 수 있다는 사실은 다른 이야기였다.
사용한 모델과 범위2026-08-02 기준 macOS 로컬 설치와 로그인 없는 공개 화면만 확인했고, 외부 모델 호출은 DeepL 대조용 격리 Codex 기준선 한 건뿐이다.
원문 전체 재검사보다 상태 요약과 최근 회차만 넘기는 쪽이 안정적으로 끝났다.
사용한 모델과 범위2026-08-03 기준 Claude Code Sonnet 한 호스트에서 합성 10화를 돌린 고정 시점 결과다.
위험은 크게 줄었지만 짧은 한국어 요청을 확실히 이기지는 못했다.
사용한 모델과 범위2026-08-03 기준 생성은 Claude Code 2.1.220 Sonnet high, 블라인드 판정은 Codex CLI 0.146.0 GPT-5.5로 돌린 결과다.
전용 스킬 세 개 중 어느 것도 무도구 기준선보다 오류를 더 찾지 못했다.
사용한 모델과 범위2026-08-03 기준 Codex CLI gpt-5.5 high로 조건마다 독립 세션 3회씩, 총 12회를 돌린 결과다.
세 도구 모두 첫 결과에 도달했지만, 세 번 다 안내에 없는 단계에서 막혔다.
사용한 모델과 범위2026-08-03 기준 macOS에서 설치, 첫 실행, 복구, 제거만 확인했고 외부 AI 모델 호출은 0회다.
이번 표본에서 이긴 쪽은 없었고, 맡기는 작업에 따라 갈렸다.
사용한 모델과 범위2026-08-03 기준 Codex CLI 0.146.0 gpt-5.5 high(ChatGPT 로그인)와 Claude Code 2.1.220 Sonnet high(claude.ai Max 로그인) 결과다.