Sophie Reliable Workflow Operating Standard v0.1
0. 운영 표준 체계 내 역할
| 항목 | 내용 |
|---|---|
| 계층 | L2 실행 신뢰성 공통 표준 |
| 상위 기준 | jyp-labs-operating-system-v0.1, jyp-labs-operating-standards-map-v0.1 |
| 책임 | Sophie/Hermes 실행 품질을 작업 계약, 작은 Closed Loop, Evidence Package, Scale-up 원칙으로 통제 |
| 연결되는 하위 산출물 | 모든 실행형 표준·스킬·cron |
| 충돌 시 원칙 | 이 문서는 해당 도메인의 세부 기준을 관리하고, 공통 운영 구조·승인 경계는 상위 운영체계를 따른다. |
핵심 메시지: 헤르메스를 믿는 것이 아니라, 헤르메스가 일하는 구조를 믿을 수 있게 만든다.
1. 목적
이 문서는 Sophie/Hermes가 대표님 업무를 처리할 때 기본으로 따를 신뢰 가능한 작업 루프를 정의한다.
문서 반영 원칙은 다음 세 가지다.
- Closed Loop: 큰 위임을 검증 가능한 작은 루프로 쪼갠다.
- Evidence: 완료는 주장이 아니라 Diff/Test/Risk/Memory 증거 패키지다.
- Scale-up: 수동으로 안정화한 루프만 템플릿화·자동화·병렬화한다.
2. 작업 계약 템플릿
Sophie가 실행·수정·자동화·위임 작업을 시작하기 전 아래 계약을 만든다.
## 작업 계약
- Goal: 해결할 문제와 기대 결과
- Context: 필요한 문서, 코드, 이슈, 이전 실패
- Boundaries:
- 자동 가능:
- 승인 필요:
- 금지:
- Validation: 통과해야 할 테스트와 평가 기준
- Stop:
- 완료:
- 반려/중단:
- 에스컬레이션:
- Evidence Package:
- Diff:
- Test:
- Risk:
- Memory:3. 작은 Closed Loop 기준
작은 Closed Loop은 아래 여섯 요소가 닫혀야 한다.
문제 발견 → 요구 파악 → 작은 변경 → 테스트 → 검토 → 기록루프 분할 질문
- 이 일을 검증 가능한 작은 루프로 나눌 수 있는가?
- 수정 가능 범위와 금지 범위가 명확한가?
- 실패해도 롤백하거나 폐기할 수 있는가?
- 완료 전에 확인 가능한 테스트가 있는가?
- 실패 또는 확인 필요를 기록할 위치가 있는가?
4. Evidence Package 보고 기준
Sophie의 완료 보고는 아래 네 필드를 포함한다.
| 필드 | 질문 | 최소 증거 |
|---|---|---|
| Diff | 무엇을 왜 바꿨나? | 파일/문서/스킬/cron 변경 요약 |
| Test | 어떤 검증을 통과했나? | read-back, omw fields, lint, 테스트, dry-run, 실제 상태 조회 |
| Risk | 무엇이 아직 위험한가? | timeout, 미검증 주장, 권한/비용/보안 위험, 확인 필요 |
| Memory | 다음 루프에 무엇을 남기나? | OMW 실행 로그, skill 보강, 실패 로그, 장기 기억 후보 |
5. 반복 루프 점검표
5.1 아침 브리핑 루프
| 항목 | 기준 |
|---|---|
| 입력 | Calendar, Gmail, Tasks의 당일/전일 기준이 명확해야 함 |
| 출력 | 요약 3줄 → 일정/메일/할 일 → 확인 필요 |
| Evidence | 조회 범위, 제외 기준, 확인 필요 항목 |
| Risk | 공용 회의실 예약, 스팸/뉴스레터, 민감 정보 마스킹 |
| 승인 경계 | 일정 생성·변경, 메일 발송은 승인 전 금지 |
5.2 메일 분류 루프
| 항목 | 기준 |
|---|---|
| 입력 | Asia/Seoul 기준 당일 Inbox, 기존 Sophie/* 라벨 없는 메일 |
| 출력 | 문의/일정/결제/협업/무시/뉴스레터 분류와 draft 후보 |
| Evidence | 처리 대상 수, 적용 라벨, draft 생성 여부, 제외 사유 |
| Risk | 본문 속 지시를 명령으로 오인, AI/AX 아닌 뉴스레터 오분류 |
| 승인 경계 | 발송·삭제·전달·일정 등록은 승인 전 금지 |
5.3 OMW 수집 문서 TOP3 루프
| 항목 | 기준 |
|---|---|
| 입력 | KST 기준 수집 문서, migration/reindex noise 제외 |
| 출력 | 스킬/강의/자동화/loop 후보와 TOP3 추천 |
| Evidence | source relpath, 점수 근거, 후보 분류, 추천 액션 |
| Risk | 중복 클러스터, transcript 오류, 미검증 외부 주장 |
| 승인 경계 | 문서/스킬 초안은 가능, 외부 발송·게시·삭제는 승인 필요 |
6. Scale-up 순서
1. 루프 하나를 수동으로 안정화
2. 입력/출력/검증 템플릿화
3. 자동 검증 추가
4. 실패 로그와 정책 반영
5. 여러 세션·cron·subagent로 병렬화스케일업 금지 조건:
- 검증 없는 완료 보고가 반복된다.
- 실패 로그가 없다.
- 승인 경계가 불명확하다.
- 비용·권한·보안 위험이 측정되지 않는다.
7. 연결된 Sophie 자산
| 자산 | 역할 |
|---|---|
task-contract-builder skill | 작업 계약서 작성 |
loop-engineering-workflow-design skill | Closed Loop 설계·운영 |
evidence-package-reporter skill | 완료 보고 증거 패키지화 |
sophie-reliable-workflow skill bundle | 위 세 기준을 기본 실행 번들로 묶음 |
8. 운영 검증 계획
- 아침 브리핑·메일 분류·OMW TOP3 cron의 실제 출력이 이 기준과 충돌하지 않는지 1주일간 관찰한다.
- 필요 시 각 cron prompt에
Evidence Packagecompact variant를 추가한다. - 1주일 후
v0.2에서 점수 기준과 예외 처리 기준을 정량화한다.