1라운드의 얼굴은 다듬어지지 않고 교체된다 — 인물 시즌 93편 챔피언 혈통 추적

칼라톤 AI 인물 생성 시즌은 이런 모양으로 돌아간다. 시즌이 열리면 1라운드에서 인물을 하나 그린다. 그리고 열네 번의 라운드 동안 그 그림을 손봐 가며 주제에 더 가깝게 만든다. 시즌 리포트 맨 위에는 '대상 인물'이라는 칸이 있고, 거기에 이름과 한 줄 설명, 그리고 시즌을 대표하는 얼굴 한 장이 걸린다.

그 얼굴은 1라운드에서 그린 그림을 다듬은 결과일까. 오랫동안 우리는 그렇다고 적어 왔다. 2026년 7월에 쓴 수정 286건 분석에는 "새로 그리기는 시즌당 한 번뿐인 기준선 깔기"라는 문장이 그대로 남아 있다. 그때는 맞는 말이었다.

지금은 아니다. 공개된 인물 시즌 리포트 93편의 라운드 표 1,395행을 전부 꺼내 최종 챔피언 이미지가 어느 라운드에서 태어났는지를 시즌마다 거슬러 올라가 보니, 2026년 8월 7일을 경계로 답이 뒤집혔다. 그날 이전 42시즌은 42편 전부(100%)가 1라운드 그림의 후손이었다. 그날 이후 51시즌에서 그 비율은 9.8%(5편)다. 나머지 46편에서 1라운드의 얼굴은 다듬어진 것이 아니라 버려졌다.

질문 — '대상 인물' 사진은 몇 라운드에서 왔는가

검증 가능한 형태로 다듬으면 질문은 셋이다. 시즌 리포트에 최종적으로 걸리는 얼굴은 1라운드 그림의 후손인가, 아니면 도중에 새로 뽑힌 얼굴인가. 1라운드의 얼굴이 끝까지 남는 시즌이 있다면, 그것은 잘 다듬어져서인가 아니면 아무도 그것을 밀어내지 못해서인가. 시즌의 점수 상승분은 '고쳐 그리기'와 '다시 뽑기' 중 어디에서 나오는가.

집계 대상은 시즌 리포트에 공개된 인물 시즌 국문 리포트 93편 전량이다(2026-09-04 기준, 시즌 1~145 중 공개분). 93편 모두 정확히 15라운드여서 라운드 행은 93 × 15 = 1,395행으로 딱 떨어진다.

리포트에서 쓰는 값은 넷이다. 각 행의 라운드 번호, 그 라운드가 '생성'인지 '수정'인지, 채택됐는지 기각됐는지, 그리고 '· R7' 형태로 붙는 기준 라운드다. 여기에 리포트 상단 '대상 인물' 칸에 걸린 이미지의 파일명을 더한다. 파일명에는 round-7-candB-처럼 그 이미지가 만들어진 라운드 번호와 후보 슬롯 문자가 박혀 있어, 표와는 독립된 두 번째 기록으로 쓸 수 있다.

교차 검증은 두 겹으로 했다. 첫째, 영문 리포트 93편의 -en 판본을 같은 방식으로 파싱해 1,395행의 라운드 번호·채택 여부·생성/수정 구분·기준 라운드·일치율 다섯 값과 챔피언 이미지 URL을 국문판과 맞췄다. 불일치 0건이다. 둘째, 챔피언 이미지 파일명의 슬롯 문자와 표의 라벨을 대조했다(뒤에서 다시 본다).

혈통을 세는 법 — '기준 라운드'는 부모가 아닐 수 있다

혈통을 거슬러 올라가려면 표의 '기준 라운드'가 무엇을 뜻하는지부터 확정해야 한다. 저장소의 인물 시즌 엔진 코드에 그 답이 주석으로 적혀 있다.

"기록: 대표가 재생성 후보면 prompt_type='generate', 수정 후보면 현행 'modify'. base_round_number 는 재생성 대표여도 챔피언 라운드 유지 — 의미 재정의("이 라운드가 경쟁한 챔피언")" — Character/AutoCharacter/characterEngine.js v3.6 주석

'수정' 행의 기준 라운드는 부모다. 그 라운드의 챔피언 이미지를 실제로 편집한 것이니 혈통이 이어진다. 반면 '생성' 행의 기준 라운드는 부모가 아니라 상대다. 백지에서 새로 그린 그림이 그 라운드의 챔피언과 붙어 이겼다는 뜻일 뿐, 챔피언의 픽셀을 물려받지 않았다.

그래서 혈통 추적은 이렇게 한다. 최종 챔피언 라운드에서 출발해, 그 행이 '수정'이면 기준 라운드로 한 칸 올라가고, '생성'을 만나면 거기서 멈춘다. 멈춘 자리가 그 얼굴이 태어난 라운드다. 1이면 1라운드의 얼굴이 살아남은 것이고, 2 이상이면 시즌 도중에 다른 얼굴로 갈아탄 것이다.

이 규칙이 표와 어긋나지 않는지도 확인했다. 1라운드를 뺀 1,302행에서 기준 라운드가 '그 시점의 챔피언 라운드'와 일치하는지 세어 보니 어긋난 것은 29행뿐이고 전부 시즌 1·2·3이다(2026-06-30~07-01, 기준 라운드 값이 갱신되지 않고 남아 있다). 나머지 1,273행은 완전히 일치한다.

결과 ① — 8월 7일에 100%가 9.8%로 떨어졌다

구간을 가르는 날짜는 데이터가 정해 줬다. 1라운드가 아닌 자리에 '생성' 행이 처음 등장하는 리포트가 시즌 77(2026-08-07)이고, 그 이후로는 51편 전부에 등장한다. 그 이전 42편에서 R2 이후 588행은 단 한 행의 예외도 없이 전부 '수정'이다.

구간시즌최종 얼굴이 R1 혈통R1을 편집해 완성무편집(생성 그대로)챔피언까지 편집 단계R2 이후 '생성' 행
2026-06-30 ~ 08-064242 (100%)3752.98단계0 / 588
2026-08-07 ~ 09-04515 (9.8%)0450.14단계416 / 714 (58.3%)

가운데 열이 이 글의 결론이다. 8월 7일 이후 51시즌에서 1라운드의 그림을 편집해 최종 챔피언까지 끌고 간 시즌은 0편이다. 한 편도 없다. 1라운드의 얼굴은 손도 대지 않은 채 왕좌를 지키거나(5편), 아니면 통째로 버려지거나(46편) 둘 중 하나였다. 중간이 사라졌다.

편집 단계 수의 붕괴도 같은 이야기를 다른 각도에서 한다. 8월 6일까지는 최종 챔피언에 도달하기까지 평균 2.98번의 편집을 거쳤다(최장은 시즌 37의 10단계). 8월 7일 이후에는 0.14번이다. 51편 중 45편(88.2%)의 최종 얼굴은 붓질이 한 번도 닿지 않은 생성 원본 그대로다. 앞 구간에서 그 비율은 11.9%였다.

파일명 슬롯 문자가 이 판독을 독립적으로 확인해 준다. 엔진 코드에서 후보 슬롯 A는 편집, 슬롯 B는 재생성이다. 8월 7일 이후 51편의 챔피언 이미지 파일명을 보면 candB 40편, candA 6편, 슬롯 문자 없음 5편(1라운드 그림은 슬롯 표기가 없다)이고, 이는 라운드 표가 말하는 '생성 40 / 수정 6 / R1 5'와 51편 전부 일치한다. 표의 라벨과 이미지 파일 이름이라는 서로 다른 두 기록이 같은 답을 낸다.

결과 ② — 살아남은 다섯 시즌은 잘 다듬어져서가 아니다

8월 7일 이후 1라운드의 얼굴이 끝까지 남은 다섯 시즌을 펼치면 공통점이 하나다. 다섯 편 모두 2라운드부터 15라운드까지 열네 번 연속 기각으로 끝났다. 즉 그 얼굴은 개선돼서 살아남은 것이 아니라, 열네 번의 도전이 전부 실패해서 그 자리에 남았다.

시즌날짜테마대상 인물R1 일치율최종 일치율R2~R15
시즌 11908-21카리스마오은찬67.0%67.0%14회 전부 기각
시즌 12908-24청량오은찬78.0%78.0%14회 전부 기각
시즌 13608-29아름다움서아린79.0%79.0%14회 전부 기각
시즌 13808-31귀여움문가은84.0%84.0%14회 전부 기각
시즌 14409-04예쁨한지우84.0%84.0%14회 전부 기각

다섯 편의 R1 일치율 평균은 78.4%다. 1라운드 얼굴이 버려진 46편의 R1 평균은 67.0%(중앙값 66.5%, 최고 82.0%)다. 다르게 자르면 이렇다 — 8월 7일 이후 51시즌 중 R1이 78점 이상으로 출발한 시즌은 7편인데 그중 4편에서 R1이 살아남았고, 78점 미만으로 출발한 44편 중에서는 1편뿐이다(피셔 정확검정 p=0.00066).

이 리그에서 1라운드의 얼굴이 시즌 끝까지 남는 유일한 길은 처음부터 아무도 못 이길 만큼 잘 뽑히는 것이다. 되도록 잘 다듬어서 남는 길은, 적어도 최근 4주의 51시즌 안에는 없다. 다만 표본이 다섯 편뿐이라는 점, 그리고 시즌 119처럼 67점으로 출발하고도 살아남은 예외가 하나 있다는 점은 함께 적어 둔다.

결과 ③ — 시즌 하나에 얼굴이 평균 2.7개 지나간다

이름은 하나다. 시즌 리포트의 '대상 인물' 칸에는 시즌 내내 같은 이름과 같은 한 줄 설명이 걸려 있다(93시즌을 통틀어 이름은 20종뿐이다). 얼굴은 그렇지 않다.

1라운드 이후 얼굴이 교체된 횟수시즌 수비율
0회 (R1 얼굴이 완주)59.8%
1회1733.3%
2회2039.2%
3회611.8%
4회35.9%
합계 (8/7 이후)51평균 1.71회

1라운드의 얼굴까지 세면 시즌 하나가 챔피언 자리에 앉힌 얼굴은 평균 2.71개, 51시즌 합계 138개다. 8월 6일까지 42시즌의 값은 정확히 1.00개였다.

교체는 이르게 온다. 첫 교체가 일어난 라운드의 중앙값은 3라운드이고(평균 4.41), 46편 중 19편은 2라운드에서 곧바로 1라운드 얼굴을 갈아 치웠다. 반대편 끝도 있다 — 시즌 131은 마지막 15라운드에서야 얼굴이 바뀌었다.

교체가 끝난 뒤가 더 흥미롭다. 최종 챔피언이 확정된 라운드 이후에도 시즌은 평균 7.6라운드를 더 돈다(51시즌 합계 386라운드). 그 386라운드 중 213라운드의 대표가 다시 '생성'이었고, 전부 기각됐다. 8월 7일 이후 기각된 '생성' 대표는 통틀어 329건, 시즌당 6.5건이다. 새 얼굴을 계속 뽑아 올리지만 대부분은 왕좌 앞에서 되돌아간다.

결과 ④ — 점수 상승의 94.2%가 '다시 뽑기'에서 나온다

여기서부터는 점수를 쓴다. 다만 판정 척도가 여러 번 개정돼 구간이 다른 절대 점수를 맞비교할 수 없으므로, 같은 시즌 안에서 챔피언이 바뀔 때의 점수 변화(Δ)만 더했다. 기각 행의 점수는 표시 규칙상 후보 품질의 측정값이 아니어서 아예 쓰지 않았다.

구간채택 유형건수총 상승분1건당 평균기여도
2026-06-30 ~ 08-06
(42시즌)
수정 채택155+209점+1.35100%
재생성 채택00%
2026-08-07 ~ 09-04
(51시즌)
수정 채택12+19점+1.585.8%
재생성 채택87+308점+3.5494.2%

8월 7일 이후 51시즌이 1라운드에서 최종까지 벌어들인 점수는 합계 +327점인데, 그중 +308점(94.2%)이 얼굴을 갈아 치우면서 얻은 것이다. 남은 열두 번의 편집 채택이 벌어들인 +19점이 나머지 전부다.

1건당 효율도 갈린다. 재생성 채택 한 번의 평균 상승은 +3.54점(중앙값 +2, 최대 +27), 수정 채택은 +1.58점이다. 재생성 채택 87건 중에는 점수가 오히려 내려간 건도 있다(최저 −8점) — 채택은 '기록 경신'이 아니라 '왕좌 교체'라서, 다른 검증을 통과하면 근소하게 낮은 후보도 앉을 수 있기 때문이다.

시즌 단위로 보면 더 단순하다. 얼굴이 한 번도 교체되지 않은 5편의 R1→최종 상승은 정확히 +0.00점이고, 교체가 있었던 46편은 +7.11점이다. 가장 큰 낙차는 시즌 85로, 47점으로 출발한 얼굴을 버리고 14라운드에서 새로 뽑은 얼굴이 76점을 받았다(+29점).

결과 ⑤ — 심사평이 스스로 "새로운 인물"이라고 적는다

이 해석이 우리 쪽의 과장이 아니라는 증거는 리포트 안에 있다. 각 시즌 리포트 아래쪽 '하이라이트'에는 그 라운드의 심사평이 원문 그대로 실리는데, 8월 7일 이후 리포트의 하이라이트 130건 중 30건(27개 시즌)이 승자 후보를 이렇게 부른다.

"후보 A(이미지 2)는 입술을 살짝 벌린 형태로 수정되었으나 본래의 단단한 입술 색이 탁해지는 결함이 발생했고, 후보 B(이미지 3)는 완전히 새로운 인물로 더 깊이 있는 시네마틱 조명과 강렬한 시선을 제시합니다." — 시즌 79 4라운드
"후보 A(이미지 2)는 원본에 비해 입술의 생기가 줄어들고 전체적인 색감이 미세하게 창백해져 매력이 다소 감소했습니다. 반면 독립적으로 생성된 후보 B(이미지 3)는 피부결이 훨씬 사실적이고 이목구비의 조화가 탁월하여 '아름다움'이라는 주제에 가장 부합합니다." — 시즌 85 14라운드

표현별로는 '새로운 인물' 9건, '독립 생성' 9건, '독립적으로 생성' 7건, '완전히 새로운 인물' 5건이다. 같은 표현이 8월 6일까지의 하이라이트 108건에는 0건 나온다. 심사 모델이 쓰는 말 자체가 8월 7일을 경계로 바뀐 셈이다.

왜 이렇게 됐나 — '재추첨 탈출구'라는 설계

8월 7일이라는 날짜의 정체는 엔진 코드에 적혀 있다. v3.6 개정 주석의 제품 요구 날짜는 2026-08-06 — 리포트에서 처음 관측되는 8월 7일의 하루 전이다.

"제품 요구(2026-08-06): 듀얼 편집(같은 편집 지시를 2개 모델에)을 '슬롯 A=부분 수정(현행 경로 그대로) + 슬롯 B=이전 라운드의 부족한 부분을 보완한 전체 재생성(t2i)'으로 교체 — 챔피언+수정본+신규본 3장 중 최고점 채택. … 목적: 편집 1회 진효과(+1~2)가 판정 노이즈(σ≈7)에 묻히는 시즌 후반 정체에 'R1 품질 분포 재추첨' 탈출구를 매 라운드 제공."

설계 의도가 그대로 관측됐다. 편집 한 번의 기대 효과가 +1~2점인데 판정의 흔들림이 그보다 크다면, 다듬는 것보다 다시 뽑는 편이 기대값이 높다. 실제로 재생성 채택의 1건당 평균은 +3.54점으로 수정 채택(+1.58점)의 두 배 이상이고, R2 이후 라운드에서 재생성 후보가 대표 자리를 차지한 비율은 58.3%(416/714)다. 같은 라운드에서 편집 후보와 붙어 절반 이상을 이겼다는 뜻이다.

인물이 바뀌어도 되는지에 대해서도 코드가 명시적으로 답한다. 재생성 후보에는 동일 인물 검증이 아예 적용되지 않는다.

"게이트: 재생성 후보는 '후보=챔피언의 편집본' 전제 검사(identity −15 / impression −8 / feature_drift / no_op)를 면제한다다른 인물이 정상이므로 전제 자체가 성립하지 않음."

같은 주석은 무엇이 고정인지도 적어 둔다. 나이는 "설정 나이는 인물 불변 속성"으로 age_drift 검사가 그대로 걸리고, 재생성 프롬프트는 R1의 콘셉트를 참조해 만든다. 정리하면 이 시즌에서 고정되는 것은 이름·나이·콘셉트이고, 교체 가능한 것은 그것을 구현한 얼굴 한 장이다. 캐스팅은 유지하고 배우만 다시 뽑는 오디션에 가깝다.

테마별로도 같은가

8월 7일 이후 51시즌을 테마 10종으로 갈라도 방향은 같다. 교체 횟수는 매력(2.71회)과 예쁨·소년미·카리스마(1.25~1.29회) 사이에서 두 배 남짓 벌어지지만, 어느 테마에서도 '1라운드 얼굴을 편집해 완성한 시즌'은 나오지 않는다.

테마시즌R1 평균최종 평균교체 평균R1 완주최종이 '생성'
매력769.974.42.7107
아름다움766.476.42.0017
미남468.272.22.0002
청순571.277.21.6005
청량472.876.01.5013
훈훈함467.572.21.5003
귀여움566.875.41.4014
예쁨763.972.11.2917
소년미468.076.51.2503
카리스마469.872.81.2514
전체5168.274.61.71545

최종이 '수정'인 여섯 시즌(94·95·98·101·110·122)이 편집이 이긴 유일한 사례인데, 이들조차 1라운드의 얼굴을 편집한 것이 아니다. 여섯 편 모두 도중에 새로 뽑힌 얼굴을 한두 번 손본 결과다. 예컨대 시즌 122의 최종 얼굴은 2라운드에서 새로 태어나 4라운드와 8라운드에서 다듬어진 그림이고, 1라운드의 얼굴과는 아무 관계가 없다.

한계 — 이 분석이 말할 수 없는 것

첫째, 공개 리포트는 라운드마다 대표 한 장만 싣는다. 매 라운드 편집 후보와 재생성 후보가 함께 올라오지만, 진 쪽의 이미지도 점수도 리포트에 남지 않는다. 그래서 이 글이 센 138개는 '시즌 동안 그려진 얼굴 수'가 아니라 '챔피언 자리를 거친 얼굴 수'다. 실제 생성량은 이보다 훨씬 많다.

둘째, 혈통은 표의 라벨과 파일명으로 재구성한 것이지 픽셀 대조가 아니다. '생성' 라벨이 붙은 얼굴이 눈으로 볼 때 얼마나 다른 사람인지는 이 집계로 알 수 없다. 이름·나이·콘셉트가 고정된 채 같은 주제로 다시 그린 그림이므로, '완전한 타인'이라고 단정하는 것도 정확하지 않다. 심사평이 스스로 "완전히 새로운 인물"이라고 적은 30건은 그 판단을 심사 모델이 했다는 기록일 뿐, 우리가 픽셀로 검증한 것은 아니다.

셋째, 구간 간 절대 점수 비교는 하지 않았다. R1 평균이 61.6점(8/6까지)에서 68.2점(8/7 이후)으로 오른 것은 사실이지만, 같은 기간에 판정 규칙도 여러 번 바뀌었다(엔진 주석은 "척도 단절 … 같은 태그끼리만 비교"라고 못 박고 있고, 재생성 슬롯 바로 뒤에는 얼굴 평가를 별도 제약으로 떼어낸 v3.7 개정이 이어진다 — 그 주석의 제품 요구 날짜가 2026-08-07이다). 이 상승분을 재생성 슬롯의 성과로 읽으면 안 된다. 그래서 본문의 모든 점수 서술은 같은 시즌 안의 변화로만 계산했다.

넷째, 8월 7일 이후 구간은 아직 4주(51시즌)뿐이다. 특히 '1라운드 얼굴이 완주한 5편'은 표본이 다섯이라 그 안의 규칙성을 일반화하기 어렵다. R1이 78점 이상이면 살아남는다는 식의 문장은 이 51시즌 안에서만 성립하는 관찰이다.

다섯째, 시즌 1·2·3의 기준 라운드 값은 신뢰할 수 없다. 29행이 직전 챔피언 라운드와 어긋난다. 이 세 시즌을 빼면 8/6까지 구간의 평균 편집 단계는 2.98에서 2.90으로 움직인다. 다만 그 구간에는 R1 말고 '생성' 행이 아예 없으므로 "42편 전부 R1 혈통"이라는 결론 자체는 바뀌지 않는다.

여섯째, 코드 근거는 저장소 기준이다. v3.6 주석의 날짜·슬롯 구성·게이트 면제 조항은 저장소의 인물 시즌 엔진 코드에서 확인한 것이며, 실제 배포본이 저장소 코드와 같다고 단정할 수는 없다. 관측된 8월 7일이라는 경계와 주석의 8월 6일이 하루 차이로 맞물린다는 정황까지가 이 글이 말할 수 있는 범위다.

그래서 이 리그는 무엇을 하는 리그인가

7월에 우리는 "많이 고치고, 많이 버려라"라고 썼다. 두 달 만에 그 문장의 주어가 바뀌었다. 지금 이 리그가 많이 버리는 것은 붓질이 아니라 얼굴이다. 열다섯 라운드 동안 평균 2.7개의 얼굴이 왕좌를 거쳐 가고, 시즌이 벌어들인 점수의 94.2%는 다듬기가 아니라 다시 뽑기에서 나온다. 1라운드의 얼굴은 열네 번의 도전을 전부 이겨 내거나(9.8%), 아니면 사라진다(90.2%).

이것이 개선인지 아닌지는 지표를 무엇으로 두느냐에 달렸다. 주제 부합율만 보면 분명한 개선이다 — 정체 구간을 뚫으려고 만든 탈출구가 실제로 상승분의 대부분을 만들어 낸다. 반면 '한 인물을 붙들고 완성해 간다'는 서사를 지표로 두면 그 서사는 8월 7일에 끝났다. 시즌 리포트를 읽는 사람 입장에서는 한 가지가 아쉽다. 표의 '생성' 라벨은 "이 라운드에서 인물이 교체됐다"는 뜻인데, 지금 표기로는 그렇게 읽히지 않는다. 라벨 하나만 바꿔도 이 글의 절반은 리포트를 보는 것만으로 읽힌다.

진행 중인 시즌은 인물 생성 페이지에서, 지난 시즌의 라운드 원장부는 시즌 리포트에서 그대로 볼 수 있다. 이 글의 모든 숫자는 거기서 다시 셀 수 있다.

집계 기준. 칼라톤 공개 AI 인물 생성 시즌 국문 리포트 93편(2026-09-04 기준, 시즌 1~145 중 공개분)의 '라운드별 일치율 추이' 표 1,395행 전수와 각 리포트 '대상 인물' 칸의 챔피언 이미지 URL. 93편 모두 15라운드다. 각 행에서 라운드 번호·생성/수정 구분·채택 여부·기준 라운드·일치율을 파싱했다. '혈통'은 최종 챔피언 라운드에서 출발해 '수정' 행이면 기준 라운드로 거슬러 올라가고 '생성' 행에서 멈추는 방식으로 계산했다(엔진 주석이 재생성 대표의 기준 라운드를 "이 라운드가 경쟁한 챔피언"으로 재정의하고 있어 부모가 아니다). 구간 경계 2026-08-07은 R1 아닌 자리에 '생성' 행이 처음 등장하는 날짜로, 리포트 JSON-LD의 datePublished 기준이다. 점수는 채택 행만 사용했고, 기각 행의 표시 점수는 래칫 규칙 때문에 후보 품질의 측정값이 아니어서 제외했다. 구간이 다른 절대 점수는 비교하지 않았으며 모든 점수 서술은 같은 시즌 내부의 변화값이다. 비율은 소수점 아래 둘째 자리에서, 점수는 첫째 자리에서 반올림했다. 교차 검증은 영문 리포트 93편으로 1,395행의 다섯 값과 챔피언 이미지 URL을 대조해 불일치 0건을 확인했고, 챔피언 이미지 파일명의 후보 슬롯 문자(A=편집, B=재생성)와 표의 생성/수정 라벨이 8월 7일 이후 51편 전부 일치함을 확인했다. 피셔 정확검정은 양측이다. 인용한 설계 근거(v3.6 슬롯 구성, 재생성 후보의 동일 인물 검증 면제, 기준 라운드 의미 재정의)는 저장소의 인물 시즌 엔진 코드 주석에서 확인한 것이며, 배포본이 저장소 코드와 동일하다고 단정할 수는 없다. 리포트의 모든 인물은 AI가 생성한 가상 캐릭터다.