느린 코드를 발견하면 AI가 더 빠른 후보를 많이 만들게 하고 싶어져요. 하지만 Google Cloud가 2026년 7월 Gemini Enterprise Agent Platform에서 정식 제공을 시작한 AlphaEvolve의 흐름은 후보 생성만으로 끝나지 않아요. 시작 프로그램과 클라이언트 쪽에서 결정적으로 실행되는 평가기를 넣고, 정의·측정·최적화·적용의 순서로 진행해요.
“더 빠르되 아무것도 망가뜨리지 말 것”은 실행 가능한 판정이 아니에요. 바꿔도 되는 범위, 개선을 나타내는 점수, 점수가 높아도 탈락시킬 조건이 코드로 표현돼야 해요. InfoQ도 성공을 측정하고 자동화할 수 있는 문제에 이 방식이 맞는다고 설명해요. 동시에 공급업체가 제시한 성과를 독립 벤치마크로 볼 수 없고, 탐색 과정이 평가기의 빈틈을 이용할 수 있다고 지적해요.
탐색 예산보다 평가 계약을 먼저 정해요
평가 계약에는 다섯 가지 역할이 있어요. 비교할 실행 환경과 기준선을 고정하고, 개선 방향을 계산 가능한 지표 하나로 만들어요. 정확성·결정성·자원·인터페이스에 관한 절대 제약을 검사하며, 정해진 예산이나 연속 무개선 횟수에 도달하면 멈춰요. 마지막으로 살아남은 변경과 근거를 읽고 배포 여부를 결정할 사람을 지정해요.
빈칸을 채우기 위한 문서가 아니에요. Klarna Engineering의 사례에서는 엔지니어가 변경 가능 범위와 지표, 양보할 수 없는 제약을 정했어요. 결정성 조건 하나가 빠지자 속도는 빠르지만 배포할 수 없는 경로가 나왔어요. 개선 없이 평가가 631회 이어졌다는 기록도 있어요. 멈춤 규칙이 없다면 계산 자원이 아니라 사람의 인내심이 종료 조건이 돼요.
목표를 세 갈래로 분류해요
- 결과를 객관적으로 채점하고 필수 제약도 자동 검사할 수 있는가?
- 객관 채점과 필수 제약 자동 검사 가능시작 가능—범위·예산 고정, 사람 검토, 자동 배포 금지
- 채점은 가능하나 채택 기준이 암묵적평가기 보완 필요—거절 이유 하나를 테스트로 작성
- 사업 판단이 모호하거나 피해를 막을 수 없음부적합—AI는 안을 정리하고 사람이 선택·책임
이 분류는 모델 선택보다 앞서요. 생성된 패치를 이해하고 책임질 사람이 불분명하다면 AI 코드 변경의 소유 비용 점검부터 해요. 실행 도중 근거를 살필 멈춤 지점이 없다면 코딩 에이전트에 필요한 사람의 체크포인트를 운영 계획에 넣어요.
평가기 통과와 배포 승인을 분리해요
매번 시작 버전, 환경, 점수, 제약 검사 결과, 중단 이유, 최종 차이를 남겨요. 지정된 책임자가 이 기록을 읽고 보안·운영·제품 검토로 넘길지 결정해요. 평가기는 작성된 조건을 후보가 충족했다는 근거를 줄 뿐이에요. 빠뜨린 요구사항이 없다는 사실까지 증명하지는 못해요.
플랫폼부터 도입하지 않아도 돼요. 경계가 분명한 최적화 목표 하나를 골라 기준선, 지표, 절대 제약, 중단 조건, 책임자를 적어 보세요. 한 항목이라도 모호하면 후보를 더 만들 때가 아니라 그 항목을 검증 가능하게 만들 때예요.
AI 정리 카드
지금 접근할 수 있는 작업 공간, 저장소, 테스트 결과, 프로파일링 자료 또는 프로젝트 기록에서 읽기 전용으로 탐색을 시작해 주세요. 코드, 설정, 배포 상태를 바꾸지 말고 자동 최적화 후보가 될 만한 경계가 분명한 문제 하나를 직접 찾은 뒤, 근거가 된 코드 위치나 기록을 인용하고 관찰 사실과 추론을 구분해 주세요. 현재 기준선, 계산 가능한 지표, 정확성·결정성·자원에 관한 절대 제약, 예산 또는 연속 무개선 기준의 중단 조건, 검토와 배포를 맡을 책임자를 평가 계약으로 정리해 주세요. 알 수 없는 값은 `확인 필요`로 표시해 주세요. 필수 context에 접근할 수 없다면 제가 자료 묶음을 준비하게 하지 말고, 접근 권한이나 배경에 관한 가장 구체적인 질문 하나만 해 주세요. 목표를 `시작 가능`, `평가기 보완 필요`, `자동 탐색 부적합` 중 하나로 판정하고 핵심 근거와 지금 실행할 수 있는 되돌릴 수 있는 다음 행동 하나를 제안해 주세요. 높은 점수만으로 배포하거나 게시하지 말고, 지정된 사람이 차이와 제약 검사 결과를 확인하게 해 주세요.
결과를 평가하기 전에 탐색 범위를 정해요

- 정원사는 작은 구역에서 모종 몇 포기만 비교하며 관리 가능한 시험을 시작해요.
- 모종 줄이 처음 정한 범위 밖으로 퍼지자, 정원사는 확장된 규모를 살피며 멈춰요.
- 나무 말뚝과 줄을 이용해 이번에 끝낼 시험 구역 하나만 다시 정해요.
- 경계를 정한 구역은 건강하게 자랐고, 나머지 밭은 다음 판단까지 그대로 남겨 둬요.
참고 자료
Google Cloud: AlphaEvolve is available for everyone — https://cloud.google.com/blog/products/ai-machine-learning/alphaevolve-is-available-for-everyone (2026-07-09)
InfoQ: Google’s AlphaEvolve Reaches General Availability with Evolutionary Code Optimization as a Service — https://www.infoq.com/news/2026/07/alphaevolve-generally-available/ (2026-07-19)
Klarna Engineering: Beyond Prompting: How Algorithmic Evolution Doubled our Training Speed — https://medium.com/klarna-engineering/beyond-prompting-how-algorithmic-evolution-doubled-our-training-speed-8f874af3080d (2026-03-30)



