요즘들어 계속해서 흘러들어오는 단어인 AI 하네스 활용.그게 뭔가요?
AI 하네스의 기본 개념은 아래와 같다.
ai 시스템을 같은 조건에서 반복 실행, 결과를 자동으로 측정 및 비교하는 테스트 환경.
일반적인 소프트웨어 테스트도 동일하지만, AI 를 활용할 경우 결과가 항상 같지 않기 때문에 어떻게 평가를 해야하는지가 특히 중요해진다.
그렇기 때문에 일반적인 테스트와는 다른데. 보통 "input -> 프로그램 -> 결과" 라는 명확한 한 세트가 완성되지만 ai 는 단순히 챗 에이전트에서만 봐도, "질문 -> LLM -> 대답" 에서 대답이 수많은 가짓수가 나오기 때문에 항상 정답이다 아니다를 테스트하기가 힘들다.
"정확성 관련성 근거성 형식 안전성 Latency Token Cost"
못해도 이정도는 판단을 해야 AI의 답변이 옳은지 그른지 판단할 수 있는 체크리스트가 된다.
여기서 사용하는 이 테스트 환경이 바로 하네스라고 지칭하는 것의 역할이다.
질문 하나를 만들고, 해당 질문의 명확한 대답을 선언해놓고. 해당 대답을 판단하는 것
예를 들면, "대한민국의 수도는?" 이라는 질문에 "서울" 이라는 정답이 있다면.
AI가 대한민국의 수도는 서울입니다. 대한민국의 수도는 서울특별시입니다. 같은 답변을 정답체크하는 일련의 과정을 수행하는 것이다.
AI 하네스 엔지니어링의 추구점은 반복, 측정, 회귀 방지,지속 관리 이다.
1. 사람이 직접 반복하는 것이 아니라, AI가 자동으로 100개를 질문하는 행위를 자동으로 해야되는것이다.
2. 이번 응답은 조금 괜찮은거같은데? 하는 의심이 아닌, 측정 가능한 형태의 수치를 만드는 것
3. AI관련 개발을 하다 보면 수 없이 많이 하는 LLM 모델의 변경, 각 변경마다 어떤 모델의 테스트가 깨졌는지 추적이 가능해야 하는 것
4. 개발 -> 테스트 -> 개선 -> 테스트 -> 개선 > 테스트 라는 지속적인 관리가 가능해야할 것