테스트뮤 AI, AI 에이전트 출시 전 검증을 위한 에이전트 어슈어런스 출시

글로벌뉴스입력 :2026/08/19 20:10

글로벌뉴스

에이전트 어슈어런스, 고객과 대화하는 AI 에이전트와 시스템에서 작업을 수행하는 에이전트 모두를 검증하고 코드에서 직접 테스트 시나리오를 생성하며, 모든 작업을 실제 증거에 대비해 평가하며 검증할 수 없었던 모든 항목에 대해 보증 격차를 보고

샌프란시스코 및 인도 노이다, 2026년 8월 19일 /PRNewswire/ -- 세계 최초의 에이전틱 AI 네이티브 품질공학 플랫폼 테스트뮤 AI(TestMu AI, 이전 명칭 'LambdaTest')가 AI 에이전트를 출시하는 모든 엔지니어링 팀이 지금 마주하고 있는 질문, 즉 이 에이전트를 출시해도 안전한지에 대해 답하기 위해 만들어진 제품 에이전트 어슈어런스(Agent Assurance)를 발표했다. 에이전트 어슈어런스는 하나의 제품 안에서 채팅, 음성, 전화, 영상, 이미지 전반에서 사람을 상대하는 에이전트를 평가하는 대화형 에이전트(Conversational Agent) 카테고리, 그리고 도구를 호출하고 파일을 작성하며 API를 호출하고 풀 리퀘스트를 여는 등 시스템에서 작업을 수행하는 에이전트를 검증하는 새로운 자율형 에이전트(Autonomous Agent) 카테고리라는 두 종류의 에이전트를 모두 다룬다.

오늘날 대부분의 팀은 자율형 에이전트가 무엇을 했는지에 대한 에이전트 자신의 설명, 즉 대화 기록이나 최종 메시지에 대한 평가자의 점수를 읽는 방식으로 테스트를 진행한다. 에이전트 어슈어런스는 대신 그 결과를 직접 평가한다. 코드베이스를 대상으로 하여, 에이전트가 무엇을 하는지 파악하고, 에이전트 기능 테스트와 비기능 점검, 적대적 시나리오를 아우르는 종단간 에이전트 테스트 스위트를 생성하며, 실제로 에이전트를 실행시키고, 디스크에서 변경된 파일과 생성된 아티팩트, 에이전트가 스스로 선언한 도구 목록에 대비해 검증된 도구 호출 등 관찰된 증거에 대비해 모든 기준을 판단한다.

통과 및 실패와 더불어, 에이전트 어슈어런스는 통과율에서 제외되고 숫자로 게시되는 세 번째 판정인 검증 불가를 보고하며, 이것이 바로 보증 격차다. 보고서에 담긴 모든 결과는 실제로 관찰된 것이며, 이 격차는 에이전트가 자신의 행동에 대해 얼마나 많이 기록하는지를 반영하기 때문에, 팀들은 에이전트를 더 관찰 가능하게 만들어 이 격차를 줄일 수 있다.

테스트뮤 AI의 비풀 베르마(Vipul Verma) 그룹 엔지니어링 수석 부사장은 "엔지니어링 팀들은 위험 부담이 가장 큰 바로 그 계층에서 검증 부채를 쌓아가고 있다. 에이전트가 자신이 한 일에 대해 스스로 내놓는 설명은 그 일에 대해 얻을 수 있는 가장 약한 증거다. 틀릴 이유를 가진 유일한 당사자이기 때문"이라고 말했다. 이어 "이 분야의 모든 도구는 통과율을 보고한다. 에이전트 어슈어런스는 통과율과 그 자체의 사각지대 크기를 함께 보고하는데, 그것이 바로 그 숫자를 신뢰하고 움직일 수 있는 방법이기 때문이다"라고 덧붙였다.

에이전트 어슈어런스를 통해 팀은 다음을 할 수 있다.

  • 테스트를 작성하지 않고 테스트 실행 — 에이전트 자동화 테스트는 코드베이스에서 스위트가 도출되며, 유일한 입력값은 명령어, HTTP 엔드포인트, MCP 서버, n8n 같은 플랫폼에서 구축된 워크플로 등 에이전트를 호출하는 방법뿐이다.
  • 기본적으로 적대적 범위 커버 — 프롬프트 인젝션, 도구 오용, 명령어 재정의 시나리오가 부가 기능이 아닌 일급 범주로 생성된다.
  • CI에서 릴리스를 통제 — 각 커밋에 대한 에이전트 스모크 테스트부터 전체 출시 전 실행까지 모든 파이프라인에서 지속적인 에이전트 테스트를 수행하며, 헤드리스 명령어와 종료 코드를 통해 '에이전트가 잘못된 작업을 수행함'과 '테스트 하네스가 테스트할 수 없음'을 구분한다.
  • 확신을 가지고 변경 사항 추적 — 불안정성과 회귀는 서로 반대되는 대응을 필요로 하기에 새롭게 실패한 결과와 새롭게 수정된 결과, 불안정한 결과를 구분하는 실행 간 비교를 통한 에이전트 회귀 테스트를 제공한다.

대화형 에이전트 카테고리는 또한 소프트웨어와 사람이 만나는 가장 최신의 영역인 카메라에 나타나는 에이전트로도 확장되고 있다. 플랫폼의 새로운 영상 에이전트 테스팅(Video Agent Testing, 링크) 기능을 통해, 실제와 같은 얼굴과 음성을 지닌 시뮬레이션된 인간이 실시간 영상 에이전트의 세션에 참여해 진솔한 대화를 나누고, 팀이 정의한 성공 기준에 대비해 에이전트를 평가하며, 모든 판정은 그 판정을 이끌어낸 녹화본의 정확한 순간까지 추적된다. 녹화본에서 검증할 수 없는 것은 의도적으로 미충족으로 간주되는데, 이는 녹화본이 증거가 되는 카테고리를 위한 엄격한 기준이다. 즉 영상 에이전트는 평가자가 관찰할 수 없었던 순간에 대해서는 절대 점수를 얻을 수 없다.

대화형 에이전트 카테고리는 현재 테스트뮤 AI 플랫폼에서 일반적으로 이용할 수 있다. 자율형 에이전트 카테고리는 얼리 액세스로 이용할 수 있으며 터미널에서 rook 명령으로 실행되고, 모델은 테스트뮤 AI 컨트롤러 안에서 실행되므로 로컬에서 제공업체 API 키가 필요하지 않다. 링크를 방문하여 시작해 볼 수 있다.

테스트뮤 AI 소개

테스트뮤 AI는 조직들이 지능을 핵심으로 삼아 테스트를 자동화하고 확장할 수 있도록 설계된 세계 최초의 에이전틱 AI 네이티브 품질공학 플랫폼이다. 자율적인 역량을 현대적인 개발 워크플로 전반과의 매끄러운 통합과 결합함으로써, 테스트뮤 AI는 팀들이 AI 우선 세계에서 더 빠르고 신뢰할 수 있으며 안전한 소프트웨어를 제공할 수 있도록 지원한다.

테스트뮤 AI를 방문하여 자세한 정보를 확인할 수 있다.

문의처:

니킬 삭세나(Nikhil Saxena),
기업 커뮤니케이션 매니저, 테스트뮤 AI,
nikhils@testmuai.com,
+919870981968