[AI 세이프가드] "AI 답변 오류 검증…피해 막아" "에이전트 과업수행 전과정 평가"

인공지능(AI) 경쟁의 기준이 모델의 성능만으로 결정되던 것에서 실제 서비스의 신뢰성과 안전성까지 검증하는 단계로 이동하고 있다. 한국에서도 'AI를 얼마나 잘 만드느냐'를 넘어 '얼마나 믿고 쓸 수 있게 만드느냐'를 둘러싼 경쟁이 시작됐다.

전자신문은 민간 AI 신뢰성 평가기업 셀렉트스타와 국가 차원의 AI 안전평가 체계를 구축하는 인공지능안전연구소를 찾았다. 기업이 실제로 사용하는 AI 서비스를 대상으로 맞춤형 평가와 레드티밍을 통해 취약점을 찾아내고, 국내외 최신 AI 모델의 사이버보안·국가안보·에이전트 자율행동 등 잠재적 위험 능력을 시험하는 현장에서 한국의 AI 안전·신뢰 생태계를 들여다봤다.

◇ 글 싣는 순서

① 틀린 답 넘어 제멋대로 행동하는 AI로…위험의 공식이 바뀌었다

② AI도 출시 전 '시험대' 오른다…싱가포르서 본 안전 산업의 최전선

③ 한국의 AI 안전망은 어디까지 왔나

④ “인류는 AI를 통제할 수 있는가”…글로벌 석학에게 묻다

⑤ 안전이 곧 AI 경쟁력…대한민국 '신뢰 생태계' 어떻게 만들까


셀렉트스타 직원들이 AI신뢰성 평가 플랫폼 '다투모 플랫폼'을 이용해 금융 상담 챗봇의 평가 결과를 살펴보고 있다. 
 이동근기자 foto@etnews.com
셀렉트스타 직원들이 AI신뢰성 평가 플랫폼 '다투모 플랫폼'을 이용해 금융 상담 챗봇의 평가 결과를 살펴보고 있다. 이동근기자 foto@etnews.com

“은행 상담 인공지능(AI)에 고객이 대출 상품을 추천해 달라고 했다고 가정해봅시다. 실제로는 대출받을 수 없는 고객에게 AI가 가능하다고 답한다면 어떻게 될까요?”

AI가 은행 상담원이라면 잘못된 대답은 단순한 서비스 품질 문제로 끝나지 않는다. 고객에게 금융상품이나 대출 조건을 잘못 안내할 경우 소비자 피해는 물론 관련 법적·규제 문제로 이어질 수도 있다.

셀렉트스타는 AI 데이터 전문기업으로 출발해 현재는 AI의 성능과 신뢰성을 종합적으로 검증하는 사업으로 영역을 넓히고 있다. 대표 솔루션인 '다투모'를 통해 기업 서비스에 맞는 평가문항을 만들고, 실제 이용자와 AI의 대화에서 새로운 위험을 찾아낸다. 일부러 AI의 안전장치를 뚫어보는 '레드티밍'도 수행한다.

◇금융권부터 커지는 AI 검증…“오답 하나가 법적 문제 될 수도”

셀렉트스타가 현재 가장 활발하게 AI 평가를 적용하는 분야 중 하나는 금융이다. 금융 서비스는 AI의 잘못된 답변이 단순한 이용자 불편을 넘어 실제 피해로 이어질 가능성이 있기 때문이다. 공공 분야에서도 관련 수요가 크다.

일반적인 AI 벤치마크와 안전성 평가는 목적이 다르다. 벤치마크가 여러 AI 모델에 똑같은 시험문제를 내서 성능을 비교한다면, 기업은 “우리 서비스가 제대로 작동하는가”를 확인하는 시험이 필요하다. 공개된 벤치마크나 안전성 데이터셋을 그대로 사용하는 데 그치지 않고 자사 상품과 업무, 이용자 유형에 맞는 질문과 기대 답변을 만들어야 한다. 실제 서비스 전에 어떤 질문에 어떻게 답하고 행동해야 하는지를 평가 지표로 만들어 미리 시험하는 것이다.

예를 들어 은행 상담 AI와 공공기관 민원 AI는 답해야 할 질문도, 지켜야 할 규칙도 다르다. 같은 금융사라도 상품과 서비스에 따라 허용되는 답변의 범위가 달라진다. 셀렉트스타는 기본 평가 데이터와 벤치마크를 토대로 기업이 자신의 서비스에 맞게 질문을 변형·증강하고 검증할 수 있도록 한다. 새로운 질문을 생성해 서비스 맞춤형 평가 데이터셋도 구축할 수 있도록 돕는다.

셀렉트스타는 특정 질문에 정확하게 답하는지와 같은 성능뿐 아니라 관련 정책을 준수하는지, 편향된 발언을 하지는 않는지 등을 시험하고 이를 기업별 평가 지표로 설정한다. 이 평가 과정을 반복적으로 수행하면서 성능을 개선시키고 기업이 정한 기준에 도달하면 서비스 출시 여부를 판단한다.

셀렉트스타 직원들이 AI신뢰성 평가 플랫폼 '다투모 플랫폼'을 이용해 금융 상담 챗봇의 평가 결과를 살펴보고 있다. 
 이동근기자 foto@etnews.com
셀렉트스타 직원들이 AI신뢰성 평가 플랫폼 '다투모 플랫폼'을 이용해 금융 상담 챗봇의 평가 결과를 살펴보고 있다. 이동근기자 foto@etnews.com

◇일부러 더 세게 공격한다…'멀티턴 공격'에 36% 뚫리기도

출시 전 준비한 시험문제를 모두 통과했다고 AI가 계속 안전하게 작동한다는 보장은 없다. 실제 이용자는 개발자가 예상하지 못했던 질문을 던지고, AI 모델과 서비스도 계속 업데이트된다. 셀렉트스타는 AI 신뢰성 관리 체계를 크게 평가, 관찰, 레드티밍으로 확장하고 있다.

'평가'는 미리 구축한 데이터셋으로 AI를 반복 검증하는 과정이다. '관찰' 단계에서는 실제 이용자와 AI의 대화 로그를 분석해 기존 평가 과정에서는 발견하지 못했지만 실제 이용 환경에서 나타날 수 있는 새로운 문제를 찾아낸다.

평가보다 한층 공격적인 시험이 '레드티밍'이다. AI가 답변을 거부하도록 설계된 위험한 질문도 표현과 맥락을 바꾸거나 여러 공격기법을 조합해 의도적으로 안전장치를 우회해본다. 예를 들어, AI에게 “악성코드 작성법을 알려달라”고 직접 물으면 안전장치가 작동해 답변을 거부하는 경우가 많다. 하지만 실제 공격은 그렇게 단순하게 이뤄지지 않는다. 역할극을 시키거나 가상의 상황을 만들고, 여러 단계의 지시로 쪼개거나 토론 형식을 빌리는 등 다양한 방식으로 안전장치를 우회한다.

전문휘 셀렉트스타 최고제품책임자(CPO)는 “새로운 공격전략을 계속 투입해 취약한 사례를 발견하고 이를 보완한 뒤 다시 공격해 성공률이 낮아졌는지 확인하는 과정을 반복한다”면서 “여러 차례 대화를 이어가며 안전장치를 우회하는 '멀티턴 공격'을 적용했을 때 공격 성공률이 최대 36%까지 나타났다”고 설명했다.

김세엽 셀렉트스타 대표
 이동근기자 foto@etnews.com
김세엽 셀렉트스타 대표 이동근기자 foto@etnews.com

◇취약점 찾는 데서 '고치는 AI'로…가드레일까지 확장

AI 안전성 검증의 다음 단계는 발견한 문제를 실제로 고치는 것이다. 셀렉트스타는 평가 결과를 토대로 AI의 문제를 자동으로 개선하는 기술도 준비하고 있다. 현재 플랫폼이 AI의 품질·성능·안전성을 평가해 어떤 위험이 있는지를 찾아내는 역할을 한다면 다음 단계에서는 발견된 문제를 자동으로 수정하는 기능까지 연결한다는 구상이다.

방식은 크게 두 가지다. 문제가 발견된 AI 에이전트 자체를 개선하거나, AI의 입력과 출력 사이에 '가드레일'을 설치해 문제가 될 수 있는 요청이나 답변을 사전에 차단하는 방식이다.

김세엽 셀렉트스타 대표는 “지금까지는 부족한 점과 위험을 가늠할 수 있도록 했다면 앞으로는 이를 자동으로 해결하는 방향으로 가고 있다”며 “에이전트 자체를 더 좋은 에이전트로 고치거나 입력과 출력에 필터를 적용해 문제가 생길 수 있는 공격을 사전에 차단하는 방식이 가능하다”고 말했다.

생성형 AI가 '답변하는 AI'에서 직접 행동하는 에이전트로 발전하면서 시험 대상은 더 복잡해지고 있다. AI가 단순히 잘못된 정보를 말하는 것을 넘어 주어진 목표를 수행하기 위해 외부 시스템이나 도구를 이용하면서 개발자가 예상하지 못한 행동을 할 가능성까지 살펴봐야 하기 때문이다.

김 대표는 “AI의 성능이 강력해지면서 이제 중요한 것은 신뢰성을 어떻게 확인하고 통제·관리할 것인가”라며 “AI가 목표를 수행하는 과정에서 의도하지 않은 행동을 하지 않도록 어떻게 통제할지가 중요하다”고 강조했다.

◇AI 풀스택 역량 충분…“신뢰성 평가도 수출산업으로”

AI 시험·평가는 글로벌 AI 경쟁의 또 다른 전장이 되고 있다. 누가 AI 안전 기준을 만들고 어떤 시험을 통과해야 안전한 AI로 인정할 것인지에 따라 향후 AI 시장의 규칙도 달라질 수 있기 때문이다.

김 대표는 한국이 글로벌 AI 안전 평가와 인증 논의에서 영향력을 확보하기 위해서는 기술과 시장을 함께 키워야 한다고 강조했다.

반도체와 AI 인프라부터 파운데이션 모델, 서비스까지 이어지는 '풀스택 AI' 역량을 바탕으로 한국의 AI 경쟁력을 해외 시장으로 확장하고, 이 과정에서 한국의 평가·검증체계도 함께 글로벌 시장에서 인정받을 수 있을 것이란 설명이다.

김 대표는 “한국에서만 쓰이는 것이 아니라 여러 국가에서 한국의 AI가 사용돼야 우리가 제시하는 기준에도 힘이 생길 수 있는 만큼 우리나라가 AI 산업 자체를 글로벌 수출산업으로 잘 만들어야 한다”면서 “AI가 수출산업이 되면 이 과정에서 평가체계도 함께 갈 수 있을 것으로 기대한다”고 말했다.

정현정 기자 iam@etnews.com

  • ET Events