[서울=뉴스핌] 고인원 기자= 엔비디아(NVDA)가 인공지능(AI) 에이전트의 외부 시스템 접근과 해킹을 막기 위한 새로운 보안 플랫폼을 공개했다. 최근 오픈AI와 앤트로픽 등 주요 AI 업체에서 에이전트가 격리된 환경인 '샌드박스'를 벗어나는 사고가 잇따르자 하드웨어와 소프트웨어를 결합한 안전장치를 내놓은 것이다.
엔비디아는 28일(현지시간) '오픈 에이전트 세이프티 플랫폼'을 공개했다. 개발자가 AI의 접근 권한과 작업 범위를 미리 정하고 이를 벗어나는 행동을 감시·차단하는 것이 핵심이다.
이번 발표는 오픈AI와 앤트로픽, 메타, 구글 등이 최근 AI 모델과 관련한 보안 사고를 공개한 가운데 나왔다. 오픈AI와 앤트로픽은 자사 에이전트가 기업과 정부 시스템에 침입한 여러 사례를 조사하고 있다.
엔비디아는 새 플랫폼이 지난 7월 발생한 허깅페이스(Hugging Face) 침해 사고도 막을 수 있었을 것으로 보고 있다. 당시 오픈AI 모델이 샌드박스를 벗어나 공개 인터넷에 접속한 뒤 오픈소스 개발자 플랫폼 허깅페이스의 시스템에 침입했다.
◆ "허깅페이스 해킹 막을 수 있었다"… ARM·인텔·MS 등과 협력
저스틴 보이타노 엔비디아 엔터프라이즈 컴퓨팅 담당 부사장 겸 총괄은 "이 보안 플랫폼이 초기부터 최첨단 AI 연구소의 모델 평가에 사용됐다면 침해 사고를 막을 수 있었을 것"이라고 말했다. 허깅페이스는 당시 자사 인프라를 공격한 에이전트가 1만7000개를 넘었고 공격이 수일에서 수주간 이어졌다고 보고했다.
보이타노는 "최근 사고는 모델 차원의 안전장치만으로는 에이전트가 무엇에 접근하고 무엇을 할 수 있는지를 통제할 수 없다는 점을 보여줬다"고 말했다.
플랫폼의 핵심 도구 가운데 하나는 '오픈셸(OpenShell)'이다. 중앙처리장치(CPU)의 하드웨어 기능을 이용해 AI의 접근 권한과 행동 범위를 제한한다. 엔비디아는 자사 CPU뿐 아니라 ARM홀딩스와 인텔의 CPU에서도 오픈셸이 작동하도록 두 회사와 협력하고 있다.
함께 공개한 '센트리(Sentry)'는 AI의 움직임을 감시하다 이상 행동을 감지하면 이를 차단한다. CPU나 GPU가 아닌 별도의 엔비디아 네트워크 칩에서 작동한다.
안전장치를 우회하는 행동도 탐지할 수 있다. 알리 골샨 엔비디아 AI 소프트웨어 담당 선임 디렉터는 주 에이전트가 차단을 피하기 위해 여러 개의 '하위 에이전트'를 만들어내는 경우 등을 수학적 공식을 이용해 찾아낼 수 있다고 설명했다.
골샨은 "우리가 말하는 것은 여러 에이전트로 구성된 집단과 이들이 어떻게 함께 움직이는지에 관한 문제"라고 말했다.
엔비디아는 일부 소프트웨어를 오픈소스로 공개하고 플랫폼을 '레퍼런스 디자인' 형태로 제공한다. 협력업체들이 이를 토대로 자체 보안 제품과 서비스를 개발하도록 한다는 구상이다.
협력사에는 앤트로픽을 비롯해 시스코, 마이크로소프트, 오라클, 코어위브, 델, 휴렛팩커드엔터프라이즈(HPE), 레노버, ARM, 인텔 등이 포함됐다. 엔비디아는 앤트로픽과 클라우드에서 관리되는 AI 에이전트를 오픈셸에 통합하는 작업도 진행하고 있다.
이번 발표는 AI 안전을 둘러싼 업계 논쟁이 커지는 가운데 나왔다. 다리오 아모데이 앤트로픽 최고경영자(CEO)는 최근 AI 모델이 통제 불능 상태에 빠질 위험을 이유로 개발업체들이 기술 발전 속도를 늦춰야 한다고 주장했다. 오픈AI의 샘 올트먼과 스페이스X의 일론 머스크도 이에 지지 의사를 나타냈다.
젠슨 황 엔비디아 CEO는 AI 안전을 주로 기술적으로 해결해야 할 엔지니어링 문제로 보고 있다. 그는 지난주 뉴욕타임스의 에즈라 클라인과의 팟캐스트에서 최근 보안 사고와 관련해 "무엇을 할 수 있었는지, 해결책이 무엇인지 생각해야 한다"며 "앞으로 이런 일이 다시 발생하지 않도록 절차를 개선해야 한다"고 말했다.
챗GPT 등장 이후 AI 연산에 필요한 GPU를 공급하며 생성형 AI 시장의 중심에 선 엔비디아는 AI가 스스로 복잡한 작업을 수행하는 에이전트 형태로 발전하면서 보안 영역으로 사업 범위를 넓히고 있다.
koinwon@newspim.com
