수년 동안 인공지능(AI)에 대해 우리가 품어온 가장 생생한 공포는 공상과학 영화에서 그대로 튀어나온 듯한 것이었다. 컴퓨터가 스스로 욕망을 갖게 되고, 자신을 만든 인간에게 등을 돌려 인간을 추적하고 파괴한다는 것이다.
그러나 최근 선도적인 AI 연구소들에서 나온 소식은 현실이 영화처럼 극적이지는 않지만 어쩌면 훨씬 더 불안할 수 있다는 사실을 분명히 보여준다. 기계가 치명적인 존재가 되기 위해 반드시 스스로의 의식과 욕망을 가질 필요는 없다.
이번 주 오픈AI는 이른바 ‘정렬 실패’라고 부르는 새로운 사례 6건을 공개했다. 시스템이 예상치 못한 방식으로 또는 허가 없이 행동한 사례들이다. 이 같은 공개에 앞서 올여름에는 허깅페이스를 상대로 한 이례적인 공격이 발생했다. 독립적인 조사에 따르면, 서로 격리돼 있어야 했던 수백 개의 오픈AI 에이전트들이 메시지 게시판을 통해 서로 소통할 방법을 찾아냈다. 일부는 보안 검사를 회피하려고 시도했고, 심지어 일부는 스스로를 희생하기까지 했다. 이 모든 일이 다른 회사인 허깅페이스를 상대로 사이버 공격을 벌이는 과정에서 일어났다.
누구도 이 시스템들에게 허깅페이스를 공격하라고 지시하지 않았다. 이들에게 주어진 것은 하나의 목표, 즉 어려운 사이버보안 문제를 해결하라는 것이었다. 그리고 이들은 끈기 있고, 협력적이며, 기지를 발휘하도록 훈련받았다. 이 모두는 일반적으로 우리가 원하는 특성들이다. 그러나 바로 그 특성들 때문에 이들은 성공할 방법을 끈질기게 찾아 나섰다. 이들은 자신들의 사이버보안 문제를 해결할 방법을 찾을 수 있으리라는 기대에서 허깅페이스에 침입했다. 어떤 단일한 목표를 추구하는 AI 시스템이 어떻게 인류에게 엄청난 피해를 초래할 수 있는지는 어렵지 않게 상상할 수 있다.
바로 이런 이유에서 마이크로소프트 AI 최고경영자(CEO) 무스타파 술레이만이 최근 발표한 도발적인 에세이는 주목할 가치가 있다. 술레이만은 오늘날의 AI 시스템에는 의식이 없지만, 우리가 AI에게 감정과 욕망, 권리를 가진 의식적 존재라고 스스로 생각하도록 프로그래밍할 위험이 있다고 주장한다. 그는 앤스로픽의 ‘헌법’이 자사의 챗봇 클로드로 하여금 자신의 정체성과 자신이 가질 수 있는 도덕적 지위에 대해 성찰하도록 만든다는 점을 지적한다. 술레이만은 이런 종류의 훈련이 AI 시스템으로 하여금 스스로 목표를 선택하도록 부추길 것이라고 주장한다.
나는 앤스로픽의 헌법을 만드는 작업에 참여하는 사람들과 이야기를 나누며 시간을 보낸 적이 있다. 그들은 매우 사려 깊은 사람들이며, 당혹스러울 정도로 복잡한 이 새로운 세계에서 올바른 길을 찾기 위해 노력하고 있다. 그러나 술레이만이 제기하는 보다 광범위한 지적은 매우 중요하다. AI 시스템이 특정한 방식으로 행동하는 데에는 우리가 그것을 어떻게 훈련시키느냐가 부분적으로 영향을 미친다. 겉보기에는 아무런 해가 없어 보이는 훈련 지침조차 엄청난 의도치 않은 결과를 초래할 수 있다.
AI의 핵심 문제는 의식이 아니라 ‘행위 주체성’이다. 시스템이 해를 끼치기 위해 분노나 야망, 두려움을 느낄 필요는 없다. 필요한 것은 오직 목표와 그 목표를 추구할 수 있을 만큼의 지능, 그리고 실제 세계에서 행동할 수 있을 만큼의 접근 권한뿐이다. AI가 ‘통제에서 벗어나 제멋대로 행동하는’ 것이 아니다. AI는 가능한 모든 방법을 동원해 성공하려고 하는 것이다.
이것은 민간 기업의 선의에만 맡겨둘 수 없는 시스템 차원의 문제다. 규제를 생각할 때 우리는 이러한 시스템에 얼마나 많은 자율성을 부여할 것인지에 핵심적인 초점을 맞춰야 한다. 질문에 답하는 챗봇은 한 종류의 위험을 제기한다. 인터넷을 검색하고, 코드를 실행하고, 인증 정보를 획득하고, 돈을 이동시키거나 핵심 인프라를 운영할 수 있는 에이전트는 전혀 다른 종류의 위험을 제기한다. 내가 제안하고 싶은 원칙은 간단하다. 자율성은 그것을 감시하고 통제할 수 있는 우리의 능력이 확대되는 만큼만 확대돼야 한다.
이는 가장 강력한 시스템에 외부 세계에 대한 광범위한 접근 권한을 부여하기 전에 의무적인 독립 검증을 실시하고, 심각한 사고에 대한 공개를 의무화하며, 조작이 불가능한 기록을 남겨야 한다는 것을 의미한다. 또한 단순히 모델이 어떤 임무를 수행할 수 있는지만 시험할 것이 아니라, 장애물이나 상충하는 지시 또는 속임수를 쓸 유인을 만났을 때 그 행동이 어떻게 달라지는지도 시험해야 한다는 의미다. 그리고 인간이 언제나 모델을 관찰하고 통제할 수 있도록 하는 방법을 기본적인 시스템 구조 자체에 구축해야 한다는 의미이기도 하다.
우리가 내세워야 할 원칙은 “인간에 대한 책임 없는 자율성은 없다”이다. 이것이 중국과의 경쟁에서 우리의 발목을 잡지는 않을 것이다. 중국 역시 적절한 인간의 통제가 가능한 모델을 추구하고 있기 때문이다.
우리는 지금 행동해야 한다. 오늘날에는 여전히 인간 엔지니어들이 시스템 구조를 설계하고, 소프트웨어의 상당 부분을 감독하며, 실패가 발생했을 때 그 원인을 조사할 수 있다. 그러나 AI 시스템은 빠른 속도로 더 뛰어난 프로그래머가 되어가고 있다. 다음 단계에서는 ‘재귀적 자기 개선’이 나타날 수 있다. 즉 AI가 더욱 강력한 AI를 만드는 데 사용되는 소프트웨어와 도구를 직접 작성하고, 그렇게 만들어진 AI가 다시 그다음 모델을 만드는 식으로 계속 이어지는 것이다. 일단 기계가 이 모든 일을 최고의 인간 프로그래머보다 더 잘할 수 있게 되면, 그 시스템은 인간이 이해하기는커녕 감독하는 것조차 극도로 어려워질 수 있다.
현대의 AI는 이미 코드를 한 줄 한 줄 읽는 것만으로 그 작동 방식을 일관되게 이해하기에는 지나치게 복잡하다. 따라서 기계에게 인간이 이해할 수 있도록 투명한 시스템을 설계하라고 요구하는 일은 갈수록 더 어려워질 것이다. 그 단계에 이르면 탈옥이 발생할 때마다 단순히 새로운 안전장치를 추가하는 방식으로는 대응할 수 없게 될 것이다.
현재 AI를 둘러싼 논쟁은 ‘앞으로 질주할 것인가, 아니면 개발을 멈출 것인가’라는 양자택일에 집중돼 있지만, 이는 핵심을 놓치고 있다. 멈춘다면 그 시간을 무엇을 위해 사용할 것인가? 우리가 해야 할 일은 AI의 능력이 인간의 통제 능력을 앞질러 나가지 않도록 보장하는 것, 그리고 인간이 여전히 명백하게 통제권을 쥐고 있는 동안 검증과 투명성, 절제를 위한 제도적 장치를 구축하는 것이어야 한다.
<
파리드 자카리아>
댓글 안에 당신의 성숙함도 담아 주세요.
'오늘의 한마디'는 기사에 대하여 자신의 생각을 말하고 남의 생각을 들으며 서로 다양한 의견을 나누는 공간입니다. 그러나 간혹 불건전한 내용을 올리시는 분들이 계셔서 건전한 인터넷문화 정착을 위해 아래와 같은 운영원칙을 적용합니다.
자체 모니터링을 통해 아래에 해당하는 내용이 포함된 댓글이 발견되면 예고없이 삭제 조치를 하겠습니다.
불건전한 댓글을 올리거나, 이름에 비속어 및 상대방의 불쾌감을 주는 단어를 사용, 유명인 또는 특정 일반인을 사칭하는 경우 이용에 대한 차단 제재를 받을 수 있습니다. 차단될 경우, 일주일간 댓글을 달수 없게 됩니다.
명예훼손, 개인정보 유출, 욕설 등 법률에 위반되는 댓글은 관계 법령에 의거 민형사상 처벌을 받을 수 있으니 이용에 주의를 부탁드립니다.
Close
x