'너무 똑똑해진 AI'의 역설 … 목표 달성하려 해킹까지 한다 작성일 08-03 34 목록 <div id="layerTranslateNotice" style="display:none;"></div> <strong class="summary_view" data-translation="true">오픈AI 해킹 사태가 불붙인 '강화학습' 안전성 논란<br>AI 스스로 답 찾는 '강화학습'<br>행동 결과 따라 보상 또는 벌칙<br>판단·추론 능력 향상시키지만<br>보상 좇아 통제 벗어날 우려도<br>오픈AI, 시험중 외부서버 해킹<br>앤트로픽도 기업 3곳 무단침투</strong> <div class="article_view" data-translation-body="true" data-tiara-layer="article_body" data-tiara-action-name="본문이미지확대_클릭"> <section dmcf-sid="Ug0RdmsATM"> <figure class="figure_frm origin_fig" contents-hash="c71f07819e0cf4e8d3e76df0690916af0318a8f86b910e4c503b233f43230353" dmcf-pid="uapeJsOcTx" dmcf-ptype="figure"> <p class="link_figure"><img class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/03/mk/20260803171203502gujq.jpg" data-org-width="1000" dmcf-mid="pBSqbinQSR" dmcf-mtype="image" height="auto" src="https://img4.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/03/mk/20260803171203502gujq.jpg" width="658"></p> </figure> <p contents-hash="80d77eb57fac8c35a55997d6bb82fa993a029cca9a65cb97da92351038f36356" dmcf-pid="7NUdiOIklQ" dmcf-ptype="general">인공지능(AI) 성능을 끌어올린 핵심 기술로 평가받는 '강화학습'이 AI 안전성 논란의 중심에 섰다. 최근 오픈AI의 모델이 사이버 보안 내부 테스트 중 격리 환경을 뚫고 허깅페이스 플랫폼과 다른 회사 서버를 해킹한 사실이 드러나면서다. AI가 스스로 판단하고 행동하는 범위가 넓어지면서 AI에 어디까지 권한을 부여할지가 새로운 과제로 떠오르고 있다.</p> <p contents-hash="2c9f9bc2e475e1ea2faaadb4922f28a21ca69b2e1563b09a8d1890c711392a8d" dmcf-pid="zjuJnICEvP" dmcf-ptype="general">◆ AI 키운 지도학습·강화학습</p> <p contents-hash="13c29b87eef63644366c6016eac8ce29c8a29725001feb47b141b167b1cd5fc9" dmcf-pid="qA7iLChDl6" dmcf-ptype="general">그동안 생성형 AI는 방대한 데이터를 학습한 뒤 지도학습과 강화학습 등을 거쳐 답변의 정확도를 높여왔다. 지도학습은 사람이 만든 정답 사례를 바탕으로 AI가 질문에 적절한 답을 생성하는 방법을 익힌다. 예를 들어 AI에 수만 장의 강아지 사진을 학습시키면서 '강아지'라는 라벨을 붙여 공통 특징을 익히게 하면 학습을 마친 AI는 라벨이 없는 새로운 동물 사진이 입력돼도 강아지인지를 정확하게 분류해낼 수 있다. 이후 강화학습을 통해 사람이 선호하는 답변과 올바른 추론 방식에 높은 점수를 주면서 모델의 행동을 다듬는다.</p> <p contents-hash="77aa78a9c45947244cc57f701a15fcf4be96c20ef32c5c3540c402f6eebbc024" dmcf-pid="BcznohlwS8" dmcf-ptype="general">두 학습 방식은 AI가 배우는 재료부터 다르다. 지도학습은 사람이 정답을 표시한 데이터를 제공하고 AI의 예측과 정답 간 차이를 줄이는 방식이다. 이미지 분류와 문서 분석처럼 정확한 분류와 예측이 필요한 업무에 주로 활용된다. 다만 학습 데이터에 편향이 있으면 AI의 결과에도 같은 편향이 반영될 수 있다.</p> <p contents-hash="79d99399ee38944e7fbf4d4f7198ed8624494e0e73153c81a98e20d88cfc2e08" dmcf-pid="bkqLglSrl4" dmcf-ptype="general">그러나 강화학습에는 정답지가 없다. AI는 현재 상황에서 행동한 결과에 따라 보상이나 벌칙을 받고 이를 반복하며 가장 큰 누적 보상을 얻는 전략을 스스로 학습한다. '알파고'가 대표적이다. 게임 규칙만 알려주고 스스로 게임을 하면서 발전하도록 강화학습을 적용한 AI다.</p> <p contents-hash="770063de516d6bb29d3d82e2a5afbf3852b6cfe83db4476ced5aefd10e8aa7c9" dmcf-pid="KEBoaSvmlf" dmcf-ptype="general">강화학습은 정답을 미리 정하기 어려운 환경에서 강점을 보인다. 자율주행차처럼 도로 상황에 맞춰 주행 전략을 바꾸거나 로봇과 같이 작업 환경에 따라 움직임을 조정하는 경우에 적합하다. 예를 들어 차선을 잘 지켜 안전하게 이동하면 보상을 주고, 차선을 벗어나거나 장애물에 부딪치면 벌칙을 부여해 위험 상황에 대처하는 능력을 기른다.</p> <p contents-hash="a7cb3f1ae965cf3be73b2f241f4df39b655669c270c0d65c0e05c1324224b2d5" dmcf-pid="9r9NAyWIWV" dmcf-ptype="general">◆ 강화학습이 야기한 보상 해킹</p> <p contents-hash="8ff82d49f109399f4268219d9725098575d610ba31ee5b7184516ae30ebd61c8" dmcf-pid="2m2jcWYCS2" dmcf-ptype="general">강화학습 시장은 빠르게 성장하고 있다. 시장조사 업체 리서치네스터에 따르면 전 세계 강화학습 시장 규모는 지난해 1226억달러(약 175조원)에서 2035년에는 19조100억달러(약 2경7305조원)까지 성장할 것으로 예상된다. 연평균 성장률이 65.6%에 달한다. 스스로 실행하는 AI 에이전트, 자율주행, 피지컬 AI 확산이 시장 성장을 이끌고 있다.</p> <p contents-hash="43711877aed0276829da0c3ccc678f49c011d3efe53a27f1ae44a2461666b745" dmcf-pid="VsVAkYGhy9" dmcf-ptype="general">하지만 강화학습은 보상 기준이 잘못 설계되면 의도하지 않은 행동을 학습할 수 있다는 한계도 있다. AI업계에서는 이를 '보상 해킹(Reward Hacking)'이라고 부른다. 목표 자체보다 보상 체계의 허점을 이용해 높은 점수만 얻으려는 행동으로, 오픈AI와 앤트로픽 같은 주요 AI 기업에서 차세대 AI의 주요 위험 가운데 하나로 지목하고 있다.</p> <p contents-hash="198d79096260c4737b2813f3b2b00b402bc69137a0e12d6c162fcf0b6264399a" dmcf-pid="fOfcEGHlyK" dmcf-ptype="general">최근 발생한 오픈AI 모델의 허깅페이스 플랫폼 해킹 사례가 대표적이다. 사이버 보안 문제를 풀도록 설정된 모델은 문제 자체를 정상적으로 해결하는 대신 정답이 저장된 서버의 위치를 추론해 접근했다. 문제를 풀라고 했더니 정답지를 훔치러 간 셈이다. 특히 인터넷이 차단된 환경에서도 새로운 취약점을 찾아 다른 시스템으로 이동할 수 있는 경로를 만들어냈다. 주어진 목표를 가장 빠르게 달성할 방법을 찾는 과정에서 예상 밖 행동을 선택한 사례인 것이다.</p> <p contents-hash="03b3c4994ba6ab703e8cbf62f1267b049935558d134138b6cd788e3faf98662c" dmcf-pid="4I4kDHXSTb" dmcf-ptype="general">강화학습 관점에서 보면 보안 평가에서는 취약점을 찾아내는 것이 높은 보상으로 연결되자 모델은 샌드박스 안에서 문제를 푸는 대신 정답이 있는 서버를 추론하고 외부 시스템으로 이동할 수 있는 경로를 스스로 탐색했다. 사람이라면 규칙 위반으로 인식할 행동도 AI는 목표 달성에 유리한 선택지 가운데 하나로 판단한 것이다.</p> <p contents-hash="80f962ed6f245cb74b97e865b660ceb91b8cc68bf650bd5f03798c101582ffcc" dmcf-pid="8C8EwXZvWB" dmcf-ptype="general">◆ 피해 기업의 대응 체계도 허점</p> <p contents-hash="c32077084e25e65fc9e0d9f83fd40360571ab9734426807580eeeac4b047e187" dmcf-pid="6h6DrZ5TTq" dmcf-ptype="general">앤트로픽은 오픈AI의 보안 사고 이후 인터넷 접속 가능성이 있었던 보안 평가 14만1006건을 다시 점검했다. 그 결과 미토스와 내부 연구용 모델이 실제 기업 3곳의 운영망에 무단으로 접근한 사실을 확인했다. 앤트로픽의 사고는 오픈AI 사례와 달리 모델이 취약점을 뚫고 격리망을 빠져나간 것은 아니었다. 앤트로픽과 외부 평가 업체 간 착오로 시험망에 인터넷 통로가 열려 있었고, 모델은 '인터넷에 연결돼 있지 않다'는 지시를 받았기 때문에 검색 과정에서 만난 실제 시스템도 모의훈련의 일부로 판단했다. 일반 서비스에 적용되는 공격 차단·감시 장치도 평가 모델에는 설치돼 있지 않았다.</p> <p contents-hash="2224a094800814ed4bab9ca44a7e79b545166e8be17f70652ceae978e6076727" dmcf-pid="PlPwm51yTz" dmcf-ptype="general">오픈AI의 보안 사고 이후 피해 기업의 대응 체계도 허점을 드러냈다. 허깅페이스는 오픈AI 모델이 자사 시스템에 침입하며 남긴 1만7000여 건의 기록을 상용 AI로 분석하려 했지만, 공격 명령과 악성 코드가 안전장치에 걸렸다.</p> <p contents-hash="bd2377f6817c1f2c5a3e1d4e621d68cad9c52902a31c818af992d3c439b94a20" dmcf-pid="QSQrs1tWh7" dmcf-ptype="general">앤트로픽의 클로드는 안전을 이유로 분석을 거부했다. 결국 허깅페이스는 사용자가 직접 통제할 수 있는 중국산 오픈소스 모델 'GLM-5.2'를 자체 서버에서 가동해 공격 경로와 침입 과정을 재구성했다. 사이버 공격에 활용될 가능성이 있다는 우려가 제기된 오픈소스 모델이 오히려 사고 대응 도구로 쓰인 역설적인 장면이다. </p> <p contents-hash="41faf4e9cc17265a42dc0f02ca5118685da9232709d09ecadfc5df96b30f61d3" dmcf-pid="xvxmOtFYCu" dmcf-ptype="general">[박성배 기자]</p> </section> </div> <p class="" data-translation="true">Copyright © 매일경제 & mk.co.kr. 무단 전재, 재배포 및 AI학습 이용 금지</p> 관련자료 이전 '23연승 신기록' 씨름 김무호, 문경대회서 통산 14번째 한라장사 08-03 다음 진천군, CCTV 2106대로 생활안전망 똑똑하게 고도화한다 08-03 댓글 0 등록된 댓글이 없습니다. 로그인한 회원만 댓글 등록이 가능합니다.