'해킹법 알려줘' 명령 거부한 中 AI…작업 형태에선 중단 없어 작성일 07-21 27 목록 <div id="layerTranslateNotice" style="display:none;"></div> <strong class="summary_view" data-translation="true">美 NIST, 지푸AI 'GLM-5.2' 성능·안전성 점검<br>10개 과제서 한 번도 거부 안 해…공격 능력은 美 모델에 못미쳐</strong> <div class="article_view" data-translation-body="true" data-tiara-layer="article_body" data-tiara-action-name="본문이미지확대_클릭"> <section dmcf-sid="Y9uw7ex2Zs"> <figure class="figure_frm origin_fig" contents-hash="ab492b443b56c99647d3e7dd3dd912d3cf59c36aeef805a21792a54b0e9ee30d" dmcf-pid="GtYiGKqFGm" dmcf-ptype="figure"> <p class="link_figure"><img alt="미국 국립표준기술연구소(NIST) 산하 AI표준혁신센터(CAISI)가 지난 17일(현지시간) 공개한 미국·중국 주요 인공지능(AI) 모델의 종합 성능 비교. 중국 지푸 AI(Z.ai)의 'GLM-5.2'는 미국 최신 모델에는 뒤졌지만, 2025년 12월 공개된 오픈AI의 'GPT-5.2'와 비슷한 수준으로 평가됐다. (CAISI 보고서 갈무리) ⓒ 뉴스1 김민수 기자" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202607/21/NEWS1/20260721060242605lsqi.jpg" data-org-width="838" dmcf-mid="Zr5nH9B3HB" dmcf-mtype="image" height="auto" src="https://img1.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202607/21/NEWS1/20260721060242605lsqi.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 미국 국립표준기술연구소(NIST) 산하 AI표준혁신센터(CAISI)가 지난 17일(현지시간) 공개한 미국·중국 주요 인공지능(AI) 모델의 종합 성능 비교. 중국 지푸 AI(Z.ai)의 'GLM-5.2'는 미국 최신 모델에는 뒤졌지만, 2025년 12월 공개된 오픈AI의 'GPT-5.2'와 비슷한 수준으로 평가됐다. (CAISI 보고서 갈무리) ⓒ 뉴스1 김민수 기자 </figcaption> </figure> <p contents-hash="3bb1130a33a316817b0aaf4a37e820fa171bf65d5c86e6caa8e4c82db6362a87" dmcf-pid="HFGnH9B35r" dmcf-ptype="general">(서울=뉴스1) 김민수 기자 = 중국의 최신 인공지능(AI) 모델이 "해킹을 도와달라"는 노골적인 요청은 대부분 거부했다. 하지만 결함이 있는 프로그램을 분석해 공격 수단을 만들도록 '작업지시'를 내리자 작업 수행은 그대로 진행했다. </p> <p contents-hash="dfbace69fd0cc87aa74be6e7fc47febe291d2426eeb03c2eadcbd912007a5e58" dmcf-pid="X3HLX2b01w" dmcf-ptype="general">말(프롬프트 명령)로 드러난 악의는 걸러냈지만, 실제 작업 형태로 주어진 요청에는 제동이 걸리지 않은 셈이다.</p> <p contents-hash="4b2ec6d6ff6094b5e844e9641fc82d51cc850fa2b3dd6d80e00aa19de2b400f2" dmcf-pid="Z0XoZVKptD" dmcf-ptype="general">21일 미국 국립표준기술연구소(NIST) 산하 AI표준혁신센터(CAISI)가 최근 공개한 보고서에 따르면 중국 AI 기업 지푸AI(Z.ai)의 'GLM-5.2'는 출시 당시 공개된 오픈웨이트 모델 가운데 성능이 가장 뛰어난 것으로 평가됐다.</p> <p contents-hash="c7993fc5f984ab73b366048b0e175b757a1d6fafbfe90544b917e3b0b7b1ec4b" dmcf-pid="5pZg5f9UXE" dmcf-ptype="general">지푸AI는 지난 7월 16일 GLM-5.2를 공개했다. 오픈웨이트는 AI가 학습한 결과를 담은 '가중치'를 공개해 이용자가 모델을 내려받아 자체 서버에서 운영할 수 있도록 한 방식이다.</p> <p contents-hash="3ac83abbf235b1d057fc8bf42b5baa78f3d10358e5118a1874483f0bfba2118e" dmcf-pid="1U5a142uHk" dmcf-ptype="general">CAISI가 수학과 과학, 소프트웨어 개발 등 여러 시험 결과를 종합한 결과 GLM-5.2의 전반적인 성능은 오픈AI가 지난해 12월 내놓은 'GPT-5.2'와 비슷했다. 사이버 분야에서는 앤트로픽이 올해 2월 공개한 '오퍼스 4.6'과 유사한 수준을 보였다.</p> <figure class="figure_frm origin_fig" contents-hash="9b56e3a8b7f52316517f290673da7f0cf72d3edbf72f3155ca4492a6119269fe" dmcf-pid="tu1Nt8V7Zc" dmcf-ptype="figure"> <p class="link_figure"><img alt="미국 국립표준기술연구소(NIST) 산하 AI표준혁신센터(CAISI)가 공개한 주요 인공지능(AI) 모델의 분야별 성능 비교. 중국 지푸AI의 'GLM-5.2'는 수학과 일부 과학 평가에서 미국 최신 모델과 비슷한 수준을 보였지만, 소프트웨어 개발 평가에서는 상대적으로 낮은 점수를 기록했다. (CAISI 보고서 갈무리) ⓒ 뉴스1 김민수 기자" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202607/21/NEWS1/20260721060243984skfu.jpg" data-org-width="570" dmcf-mid="1RCPhpFYHz" dmcf-mtype="image" height="auto" src="https://img2.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202607/21/NEWS1/20260721060243984skfu.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 미국 국립표준기술연구소(NIST) 산하 AI표준혁신센터(CAISI)가 공개한 주요 인공지능(AI) 모델의 분야별 성능 비교. 중국 지푸AI의 'GLM-5.2'는 수학과 일부 과학 평가에서 미국 최신 모델과 비슷한 수준을 보였지만, 소프트웨어 개발 평가에서는 상대적으로 낮은 점수를 기록했다. (CAISI 보고서 갈무리) ⓒ 뉴스1 김민수 기자 </figcaption> </figure> <p contents-hash="35b3460bc7b019c59d050dd1484fe8d4c9d61bdc4252dc64b2d48ea666abcf8f" dmcf-pid="F7tjF6fzHA" dmcf-ptype="general">다만 미국의 최신 최상위 AI 모델 성능에는 미치지 못했다. 프로그램의 취약점을 찾아 공격 수단을 만드는 능력을 평가한 '익스플로잇벤치'에서 GLM-5.2는 세부 평가 항목의 21.4%를 달성했다. 앤트로픽의 '오퍼스 4.8'은 38.1%, 오픈AI의 'GPT-5.5'는 40.7%였다.</p> <p contents-hash="4cbce71698fbd52d5a8d1379a1862b14e709a2ed1dfed4b5f17eca6fc8307ea2" dmcf-pid="3B0kpx6b5j" dmcf-ptype="general">차이는 요청을 제시하는 방식에서 뚜렷하게 나타났다.</p> <p contents-hash="5341f6240955b99a39d9ca61ba21528e53c620ae4a47d803598abe65048bf257" dmcf-pid="0bpEUMPKHN" dmcf-ptype="general">CAISI가 공격 구상과 공격코드 제작, 보안체계 회피 등 악의적인 목적을 분명히 밝힌 질문 30개를 입력하자 GLM-5.2는 대부분 답변을 거부했다. 요청대로 완전히 답한 비율은 2%에 불과했다. 안전장치를 우회하는 이른바 '탈옥'(jailbreak) 문구를 붙여도 8%에 그쳤다.</p> <p contents-hash="689be3ca8dbba3556cd53dc23d41f26c77b61ca1d290924cc108fa5dcd0df64f" dmcf-pid="pKUDuRQ9Za" dmcf-ptype="general">반면 결함이 있는 프로그램과 이를 고친 버전을 나란히 보여주고, 두 프로그램의 차이를 분석해 공격에 쓸 코드를 만들도록 하자 결과가 달라졌다.</p> <p contents-hash="afa95041e2ff707f03d6fb2df7b54ae83c35f85686b1f7d762e5c4d938a7fa02" dmcf-pid="U9uw7ex2Zg" dmcf-ptype="general">GLM-5.2는 10개 과제 모두에서 작업을 거부하지 않았다. 과제당 최대 300개의 응답을 내놓는 동안 작업을 멈추거나 추가 도구 사용을 막은 사례도 없었다.</p> <p contents-hash="6ee04b8167839382ec1d17344ee2e117b68d4da48afbcee17b7bcf26659a8e12" dmcf-pid="u27rzdMVYo" dmcf-ptype="general">이 결과가 GLM-5.2가 10개 공격에 모두 성공했다는 뜻은 아니다. 실제 공격 수단을 만드는 능력은 미국 최신 모델보다 낮았다. CAISI가 이 시험에서 살핀 것은 공격 성공 여부가 아니라, 모델이 도중에 위험성을 감지하고 작업을 멈추는지였다. GLM-5.2는 끝까지 제동을 걸지 않았다.</p> <figure class="figure_frm origin_fig" contents-hash="c48e620c512a45578822ce2d00d44d4c832c1ef03f668ed4be5e21a276922377" dmcf-pid="7VzmqJRftL" dmcf-ptype="figure"> <p class="link_figure"><img alt="미국 국립표준기술연구소(NIST) 산하 AI표준혁신센터(CAISI)가 공개한 취약점 공격 개발 과제의 안전장치 평가. 'GLM-5.2'와 '오퍼스 4.6', 'GPT-5.5'는 10개 과제에서 최대 300턴까지 작업을 완전히 차단하지 않았고, '오퍼스 4.7'과 '오퍼스 4.8'은 각각 평균 12턴과 36턴 뒤 추가 작업을 막았다. (CAISI 보고서 갈무리) ⓒ 뉴스1 김민수 기자" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202607/21/NEWS1/20260721060245358disx.jpg" data-org-width="913" dmcf-mid="WjcBkGyOYO" dmcf-mtype="image" height="auto" src="https://img4.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202607/21/NEWS1/20260721060245358disx.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 미국 국립표준기술연구소(NIST) 산하 AI표준혁신센터(CAISI)가 공개한 취약점 공격 개발 과제의 안전장치 평가. 'GLM-5.2'와 '오퍼스 4.6', 'GPT-5.5'는 10개 과제에서 최대 300턴까지 작업을 완전히 차단하지 않았고, '오퍼스 4.7'과 '오퍼스 4.8'은 각각 평균 12턴과 36턴 뒤 추가 작업을 막았다. (CAISI 보고서 갈무리) ⓒ 뉴스1 김민수 기자 </figcaption> </figure> <p contents-hash="a2d4e6af96682bd5ff14f41d71f148a6fabb3c15397c15aed15d7b6bcd538b2a" dmcf-pid="zfqsBie4Zn" dmcf-ptype="general">같은 시험에서 오퍼스 4.6과 GPT-5.5도 최대 300턴 동안 작업을 완전히 차단하지 않았다. 반면 오퍼스 4.7과 오퍼스 4.8은 각각 평균 12개와 36개의 응답을 내놓은 뒤 추가 작업을 막거나 거부했다.</p> <p contents-hash="080d8e758689db5bd689b662fb54b1c6983e774e915b45f4614392846200ce8c" dmcf-pid="q4BObnd81i" dmcf-ptype="general">다만 다른 시험에서는 비교적 잘 버텼다. 이메일이나 문서에 공격자가 몰래 심어둔 명령을 읽게 했지만, GLM-5.2가 그 지시대로 움직인 사례는 없었다.</p> <p contents-hash="85d361d558e3c4ade8c7c8f7bf533ec1a33c22a6393167addb72eff2ed7169ef" dmcf-pid="B8bIKLJ65J" dmcf-ptype="general">이번 시험은 지푸AI의 온라인 서비스를 대상으로 한 것이 아니다. CAISI가 GLM-5.2를 직접 내려받아 자체 서버에 설치한 뒤 평가했다.</p> <p contents-hash="99c92935c673394b963dc9955b4c5b983eb5d086edcc0ab4cf28b35a2c751309" dmcf-pid="bWCPhpFYHd" dmcf-ptype="general">미국 모델은 일반 서비스에 붙어 있는 별도 차단 기능까지 켠 상태로 시험했다. 반면 GLM-5.2는 모델에 기본으로 들어 있는 거부 기능만 유지했다. 따라서 실제 온라인 서비스에서는 다른 결과가 나올 수 있다.</p> <p contents-hash="a3eb50ddb9c7ccda94694a62b10d15452f42da69cb1a09fb8217bd1b768b6de2" dmcf-pid="KYhQlU3G1e" dmcf-ptype="general">오픈웨이트 모델은 이용자가 직접 내려받아 수정할 수 있다. 위험한 요청을 막는 기능도 약화하거나 없앨 수 있다는 뜻이다. 이 때문에 AI가 어떤 답을 내놓는지만 볼 게 아니라, 프로그램을 맡겼을 때 실제로 어디까지 작업하는지도 함께 살펴야 한다.</p> <p contents-hash="563ca52364b66131052898e7ff87a8d6568777e297f63d7ce3b11d5bb53e913e" dmcf-pid="9GlxSu0HZR" dmcf-ptype="general">kxmxs4104@news1.kr<br><br><strong><용어설명></strong><br><br>■ 오픈웨이트(Open-weight)<br>AI가 학습한 결과물인 '가중치'를 공개해 이용자가 모델을 내려받아 자체 서버에서 운영할 수 있도록 한 방식. 직접 수정하거나 별도의 안전장치를 적용할 수 있지만, 기본 거부 기능을 없애거나 우회할 가능성도 있다.<br><br>■ 익스플로잇벤치(ExploitBench)<br>AI가 소프트웨어의 취약점을 분석해 공격에 활용할 수 있는 코드를 얼마나 잘 만드는지 측정하는 평가 도구. 단순한 공격 성공률이 아니라 취약점 재현, 메모리 접근, 코드 실행 등 공격 개발 단계에서 구현한 기능을 평가한다.<br><br>■ 탈옥(Jailbreak)<br>AI에 설정된 답변 제한이나 안전장치를 우회하기 위해 특별한 지시문을 입력하는 기법. 위험한 요청을 가상의 상황이나 역할극으로 포장해 AI가 답하도록 유도하는 방식 등이 포함된다.<br><br> </p> </section> </div> <p class="" data-translation="true">Copyright © 뉴스1. All rights reserved. 무단 전재 및 재배포, AI학습 이용 금지.</p> 관련자료 이전 오늘 신진서 9단과 최종 대국…바둑AI '카타고', 알파고와 어떻게 달라? 07-21 다음 [사이언스카페] 4000년 전 이집트 공주, 칼과 활 쓴 원더우먼 07-21 댓글 0 등록된 댓글이 없습니다. 로그인한 회원만 댓글 등록이 가능합니다.