X

네이버클라우드, 고성능 AI ‘착시’ 잡았다…세계 3대 학회서 쾌거

이 기사 AI가 핵심만 딱!
애니메이션 이미지
한광범 기자I 2026.08.28 14:10:28
ai번역
  • 영어

Google 검색에서 이데일리 기사를 더 자주 볼 수 있습니다.

ECCV 논문 4편 채택…벤치마크 '지름길 오류' 지적·새 학습법 제시
영상·공간 이해 허점 진단…"단순 성능경쟁 넘어 신뢰 가능 AI 구축"

영상 이해 없이 정답이 도출되는 벤치마크 문항 유형, (b) 벤치마크 점수와 지름길 문항 비율의 상관관계, (c) 지름길 문항 필터링 전후 주요 모델의 성능 격차. (이미지=네이버클라우드)
영상 이해 없이 정답이 도출되는 벤치마크 문항 유형, (b) 벤치마크 점수와 지름길 문항 비율의 상관관계, (c) 지름길 문항 필터링 전후 주요 모델의 성능 격차. (이미지=네이버클라우드)
[이데일리 한광범 기자] 팀네이버가 세계 3대 컴퓨터 비전 학회 중 하나인 ‘ECCV(European Conference on Computer Vision) 2026’에 총 23건의 연구 논문을 채택시킨 가운데, 네이버(NAVER(035420))클라우드가 AI의 ‘이해 과정’과 ‘평가 체계’에 주목한 논문 4편을 공개했다.

네이버클라우드는 이번 ECCV 2026 학회에서 겉으로 드러나는 벤치마크 점수 뒤에 숨은 AI의 요령과 판단 오류를 진단하고, 이를 바로잡는 학습법을 제시했다고 28일 밝혔다.

우선 네이버클라우드는 AI의 영상 이해 능력을 평가하는 기존 비디오 벤치마크의 허점을 분석했다(논문: Video-Oasis: Rethinking Evaluation of Video Understanding). 기존 14개 벤치마크를 대상으로 영상 제거, 장면 순서 교란 등 6종의 테스트를 진행한 결과, 전체 문항의 55%는 영상을 제대로 보지 않고도 답을 맞힐 수 있는 것으로 나타났다. 이 같은 문항을 제외하고 재평가했을 때 주요 모델들의 정확도는 26~37% 수준에 그쳤다. 네이버클라우드는 새로운 평가 기준을 만드는 대신 기존 시험지 자체를 진단하는 도구를 제시했다.

AI가 사물에 의존해 행동을 관성적으로 판단하는 문제도 다뤘다(논문: Why Can‘t I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition). AI가 학습 데이터에서 ’서랍‘이 주로 ’닫는다‘와 조합된 것을 학습한 뒤, 실제 동작을 보지 않고 서랍만 보고 ’닫는다‘로 판단하는 식이다. 연구진은 영상 합성 기법과 역재생 학습법을 도입해 추가 데이터 수집이나 모델 확장 없이 학습 방법 개선만으로 동작 인식 정밀도를 향상시켰다.

네이버클라우드의 마스크 정제 기술 '피닉스(Phoenix)'가 AI의 부정확한 물체 윤곽(왼쪽, 빨간색)을 기존 방법(가운데)보다 정밀하게 보정한 결과(오른쪽, 초록색). (이미지=네이버클라우드)
네이버클라우드의 마스크 정제 기술 '피닉스(Phoenix)'가 AI의 부정확한 물체 윤곽(왼쪽, 빨간색)을 기존 방법(가운데)보다 정밀하게 보정한 결과(오른쪽, 초록색). (이미지=네이버클라우드)
AI의 취약점을 역이용해 정밀도를 높이는 마스크 정제 기술 ’피닉스(Phoenix)‘도 발표했다(논문: Learning from Adversity: Semantic-Aware Mask Refinement through Adversarial Perturbation). AI를 무력화하는 ’적대적 공격‘ 기술을 활용해 AI가 실제 헷갈려하는 영역의 연습 문제를 자동 생성했다. 이를 통해 물체 윤곽 추출 및 미세 영역 구분 정밀 분할 성능을 최대 21%p 끌어올렸다.

이미지 속 3차원 공간 구조를 언어 모델로 학습시키는 연구 ’스페이셜부스트(SpatialBoost)‘도 선보였다(논문: SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning). 2D 사진에서 깊이와 위치 정보를 추출해 문장으로 변환한 뒤, 점·물체·장면 전체 순으로 공간 이해를 단계별로 쌓아 언어 모델을 통해 시각 모듈에 주입하는 방식을 취했다. 3D 데이터 구축 비용 부담을 줄이면서도 로봇 조작 및 이미지 분류 성능을 동시에 높였다.

네이버클라우드 관계자는 “이번 채택 논문들은 AI가 실제로 정보를 제대로 처리하고 있는지 검증하고 개선 방향을 제시했다는 점에서 의미가 있다”며 “AI가 정보를 이해하고 판단하는 과정까지 연구해 신뢰할 수 있는 AI 생태계를 만들어 나갈 것”이라고 밝혔다.

이 기사 AI가 핵심만 딱!
애니메이션 이미지

주요 뉴스

ⓒ종합 경제정보 미디어 이데일리 - 상업적 무단전재 & 재배포 금지