PunchUS Army to execute Texas military base shooter by firing squadInquirerFishing, sailing in Palawan waters banned on Oct 10 for next China rocket launchCNN Türk7 EKİM HAVA DURUMU TAHMİNLERİ: İl il hava durumu listesi! Meteoroloji'den toz taşınımı ve sağanak yağış uyarısı!RTP DesportoCarlos Padrão desdramatiza tensão entre Jesus e RonaldoBollywood HungamaKriti Sanon recalls GIVA ad controversy on the Kareena Kapoor Khan show: “My choli had become like a six-person panel discussion on prime-time news”ESPN DeportesCon qué poquito Chile humilló lo poquito de MéxicoDaily MaverickBOOK EXCERPT: Checkmate: Scandal, cheating and the billion-dollar rise of chess한겨레포니정 영리더상에 배드민턴 안세영·김도형 교수ZDF heuteAktuelle Pressemitteilungen des ZDFVanguardWorld Bank: Fuel price to slow Nigeria’s poverty reductionSözcüMüslüman iki komşu ülke birbirine girdi: Sabrımızı zorlamayınCapital FMTelcos compelled to notify subscribers before recycling mobile numbers under new rules
The Daily Newsstand · Free, Always
Wednesday, October 7, 2026

서울시립대학교 인공지능학과 학부연구생 박현우·엄준혁, 세계적 권위 AI 학회 NeurIPS 논문 발표

Translate
(왼쪽부터) 박현우, 엄준혁, 성백륜. (서울시립대학교 제공)
(왼쪽부터) 박현우, 엄준혁, 성백륜. (서울시립대학교 제공)

광고

서울시립대학교(총장 원용걸) 인공지능학과 고상기 교수 연구팀의 논문 「Risk-Aware Action Repetition via Expected Skip Evaluation」이 인공지능 분야 최고 권위 국제학술대회인 NeurIPS 2026(신경정보처리시스템학회) 메인 트랙에 채택됐다. 올해 메인 트랙에는 3만여 편의 논문이 제출됐으며, 이 중 메인 트랙에 채택된 논문은 전체의 25.7%에 불과하다.

이번 연구는 강화학습(Reinforcement Learning) 에이전트가 선택한 행동을 여러 단계 동안 그대로 반복하는 ‘행동 반복(action repetition)’ 기법을 다룬다. 행동 반복은 매 순간 새로 판단할 필요가 없어 학습 속도를 높일 수 있다는 장점이 있다. 하지만 기존 연구들은 반복이 끝난 직후 에이전트가 최적의 행동을 할 수 있다고 가정하고 반복의 가치를 평가해 왔다. 그러나 학습 중인 에이전트의 판단은 아직 불완전하기 때문에 이러한 가정은 낭떠러지와 같은 위험 구간 근처에서도 지나치게 긴 반복을 선택하게 만드는 한계가 있었다.

연구팀은 반복 이후의 상황을 이상적인 최적 행동이 아닌 학습 중 실제로 기대되는 행동을 기준으로 평가하는 ‘기대 기반 스킵 평가(Expected Skip Evaluation)’를 제안하고, 이를 적용한 ‘RARe(Risk-Aware Repetition)’를 개발했다. RARe는 안전한 구간에서는 행동을 길게 유지해 학습을 가속하고, 위험 구간에서는 반복을 짧게 조정한다. 격자 환경, 연속 제어, 안전 강화학습(Safe RL) 벤치마크에서 기존 방법보다 높은 학습 효율과 더 정확한 위험 대응을 확인했다.

광고

이번 논문에는 고상기 교수의 지도 아래 학부연구생 박현우(제1저자)·엄준혁(제2저자) 학생과 석사과정 성백륜 학생(공동저자)이 참여하였다. 학부연구생들이 대학원생과 함께 새로운 방법을 제안하고 실험을 통해 검증한 학생 주도 연구라는 점에서 의미가 있다. 연구팀은 이번 연구 성과가 자율주행·로봇 등 안전이 중요한 분야의 AI 의사결정 기술로 이어질 것으로 기대하고 있다.

S: 출발 지점, G: 목표 지점, 붉은 칸: 위험 구역. (서울시립대학교 제공)
S: 출발 지점, G: 목표 지점, 붉은 칸: 위험 구역. (서울시립대학교 제공)
위험을 고려한 최적 의사결정 비율(RODR, 높을수록 우수) - 붉은 선: 제안 기업 RARe. (서울시립대학교 제공)
위험을 고려한 최적 의사결정 비율(RODR, 높을수록 우수) - 붉은 선: 제안 기업 RARe. (서울시립대학교 제공)
View the original on 한겨레 →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.