건국대 연구팀, 바로AI의 ‘포세이돈’으로 음성 AI 연구…INTERSPEECH Top4 이어 오픈 벤치마크 세계 1위

2026.07.28

건국대 연구팀, 바로AI의 ‘포세이돈’으로 음성 AI 연구…
INTERSPEECH Top4 이어 오픈 벤치마크 세계 1위

  • INTERSPEECH 2025 챌린지 Task1·Task2 세계 4위
  • 후속 모델 MATER+, 글로벌 오픈 벤치마크(SERB) 감정 분류 부문 세계 1위 달성
  • BARO AI의 수냉식 GPU 서버 POSEIDON 기반 연구 환경으로 대규모 AI 학습 지원

건국대학교 공과대학 컴퓨터공학과 김은이 교수 연구팀이
바로AI의 수냉식 GPU 서버 'POSEIDON Ultimate(A100X4)' 환경에서 수행한
음성 AI 분야 대표 국제학회 INTERSPEECH 2025와 글로벌 오픈 벤치마크에서 연이어 세계 상위권 성과를 거뒀습니다.

연구팀은 INTERSPEECH 2025에서 개최된 Speech Emotion Recognition in Naturalistic Conditions Challenge에서
자체 개발한 AI 모델 MATER로 감정 분류(Task 1)와 감정 속성 예측(Task 2) 부문 모두 세계 4위를 기록했으며,
후속 모델 MATER+를 통해 Speech Emotion Recognition Benchmark(SERB) 감정 분류(Task 1) 부문 세계 1위를 달성했습니다.

소음과 일상 속 '진짜 감정'을 읽어내는 기술, INTERSPEECH 2025

INTERSPEECH 2025에서 열린 Speech Emotion Recognition in Naturalistic Conditions Challenge는
미국 카네기멜론대학교(CMU)와 존스홉킨스대학교(JHU)가 공동 주최하는 글로벌 음성 AI 경진대회입니다.
실제 환경에서 수집된 음성을 기반으로 AI가 화자의 감정을 얼마나 정확하게 이해하는지를 평가하며,
음성뿐 아니라 발화 내용의 문맥까지 함께 분석해 감정과 세부 속성을 예측해야 하는 고난도 과제로 알려져 있습니다.

3,400명의 목소리로 학습한 'MATER'… 세계 4위로 검증된 기술력

건국대 연구팀은 Voinosis 팀명으로 이번 챌린지에 참가했습니다.

INTERSPEECH 2025 챌린지 감정 속성 예측 리더보드입니다. Voinosis(보이노시스) 팀이 감정의 긍정/부정 상태를 예측하는 Valence 부문에서 인프라 솔루션 업체 바로에이아이(BARO AI)의 포세이돈 서버로 0.6941점으로 세계 2위를 기록했습니다.

INTERSPEECH 2025 챌린지 Task 2(감정 속성 예측) 리더보드. Voinosis(보이노시스) 팀이 감정의 긍정/부정 상태를 예측하는 Valence 부문에서 0.6941점으로 세계 2위를 기록했습니다.

연구팀이 개발한 MATER(Multi-level Acoustic and Textual Emotion Representation)는 약 3,400명의 화자가 참여한
200시간 규모의 MSP-Podcast 데이터셋을 학습한 음성 감정 인식 AI 모델입니다.
음성과 발화 내용을 함께 분석하고 여러 AI 모델의 예측 결과를 결합하는 앙상블 기법을 적용해
실제 환경에서도 안정적인 감정 인식 성능을 구현했습니다.

이를 바탕으로 감정 분류(Task 1)와 감정 속성 예측(Task 2) 모두 세계 4위를 기록했습니다.

 MATER 논문 내용이 궁금하다면?  

후속 모델 'MATER+'로 글로벌 벤치마크 SERB 1위 등극

글로벌 오픈 벤치마크(SERB) Task 1 리더보드입니다. Konkuk_AICV 팀이 인프라 솔루션 업체 바로에이아이(BARO AI)의 POSEIDON 서버로 세계 1위를 기록했으며, 기존 최고 성능 대비 Macro-F1 기준 1.25% 향상된 성능을 달성했습니다.

글로벌 오픈 벤치마크(SERB) TTask 1 리더보드. Konkuk_AICV 팀이 세계 1위를 기록했으며, 기존 최고 성능 대비 Macro-F1 기준 1.25% 향상된 성능을 달성했습니다.

연구팀은 이후 음성과 언어 정보를 결합하는 구조와 앙상블 전략을 개선한 후속 모델 MATER+를 개발했습니다.

현재 국제 저널 심사가 진행 중인 MATER+는 SERB에서 Konkuk_AICV 팀명으로 참가해
감정 분류(Task 1) 부문 세계 1위를 달성했습니다. 기존 최고 성능 대비 Macro-F1 기준 1.25% 향상된 성능을 기록하며
실제 환경 기반 음성 감정 인식 분야에서 경쟁력을 입증했습니다.

알츠하이머 AI 1위에 이은 연이은 쾌거, 검증된 연구 역량의 결실

건국대 연구팀은 앞서 건국대학교병원과 함께 참가한 IEEE ICASSP 알츠하이머 질환 AI 평가 세계대회에서도
BARO AI의 'POSEIDON' 기반 연구 환경을 활용해 세계 1위를 기록한 바 있습니다.

 지난 ICASSP 세계대회 1위 연구 이야기가 궁금하다면?  

이번 INTERSPEECH Top4와 SERB 세계 1위 성과는 연구 역량과 안정적인 AI 연구 환경이 만들어낸 성과로 평가됩니다.

대규모 AI 학습을 단 한 번의 이슈 없이 뒷받침한 바로AI의 ‘POSEIDON’

이번 연구는 BARO AI의 POSEIDON Ultimate Line-up(A100 GPU 4장 구성) 환경에서 수행됐습니다.

약 200시간 규모의 대규모 데이터셋 학습과 반복적인 모델 검증, 다양한 앙상블 실험이 장기간 이어지는 과정에서도
POSEIDON은 안정적인 GPU 연구 환경을 제공하며 연구를 지원했습니다.

연구팀은 연구 환경 최적화와 반복적인 학습 과정에서 별도의 시스템 이슈 없이 연구를 수행할 수 있었으며,
안정적인 GPU 환경이 연구 성과를 도출하는 데 도움이 됐다는 의견을 BARO AI 측에 전달했습니다.

또한 구축된 GPU 서버를 연구뿐 아니라 BARO AI 솔루션을 활용한 클라우드 기반 교육 환경에도 함께 활용하고 있으며,
정기적인 예방 점검과 유지보수 서비스를 통해 인프라 운영 부담을 줄이고 연구에 집중할 수 있었다는 의견도 전달했습니다.

BARO AI 관계자는 "AI 연구는 모델 성능뿐 아니라 장기간 안정적으로 학습과 검증을 수행할 수 있는 연구 환경이 중요하다"며
"앞으로도 연구자들이 인프라 운영 부담 없이 연구에 집중할 수 있도록 고성능 AI 인프라와 전문 기술 지원을 지속적으로
제공
하겠다"고 밝혔습니다.

INTERSPEECH 2025에 참가한 건국대 연구팀 사진입니다.

INTERSPEECH 2025에 참가한 건국대 연구팀