ko

Please fill in your name

Mobile phone format error

전화번호를 입력해 주세요

회사 이름을 입력해 주세요

회사 이메일을 입력해 주세요

데이터 요구사항을 입력해 주세요

Successful submission! Thank you for your support.

Format error, Please fill in again

Confirm

데이터 요구사항은 5자 이상이며 숫자만으로 구성될 수 없습니다

Interspeech 2026-MLC-SLM 다국어 대화 음성 경연 데이터

대화
음성 데이터
다국어
MLC-SLM
챌린지

Interspeech 2026-MLC-SLM 다국어 대화 음성 경연 데이터셋은 넥스데이타가 2026년에 개최한 MLC-SLM 다국어 대화 음성 경연을 배경으로 하며, 넥스데이타 자체 보유 21종의 대화 음성 데이터셋으로 구성됩니다. 높은 정확도와 활용성을 갖추고 있으며, 다국어 음성 인식 및 장문 컨텍스트 이해 기술의 한계를 극복하기 위해 설계되었습니다. 화자 간 발화 중첩, 즉흥적인 끼어들기 등 복잡한 상호작용 상황을 실제 환경에서 포착하여 음성 인식 관련 연구 및 애플리케이션에 풍부한 리소스를 제공하며, 실제 환경의 다양성에 직면한 모델의 성능 향상에 기여할 수 있습니다. 넥스데이타는 데이터 보호 법규 및 개인정보 보호 규정을 엄격하게 준수하며, 데이터 수집, 저장 및 사용 과정에서 사용자의 개인정보와 합법적인 권익을 보호합니다. 모든 데이터는 GDPR, CCPA, PIPL을 준수합니다.

유료 데이터셋
이는 상업적 사용, 연구 목적 등을 위한 유료 데이터셋입니다.라이선스가 부여된 기성 데이터셋은 AI 프로젝트의 빠른 시작에 도움을 줍니다.
사양사양
데이터 형식
16kHz, 16bit, 비압축 WAV, 모노
녹음 환경
상대적으로 조용한 실내 환경, 무반향 환경
녹음 내용
주제 목록을 제공하고, 녹음자가 자신이 익숙한 여러 주제를 선택하여 자연스럽고 원활한 대화를 진행할 수 있도록 하며, 각 주제를 중심으로 대화를 나누고 녹음
어노테이션 특징
텍스트 내용, 유효 문장의 시작 및 종료 시점, 화자 식별자에 대한 어노테이션
녹음 장비
안드로이드 스마트폰, 아이폰
언어
미국식 영어, 영국식 영어, 필리핀 영어, 호주 영어, 인도 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어, 태국어, 베트남어, 캐나다 프랑스어, 브라질 포르투갈어, 멕시코 스페인어, 타갈로그어, 터키어, 우르두어
샘플 샘플
  • Audio

    And we are going to talk about celebrities so Seville, why don't you tell me some of your favorite celebrities?

  • Audio

    Yeah, I mean speaking of the Kardashians, I just think it's so weird how their career excelled. You know.

  • Audio

    Well, I I mean I I couldn't tell you for sure without actually living it. Maybe for like a week or something.

  • Audio

    Oui bien sûr, j'ai vu surtout euh voilà les couleurs tendances cette année.

  • Audio

    Cent-vingts euros pour une robe que je vais la porter pendant un mariage, je trouve que c'est assez raisonnable franchement.

추천 데이터셋추천 데이터셋
579시간 48kHz 풀 듀플렉스 일본어 자연 대화 마이크 수집 음성 데이터

본 데이터는 풀 듀플렉스(Full Duplex) 대화를 전제로 수집한 고품질 일본어 음성 데이터셋입니다. Half Duplex 방식으로 재현하기 어려운 동시 발화와 중첩 발화, 자연스러운 맞장구와 끼어들기 등을 포함하여 양방향으로 동시에 진행되는 대화를 재현한 동시 양방향 음성 데이터셋으로, 실시간 대화형 AI 및 차세대 ASR의 연구개발에 적합합니다. 본 데이터셋은 제공된 주제 목록에서 화자가 자신 있는 여러 주제를 선택하고, 자연스러운 대화를 진행하여 수집한 일본어 자연 대화 음성 데이터셋입니다. 일본 각 지역의 네이티브 화자가 참여한 다양한 대화를 포함하며, 고음질로 수집된 데이터를 기반으로 ASR 음향 및 언어 모델 학습, 화자 식별, 대화 시스템 평가 등 다양한 연구 분야에 활용할 수 있습니다. 데이터는 각종 개인정보 보호 규정을 준수하여 관리하고 있습니다. 당사의 풀 듀플렉스 음성 데이터셋 시리즈는 일본어를 비롯해 영어, 한국어 등 다양한 언어를 지원하며, 전사 텍스트, 발화 타임스탬프, 화자 ID, 성별 등의 상세 어노테이션을 기본으로 제공합니다. 또한 화자별 독립 음성을 포함한 화자 분리 음성 데이터셋으로도 활용할 수 있으며, 녹음 조건, 화자 속성 및 라벨 사양에 따른 맞춤형 데이터 수집 및 제작에도 유연하게 대응할 수 있습니다.

풀 듀플렉스 일본어 일본어 음성 데이터 자연 대화 음성 인식 학습 데이터
특별한 요청 사항을 알려주세요

프로젝트 성숙도

초기 검토 단계 (구체적인 사양은 아직 없음)
목표는 명확하나 전문적인 가이드가 필요함
개발 또는 최적화 단계
명확한 데이터 사양을 보유한 데이터/라벨링 전문가 팀

제출함으로써,개인정보 보호 정책에 동의합니다

ad944ee1-6a6d-4f7e-9d90-3ee9a6d7187e

23a360ad-e275-49ac-ad06-8df401bf6646