ko

Please fill in your name

Mobile phone format error

전화번호를 입력해 주세요

회사 이름을 입력해 주세요

회사 이메일을 입력해 주세요

데이터 요구사항을 입력해 주세요

Successful submission! Thank you for your support.

Format error, Please fill in again

Confirm

데이터 요구사항은 5자 이상이며 숫자만으로 구성될 수 없습니다

음성 인식 데이터셋

넥스데이타는 고품질 ASR 모델 학습을 위해 다양한 억양, 환경, 언어 및 실제 시나리오를 포괄하는 고품질 음성 데이터셋을 제공합니다.

언어

전체
240
아랍어
8
버마어
3
중국어 방언
3
영어
52
프랑스어
15
독일어
14
힌디어
7
인도네시아어
8
이탈리아어
13
일본어
13
한국어
15
말레이어
4
만다린
3
기타
53
포르투갈어
16
러시아어
8
스페인어
19
태국어
12
베트남어
8

데이터 타입

전체
240
대화
127
읽기
114

214시간 풀 듀플렉스 한국어 자연 대화 휴대폰 수집 음성 데이터

214시간 풀 듀플렉스 한국어 자연 대화 휴대폰 수집 음성 데이터로, 일반적인 주제를 기반으로 대화를 시뮬레이션하여 녹음했습니다. 본 데이터셋에는 텍스트 내용, 문장 타임스탬프, 화자 식별 정보, 성별 등 다양한 속성이 어노테이션되어 있습니다. 서로 다른 지역과 문화적 배경을 가진 한국 현지인이 직접 녹음했으며, 높은 정확도를 바탕으로 음성 인식 관련 연구 및 응용에 활용할 수 있는 풍부한 리소스를 제공합니다. 여러 AI 기업의 검증을 거쳐 실제 환경의 다양한 상황에서도 모델의 성능 향상에 도움이 되는 것으로 확인되었습니다. 데이터 수집, 저장 및 활용 과정에서 관련 데이터 보호 법규와 개인정보 보호 규정을 엄격히 준수하여 사용자의 개인정보와 합법적인 권익을 보호하고 있으며, 모든 데이터는 GDPR, CCPA 및 PIPL을 준수합니다.
한국어 음성 데이터셋 대화형 한국어 음성 풀 듀플렉스 한국어 음성 데이터 음성 인식

172시간 미국 영어 풀 듀플렉스 화자별 채널 분리 자연 대화 휴대폰 수집 음성 데이터

미국 영어 화자별 채널 분리 자연 대화 휴대폰 수집 음성 데이터로, 일반적인 주제를 기반으로 대화를 시뮬레이션하여 녹음했습니다. 본 데이터셋에는 텍스트 내용, 문장 타임스탬프, 화자 식별 정보, 성별 등 다양한 속성이 어노테이션되어 있습니다. 서로 다른 지역과 문화적 배경을 가진 미국 현지인이 직접 녹음했으며, 높은 정확도를 바탕으로 음성 인식 관련 연구 및 응용에 활용할 수 있는 풍부한 리소스를 제공합니다. 여러 AI 기업의 검증을 거쳐 실제 환경의 다양한 상황에서도 모델의 성능 향상에 도움이 되는 것으로 확인되었습니다. 데이터 수집, 저장 및 활용 과정에서 관련 데이터 보호 법규와 개인정보 보호 규정을 엄격히 준수하여 사용자의 개인정보와 합법적인 권익을 보호하고 있으며, 모든 데이터는 GDPR, CCPA 및 PIPL을 준수합니다.
미국 영어 음성 데이터셋 스마트폰 음성 데이터 대화형 AI 데이터셋 화자별 채널 분리 음성 데이터 음성 인식

205시간 풀 듀플렉스 일본어 자연 대화 음성 데이터

205시간 풀 듀플렉스 일본어 자연 대화 음성 데이터로, 일반적인 주제를 기반으로 대화를 시뮬레이션하여 녹음했습니다. 본 데이터셋에는 텍스트 내용, 문장 타임스탬프, 화자 식별 정보, 성별 등 다양한 속성이 어노테이션되어 있습니다. 서로 다른 지역과 문화적 배경을 가진 일본 현지인이 직접 녹음했으며, 높은 정확도를 바탕으로 음성 인식 관련 연구 및 응용에 활용할 수 있는 풍부한 리소스를 제공합니다. 여러 AI 기업의 검증을 거쳐 실제 환경의 다양한 상황에서도 모델의 성능 향상에 도움이 되는 것으로 확인되었습니다. 데이터 수집, 저장 및 활용 과정에서 관련 데이터 보호 법규와 개인정보 보호 규정을 엄격히 준수하여 사용자의 개인정보와 합법적인 권익을 보호하고 있으며, 모든 데이터는 GDPR, CCPA 및 PIPL을 준수합니다.
풀 듀플렉스 일본어 음성 데이터 일본어 자연 대화 일본 ASR 학습 데이터

423시간 필리핀 영어 풀 듀플렉스 화자별 채널 분리 자연 대화 휴대폰 수집 음성 데이터

423시간 필리핀 영어 화자별 채널 분리 자연 대화 휴대폰 수집 음성 데이터로, 일반적인 주제를 기반으로 대화를 시뮬레이션하여 녹음했습니다. 본 데이터셋에는 텍스트 내용, 문장 타임스탬프, 화자 식별 정보, 성별 등 다양한 속성이 어노테이션되어 있습니다. 서로 다른 지역과 문화적 배경을 가진 필리핀 현지인이 직접 녹음했으며, 높은 정확도를 바탕으로 음성 인식 관련 연구 및 응용에 활용할 수 있는 풍부한 리소스를 제공합니다. 여러 AI 기업의 검증을 거쳐 실제 환경의 다양한 상황에서도 모델의 성능 향상에 도움이 되는 것으로 확인되었습니다. 데이터 수집, 저장 및 활용 과정에서 관련 데이터 보호 법규와 개인정보 보호 규정을 엄격히 준수하여 사용자의 개인정보와 합법적인 권익을 보호하고 있으며, 모든 데이터는 GDPR, CCPA 및 PIPL을 준수합니다.
대화형 AI 데이터셋 스마트폰 음성 데이터 필리핀 영어 음성 데이터셋 화자별 채널 분리 자연 대화 음성 인식 영어 억양

300시간 일본어 금융 분야 구어체 음성 데이터

일본어 금융 분야 음성 데이터_구어체로, 다양한 금융 분야의 전문 용어를 포함하며 실제 환경의 상호작용 상황을 반영합니다. 본 데이터셋은 텍스트 내용, 화자 신원 및 성별 등 다양한 속성에 대한 어노테이션이 포함되어 있으며, 다양한 인공지능 애플리케이션에 풍부한 리소스를 제공합니다. 또한 여러 AI 기업의 검증을 거쳤으며, 실제 환경의 다양성에 직면한 모델의 성능 향상에 기여할 수 있습니다. 넥스데이타는 데이터 보호 법규 및 개인정보 보호 규정을 엄격하게 준수하며, 데이터 수집, 저장 및 사용 과정에서 사용자의 개인정보와 합법적인 권익을 보호합니다. 모든 데이터는 GDPR, CCPA, PIPL을 준수합니다.
일본어 음성 인식 금융 분야 특정 분야 구어체

215시간 한국어 금융 분야 엔티티 어노테이션 구어체 음성 데이터

한국어 금융 분야의 엔티티가 어노테이션된 구어체 음성 데이터로, 다양한 금융 전문 용어를 포함하며 크게 거시 금융 분야와 미시 금융 분야의 내용으로 구성되어 있습니다. 실제 환경의 상호작용 상황을 반영했으며, 텍스트 내용, 화자 식별 정보 및 성별, 주요 엔티티 등 다양한 속성이 어노테이션되어 있습니다. 다양한 AI 애플리케이션을 위한 풍부한 리소스를 제공하며, 여러 AI 기업의 검증을 통해 실제 환경의 다양한 상황에서도 모델의 성능 향상에 도움이 되는 것으로 확인되었습니다. 데이터 수집, 저장 및 활용 과정에서 관련 데이터 보호 법규와 개인정보 보호 규정을 엄격히 준수하여 사용자의 개인정보와 합법적인 권익을 보호하고 있으며, 모든 데이터는 GDPR, CCPA 및 PIPL을 준수합니다.
한국어 자연 대화 금융 엔티티 어노테이션 구어체 음성 데이터 특정 분야

203시간 한국어 의료 분야 음성 데이터 | 구어체 음성 인식 모바일 수집 데이터

203시간 한국 한국어 의료 분야 엔터티 어노테이션 음성 데이터_구어체로, 다양한 의료 유형을 포함하며 진단, 의약품명 등의 전문 용어가 포함되어 있습니다. 실제 환경의 상호작용 상황을 반영합니다. 본 데이터셋은 텍스트 내용, 화자 신원, 성별, 일반적인 엔터티 단어 등 다양한 속성에 대한 어노테이션을 제공하여 다양한 인공지능 애플리케이션에 풍부한 리소스를 제공합니다. 여러 AI 기업의 검증을 거쳤으며, 실제 환경의 다양성에 대응하는 모델의 성능 향상에 도움이 됩니다. 데이터 보호 법규 및 개인정보 보호 규정을 엄격하게 준수하여 데이터 수집, 저장 및 사용 과정에서 사용자의 개인정보와 합법적인 권익을 보호하며, 모든 데이터는 GDPR, CCPA, PIPL을 준수합니다.
한국어 한국어 구어체 음성 데이터 한국어 음성 인식 데이터 ASR 음성-텍스트 변환 의료 분야 데이터 특정 분야

Interspeech 2026-MLC-SLM 다국어 대화 음성 경연 데이터

Interspeech 2026-MLC-SLM 다국어 대화 음성 경연 데이터셋은 넥스데이타가 2026년에 개최한 MLC-SLM 다국어 대화 음성 경연을 배경으로 하며, 넥스데이타 자체 보유 21종의 대화 음성 데이터셋으로 구성됩니다. 높은 정확도와 활용성을 갖추고 있으며, 다국어 음성 인식 및 장문 컨텍스트 이해 기술의 한계를 극복하기 위해 설계되었습니다. 화자 간 발화 중첩, 즉흥적인 끼어들기 등 복잡한 상호작용 상황을 실제 환경에서 포착하여 음성 인식 관련 연구 및 애플리케이션에 풍부한 리소스를 제공하며, 실제 환경의 다양성에 직면한 모델의 성능 향상에 기여할 수 있습니다. 넥스데이타는 데이터 보호 법규 및 개인정보 보호 규정을 엄격하게 준수하며, 데이터 수집, 저장 및 사용 과정에서 사용자의 개인정보와 합법적인 권익을 보호합니다. 모든 데이터는 GDPR, CCPA, PIPL을 준수합니다.
대화 음성 데이터 다국어 MLC-SLM 챌린지

93시간 한국어 아동 구어체 음성 데이터

한국어 아동 구어체 음성 데이터로, 실제 대화 상황을 반영합니다. 본 데이터셋은 텍스트 내용, 화자 신원 및 성별, 발화 지역 등 다양한 속성에 대한 어노테이션을 제공하며, 12세 이하의 다양한 지역 및 문화적 배경을 가진 한국 아동들이 녹음에 참여하였습니다. 음성 인식 관련 연구 및 애플리케이션에 풍부한 리소스를 제공하며, 실제 환경의 다양한 변수에 대응하는 모델 성능 향상에 효과적입니다. 데이터 수집, 저장 및 활용의 전 과정에 걸쳐 GDPR, CCPA, PIPL 등 개인정보 보호 규정을 준수하며, 사용자의 프라이버시와 정당한 권익을 보호합니다.
한국어 아동 음성 데이터 텍스트 어노테이션
. . .

loading

지금 바로 데이터를 맞춤 설정하세요

표준 데이터셋을 선택하는 이유

  • 저작권

    저작권

    명확한 저작권 쉽게 확인 가능
  • 보안

    보안

    적절한 권한 부여 안전하게 사용 가능
  • 전문성

    전문성

    AI 데이터 전문가들이 설계 및 제작
  • 다양성

    다양성

    다양한 실제 장면에서 수집
  • 비용 효율성

    비용 효율성

    맞춤형 데이터보다 비용 효율적
  • 효율성

    효율성

    즉시 제공, 빠른 납품
a8a9eeba-10eb-4dfb-abb4-016cadbb4969