ko

Please fill in your name

Mobile phone format error

전화번호를 입력해 주세요

회사 이름을 입력해 주세요

회사 이메일을 입력해 주세요

데이터 요구사항을 입력해 주세요

Successful submission! Thank you for your support.

Format error, Please fill in again

Confirm

데이터 요구사항은 5자 이상이며 숫자만으로 구성될 수 없습니다

OCR 데이터셋

넥스데이타는 문서 인식, 장면 텍스트 감지, 필기 인식 및 다국어 텍스트 추출 애플리케이션을 위한 고품질 OCR 데이터셋을 제공합니다.

데이터 타입

전체
36
문서
8
일반 시나리오
13
손글씨
17
인터넷 이미지
2
송장
3
기타
5
시험지
1
1

언어

전체
36
중국어
8
영어
9
힌디어
5
일본어
10
한국어
8
기타
21
베트남어
4

15,148세트 한·일 메뉴 OCR 데이터

15,148세트 한·일 메뉴 OCR 데이터로, 일본 메뉴 9,701세트와 한국 메뉴 5,447세트를 포함합니다. 어노테이션 내용은 행 단위 사변형 박스 어노테이션 및 행 단위 콘텐츠 전사이며, 일부 데이터는 열 단위 사변형 박스 어노테이션 및 열 단위 콘텐츠 전사로 구성됩니다.
메뉴 OCR 일본어 한국어

1,586,458세트 문서 OCR 및 구조화 파싱 데이터

1,586,458세트 문서 OCR 및 구조화 파싱 데이터로, 중국어 교재, 중국어 전자책, 중국어 학습 보조 교재 등을 포함하며, 어노테이션 파일에는 OCR 어노테이션과 구조화 파싱 데이터가 포함됩니다.
중국어 OCR 문서 구조화 파싱

4,995장 베트남어 OCR 어노테이션 및 전사 데이터

4,995장의 베트남어 OCR 어노테이션 및 전사 데이터로, 자연 환경 이미지 258장, 스크린샷 2,553장 및 텍스트 이미지 2,184장을 포함합니다. 어노테이션 측면에서는 행 단위 콘텐츠에 대해 행 단위 사변형 박스 어노테이션 및 행 단위 콘텐츠 전사를 진행했으며, 세로 열 콘텐츠에 대해서는 세로 열 사변형 박스 어노테이션 및 세로 열 콘텐츠 전사를 진행했습니다. 본 베트남어 OCR 어노테이션 및 전사 데이터는 다양한 환경에서의 베트남어 인식, 베트남어 사진 번역 등의 작업에 활용할 수 있습니다.
베트남어 OCR 문서 이미지 인터넷 이미지 자연 장면 다양한 각도 다른 조도 조건 텍스트 라인 수준 전사

14,980장 8개 언어 PPT OCR 데이터

14,980장의 8개 언어 PPT OCR 데이터로, 8개 언어, 다양한 환경, 다양한 촬영 각도, 다양한 촬영 거리 및 다양한 조명 조건을 포함합니다. 어노테이션 측면에서는 행 단위 텍스트의 사변형 박스 어노테이션 및 행 단위 텍스트 전사를 진행했습니다. 본 다국어 PPT OCR 데이터는 다국어 OCR 등의 작업에 활용할 수 있습니다.
PPT OCR 다양한 각도 다양한 언어 다양한 조명 조건 영어 한국어 일본어

39,993장 이미지 OCR 데이터

39,993장의 이미지 OCR 데이터로, 언어 분포는 중국어 및 영어(소량)로 구성됩니다. 어노테이션 측면에서는 이미지에 대해 행 단위 사각형 박스 어노테이션 및 행 단위 콘텐츠 전사를 진행했으며, 일부 데이터는 열 단위 사각형 박스 어노테이션 및 열 단위 콘텐츠 전사로 구성됩니다.
OCR 중국어 영어

1,000장 일본어 영수증 수집 데이터

1,000장의 일본어 영수증 수집 데이터입니다. 데이터는 기본 편집 500장과 전문 편집 500장으로 구성됩니다. 데이터 다양성은 다양한 영수증 내용·편집 유형·형식을 포함합니다. 영수증의 회사명, 주소, 이름, 팩스번호, 전화번호 등 민감 정보는 모두 가상 정보로 편집했으며 실제 정보가 아닙니다. 본 데이터는 일본어 영수증 검출, 인식, End-to-End OCR 등의 작업에 활용할 수 있습니다.
일본어 영수증 OCR 인보이스

426,687장 자연 장면, 문서 촬영 장면 및 전자 장면 OCR 수집 데이터

426,687장의 자연 장면, 문서 촬영 장면 및 전자 장면 OCR 수집 데이터는 번체 중국어, 일본어, 한국어, 인도네시아어, 말레이어, 태국어, 베트남어, 폴란드어 등 20개 언어를 포함합니다. 데이터 다양성은 다양한 자연 장면 및 다양한 촬영 각도를 포함합니다. 본 데이터셋은 다국어 OCR 태스크에 활용할 수 있습니다.
자연 환경 문서 OCR

9,497장 10종 표 OCR 데이터

9,497장의 10종 표 OCR 데이터로, 사각형 박스를 사용하여 어노테이션을 진행했으며, 본 데이터는 표 검출 및 인식 등의 작업에 활용할 수 있습니다.
OCR 차트

3,506장 힌디어 OCR 어노테이션 및 전사 데이터

3,506장의 힌디어 OCR 어노테이션 및 전사 데이터로, 자연 환경 이미지 2,056장, 스크린샷 1,103장 및 텍스트 이미지 347장을 포함합니다. 어노테이션 측면에서는 행 단위 콘텐츠에 대해 행 단위 사변형 박스 어노테이션 및 행 단위 콘텐츠 전사를 진행했으며, 세로 열 콘텐츠에 대해서는 세로 열 사변형 박스 어노테이션 및 세로 열 콘텐츠 전사를 진행했습니다. 본 힌디어 OCR 어노테이션 및 전사 데이터는 다양한 환경에서의 힌디어 인식, 힌디어 사진 번역 등의 작업에 활용할 수 있습니다.
힌디어 OCR 문서 이미지 인터넷 이미지 자연 장면 다양한 각도 다른 조도 조건 텍스트 라인 수준 전사

loading

지금 바로 데이터를 맞춤 설정하세요

표준 데이터셋을 선택하는 이유

  • 저작권

    저작권

    명확한 저작권 쉽게 확인 가능
  • 보안

    보안

    적절한 권한 부여 안전하게 사용 가능
  • 전문성

    전문성

    AI 데이터 전문가들이 설계 및 제작
  • 다양성

    다양성

    다양한 실제 장면에서 수집
  • 비용 효율성

    비용 효율성

    맞춤형 데이터보다 비용 효율적
  • 효율성

    효율성

    즉시 제공, 빠른 납품
7d202742-b8cf-4c83-bcec-9fcad0790448