ko

Please fill in your name

Mobile phone format error

전화번호를 입력해 주세요

회사 이름을 입력해 주세요

회사 이메일을 입력해 주세요

데이터 요구사항을 입력해 주세요

Successful submission! Thank you for your support.

Format error, Please fill in again

Confirm

데이터 요구사항은 5자 이상이며 숫자만으로 구성될 수 없습니다

OCR 데이터셋

넥스데이타는 문서 인식, 장면 텍스트 감지, 필기 인식 및 다국어 텍스트 추출 애플리케이션을 위한 고품질 OCR 데이터셋을 제공합니다.

데이터 타입

전체
36
문서
8
일반 시나리오
13
손글씨
17
인터넷 이미지
2
송장
3
기타
5
시험지
1
1

언어

전체
36
중국어
8
영어
9
힌디어
5
일본어
10
한국어
8
기타
21
베트남어
4

15,148세트 한·일 메뉴 OCR 데이터

15,148세트 한·일 메뉴 OCR 데이터로, 일본 메뉴 9,701세트와 한국 메뉴 5,447세트를 포함합니다. 어노테이션 내용은 행 단위 사변형 박스 어노테이션 및 행 단위 콘텐츠 전사이며, 일부 데이터는 열 단위 사변형 박스 어노테이션 및 열 단위 콘텐츠 전사로 구성됩니다.
메뉴 OCR 일본어 한국어

1,586,458세트 문서 OCR 및 구조화 파싱 데이터

1,586,458세트 문서 OCR 및 구조화 파싱 데이터로, 중국어 교재, 중국어 전자책, 중국어 학습 보조 교재 등을 포함하며, 어노테이션 파일에는 OCR 어노테이션과 구조화 파싱 데이터가 포함됩니다.
중국어 OCR 문서 구조화 파싱

5,711장 한국어 손글씨 OCR 데이터

5,711장의 한국어 손글씨 OCR 데이터입니다. 텍스트는 A4 용지, 줄노트, 모눈종이 등 다양한 형태의 용지에 작성되었습니다. 스마트폰으로 정면 시점에서 촬영했으며, 한국어 작문, 시, 산문, 뉴스, 이야기 등 다양한 콘텐츠를 포함합니다. 어노테이션은 텍스트 라인 단위의 사각형 영역과 라인 단위 텍스트 전사로 구성됩니다. 본 데이터는 한국어 손글씨 OCR 작업에 활용할 수 있습니다.
한국어 OCR 행 단위 라벨링 행 단위 텍스트 전사 손글씨 데이터

14,980장 8개 언어 PPT OCR 데이터

14,980장의 8개 언어 PPT OCR 데이터로, 8개 언어, 다양한 환경, 다양한 촬영 각도, 다양한 촬영 거리 및 다양한 조명 조건을 포함합니다. 어노테이션 측면에서는 행 단위 텍스트의 사변형 박스 어노테이션 및 행 단위 텍스트 전사를 진행했습니다. 본 다국어 PPT OCR 데이터는 다국어 OCR 등의 작업에 활용할 수 있습니다.
PPT OCR 다양한 각도 다양한 언어 다양한 조명 조건 영어 한국어 일본어

5,000장 4대 유형 카드 OCR 데이터

5,000장 4대 유형 카드 OCR 데이터로, 문자 인식 등의 작업에 활용할 수 있습니다.
카드 OCR 문자 인식

71,535장 영어 자연 장면 OCR 데이터

71,535장의 영어 자연 환경 OCR 데이터는 영국과 미국 현지에서 수집되었습니다. 데이터 다양성은 다양한 환경, 촬영 각도, 조명 조건을 포함합니다. 어노테이션 측면에서는 영어 OCR 데이터에 대해 행 단위, 단어 단위, 문자 단위의 사각형(또는 사변형) 박스 라벨링과 텍스트 내용 전사가 포함되어 있습니다. 본 영어 자연 환경 OCR 데이터셋은 영어 자연 환경 OCR 작업에 활용될 수 있습니다.
영어 자연 장면 OCR 다중 장면 다양한 촬영 각도 다양한 조도 조건 텍스트 전사

100명 한·일 손글씨 데이터

100명 한·일 손글씨 데이터로, 총 100명의 입력자가 참여했으며, 일본인 50명, 한국인 49명, 아프가니스탄인 1명으로 구성되어 있습니다. 각 개인이 작성한 코퍼스는 모두 다릅니다. 데이터 다양성은 여러 종류의 모바일 기기와 다양한 코퍼스를 포함합니다. 본 한·일 손글씨 데이터는 일본어 및 한국어 손글씨 OCR 인식에 활용될 수 있습니다.
일본어 한국어 필기 OCR 필적

426,687장 자연 장면, 문서 촬영 장면 및 전자 장면 OCR 수집 데이터

426,687장의 자연 장면, 문서 촬영 장면 및 전자 장면 OCR 수집 데이터는 번체 중국어, 일본어, 한국어, 인도네시아어, 말레이어, 태국어, 베트남어, 폴란드어 등 20개 언어를 포함합니다. 데이터 다양성은 다양한 자연 장면 및 다양한 촬영 각도를 포함합니다. 본 데이터셋은 다국어 OCR 태스크에 활용할 수 있습니다.
자연 환경 문서 OCR

39,993장 이미지 OCR 데이터

39,993장의 이미지 OCR 데이터로, 언어 분포는 중국어 및 영어(소량)로 구성됩니다. 어노테이션 측면에서는 이미지에 대해 행 단위 사각형 박스 어노테이션 및 행 단위 콘텐츠 전사를 진행했으며, 일부 데이터는 열 단위 사각형 박스 어노테이션 및 열 단위 콘텐츠 전사로 구성됩니다.
OCR 중국어 영어

loading

지금 바로 데이터를 맞춤 설정하세요

표준 데이터셋을 선택하는 이유

  • 저작권

    저작권

    명확한 저작권 쉽게 확인 가능
  • 보안

    보안

    적절한 권한 부여 안전하게 사용 가능
  • 전문성

    전문성

    AI 데이터 전문가들이 설계 및 제작
  • 다양성

    다양성

    다양한 실제 장면에서 수집
  • 비용 효율성

    비용 효율성

    맞춤형 데이터보다 비용 효율적
  • 효율성

    효율성

    즉시 제공, 빠른 납품
ca92fdba-af73-4612-abb5-9dcb96f395dd