[{"@type":"PropertyValue","name":"데이터 규모","value":"39,993장, 227,910개 박스"},{"@type":"PropertyValue","name":"언어 구성","value":"중국어, 영어(소량)"},{"@type":"PropertyValue","name":"데이터 형식","value":"이미지 데이터 형식: .jpg, 어노테이션 문서 형식: .json"},{"@type":"PropertyValue","name":"어노테이션 내용","value":"행 단위 사각형 박스 어노테이션, 행 단위 콘텐츠 전사(일부 데이터는 열 단위 사각형 박스 어노테이션, 열 단위 콘텐츠 전사)"},{"@type":"PropertyValue","name":"정확도","value":"사각형 박스 꼭짓점 오차가 5픽셀 이내인 경우 올바른 검출로 판정, 검출 박스 정확도 97% 이상; 텍스트 전사 정확도 97% 이상"}]
{"id":171,"datatype":"1","titleimg":"https://ko.nexdata.ai/shujutang/static/image/index/datatang_tuxiang_default.webp","type1":"147","type1str":null,"type2":"150","type2str":null,"dataname":"39,993장 이미지 OCR 데이터","datazy":[{"title":"데이터 규모","content":"39,993장, 227,910개 박스"},{"title":"언어 구성","content":"중국어, 영어(소량)"},{"title":"데이터 형식","content":"이미지 데이터 형식: .jpg, 어노테이션 문서 형식: .json"},{"title":"어노테이션 내용","content":"행 단위 사각형 박스 어노테이션, 행 단위 콘텐츠 전사(일부 데이터는 열 단위 사각형 박스 어노테이션, 열 단위 콘텐츠 전사)"},{"title":"정확도","content":"사각형 박스 꼭짓점 오차가 5픽셀 이내인 경우 올바른 검출로 판정, 검출 박스 정확도 97% 이상; 텍스트 전사 정확도 97% 이상"}],"datatag":"OCR,Multiple types of internet images","technologydoc":null,"downurl":null,"datainfo":null,"standard":null,"dataylurl":null,"flag":null,"publishtime":null,"createby":null,"createtime":null,"ext1":null,"samplestoreloc":null,"hosturl":null,"datasize":null,"industryPlan":null,"keyInformation":null,"samplePresentation":[],"officialSummary":"39,993장의 이미지 OCR 데이터로, 언어 분포는 중국어 및 영어(소량)로 구성됩니다. 어노테이션 측면에서는 이미지에 대해 행 단위 사각형 박스 어노테이션 및 행 단위 콘텐츠 전사를 진행했으며, 일부 데이터는 열 단위 사각형 박스 어노테이션 및 열 단위 콘텐츠 전사로 구성됩니다.","dataexampl":null,"datakeyword":["OCR","중국어","영어"],"isDelete":null,"ids":null,"idsList":null,"datasetCode":null,"productStatus":null,"tagTypeEn":"Data Type,Language","tagTypeZh":null,"website":null,"samplePresentationList":null,"datazyList":null,"keyInformationList":null,"dataexamplList":null,"bgimg":null,"datazyScriptList":null,"datakeywordListString":null,"sourceShowPage":"ocr","dataShowType":"[{\"code\":\"0\",\"language\":\"ZH\"},{\"code\":\"1\",\"language\":\"ZH\"},{\"code\":\"2\",\"language\":\"EN,JP,KO\"},{\"code\":\"3\",\"language\":\"EN\"},{\"code\":\"4\",\"language\":\"JP\"}]","productNameEn":"39,993 Images OCR Data","BGimg":"","voiceBg":["/shujutang/static/image/comm/audio_bg.webp","/shujutang/static/image/comm/audio_bg2.webp","/shujutang/static/image/comm/audio_bg3.webp","/shujutang/static/image/comm/audio_bg4.webp","/shujutang/static/image/comm/audio_bg5.webp"]}
39,993장의 이미지 OCR 데이터로, 언어 분포는 중국어 및 영어(소량)로 구성됩니다. 어노테이션 측면에서는 이미지에 대해 행 단위 사각형 박스 어노테이션 및 행 단위 콘텐츠 전사를 진행했으며, 일부 데이터는 열 단위 사각형 박스 어노테이션 및 열 단위 콘텐츠 전사로 구성됩니다.
이는 상업적 사용, 연구 목적 등을 위한 유료 데이터셋입니다.라이선스가 부여된 기성 데이터셋은 AI 프로젝트의 빠른 시작에 도움을 줍니다.
사양
데이터 규모
39,993장, 227,910개 박스
언어 구성
중국어, 영어(소량)
데이터 형식
이미지 데이터 형식: .jpg, 어노테이션 문서 형식: .json
어노테이션 내용
행 단위 사각형 박스 어노테이션, 행 단위 콘텐츠 전사(일부 데이터는 열 단위 사각형 박스 어노테이션, 열 단위 콘텐츠 전사)
정확도
사각형 박스 꼭짓점 오차가 5픽셀 이내인 경우 올바른 검출로 판정, 검출 박스 정확도 97% 이상; 텍스트 전사 정확도 97% 이상