ko

Please fill in your name

Mobile phone format error

전화번호를 입력해 주세요

회사 이름을 입력해 주세요

회사 이메일을 입력해 주세요

데이터 요구사항을 입력해 주세요

Successful submission! Thank you for your support.

Format error, Please fill in again

Confirm

데이터 요구사항은 5자 이상이며 숫자만으로 구성될 수 없습니다

LLM 데이터셋

넥스데이타는 대화 시스템, 명령어 튜닝 및 다국어 AI 학습을 위한 고품질 LLM 데이터셋을 제공하여 신뢰할 수 있고 확장 가능한 언어 모델을 개발할 수 있게 합니다.

유형

전체
29
이미지 캡션
10
SFT 데이터셋
10
사전 학습 텍스트
14

240만 문제 한국어 시험 문제 구조화 분석 처리 데이터

한국어 시험 문제 구조화 분석 처리 데이터는 총 약 240만 문제로 구성되며, 각 문제는 문항 유형, 문제 질문, 정답, 해설 등 필드를 포함합니다. 교과목은 [초등학교] 국어, 수학, 영어, 사회, 과학을 포함하며, [중학교] 국어, 영어, 수학, 과학, 사회를 포함하고, [고등학교] 국어, 영어, 수학, 물리, 화학, 생물, 역사, 지리를 포함합니다. 문항 유형은 객관식, 주관식(단답형), 진위형, 서술형 등을 포함합니다. 본 데이터셋은 대형 모델의 교과 지식 강화 태스크에 활용할 수 있습니다.
K12 문제 텍스트 LLM 한국어

에이전트 트레이젝토리 데이터셋

본 데이터셋은 심층 검색, 데이터 분석, 산업 리서치 등 업무 환경을 포괄하며, 여러 차례에 걸친 추론 과정과 도구 호출 체인을 완전하게 기록합니다. 에이전트의 계획 수립 능력 분석, 도구 선택 전략 연구 및 품질 평가 등에 활용할 수 있으며, 에이전트 학습 및 평가를 위한 구조화된 벤치마크를 제공합니다.
에이젠트 데이터 트레이젝토리Trajectory 한국어 에이젠트 데이터 영어 에이젠트 데이터

50만 건 LLM 한국어 수학 사진 기반 문제 풀이 데이터

50만 건의 LLM용 한국어 수학 사진 기반 문제 풀이 데이터로, 다양한 학년과 문항 유형을 포함하고 있습니다. 모든 답안은 전사되어 있으며, 수식과 표는 LaTeX 형식으로 변환되어 있습니다. 본 데이터셋은 자동 채점, 숙제 및 학습 보조 등의 다양한 교육 분야에 활용할 수 있습니다. 데이터 수집, 저장 및 활용을 포함한 전체 데이터 라이프사이클에서 관련 데이터 보호 법규와 개인정보 보호 기준을 엄격하게 준수하고 있습니다. 이를 통해 사용자의 권리와 개인정보를 보호하고 있으며, 모든 데이터는 GDPR, CCPA 및 PIPL을 준수합니다.
시험 문제 수학 중학교 교육 고등학교 교육 문제 풀이

7,500개 장문 추론 데이터셋(영문, 한문, 중문 포함)

본 데이터셋은 현재 대규모 언어 모델이 장문 이해 및 복잡한 추론 작업에서 보이는 핵심적인 한계를 보완하기 위해 구축한 고품질 학습 데이터입니다. 중국어, 영어, 한국어 3개 언어로 총 7,500건으로 구성되어 있으며, 각 데이터는 장문 context를 기반으로 문단 간·문서 간 정보 통합과 다중 단계 논리 추론이 필요한 질문으로 설계되었습니다. 이를 통해 모델의 장문 이해, 정보 검색, 추론 체인 구축 및 근거 추적 능력을 종합적이고 엄격하게 평가할 수 있습니다.
다국어 데이터 장문 추론 데이터

1,000만 문제 영어 시험 문제 텍스트 데이터 구조화 해석 처리 데이터

1,000만 개의 영어 시험 문제 텍스트 데이터를 구조화 및 분석 처리한 데이터로, 각 문항은 문제, 정답, 해설, 학과, 학년, 문제 유형 필드를 포함합니다. 학년은 초등, 중등, 고등부터 대학까지 포함되며, 학과는 수학, 생물학, 회계학 등 다양한 과목을 포함합니다. 본 데이터는 영미 교육 체계 하의 시험 문제 텍스트로, 대형 언어 모델의 학문적 지식 향상에 활용될 수 있습니다.
영어 테스트 문제 텍스트 데이터 대형 언어 모델 대규모 언어 모델 대형 모델 ChatGPT 데이터

10만 개 영어 대형 모델 명령어 미세 조정 텍스트 데이터셋

영어 대형 모델 인스트럭션 미세 조정 텍스트 데이터셋입니다. AI 모델 최적화를 위한 학습 리소스로 설계되어, 모델의 명령 이해 및 수행 능력을 현저히 강화시킵니다. 언어학 전문가와 AI 엔지니어의 이중 검증을 거쳤으며, 주요 사전학습 모델의 미세 조정에 완벽히 호환됩니다.
LLM 미세 조정 데이터셋 지도 미세 조정 SFT 데이터셋 영어 명령어 튜닝 데이터 일반 도메인 LLM 데이터 AI 모델 미세 조정 명령어 추종 트레이닝 데이터 GPT 튜닝 데이터셋

202,735건 PPT 이미지 설명 및 Q&A 데이터

202,735건의 PPT 이미지와 이에 대응하는 설명 및 Q&A 라벨링 데이터로 구성. PPT 이미지 유형은 아키텍처 다이어그램, 디지털 차트, 순서도, 일러스트레이션 총 4가지로 분류. 해당 데이터셋은 문서 Intelligence 등 다양한 태스크에 활용 가능.
슬라이드 시각 질문 응답 문서 분석

3,200만 문제 이공계 시험 문제 텍스트 구조화 해석 처리 데이터

3,200만 개의 이공계 문제 텍스트 구조화 분석 데이터는 초등, 중등, 고등, 대학 수준의 수학, 물리, 화학, 생물 등 이공계 과목을 포함합니다. 각 문제는 문제, 정답, 해설, 문제 유형, 학과, 학년 등의 필드를 포함하고 있습니다. 본 데이터는 대형 모델의 학문 지식 강화 작업에 활용될 수 있습니다.
과학 과목 문제 대형 언어 모델 텍스트

68,750조의 이미지 편집(추론형 편집) 데이터

이미지는 다양한 장면, 다양한 카테고리 등 포함 어노테이션 측면에서는 문서 지침에 따라 원본 이미지를 편집하여 효과 이미지를 생성하며, 대부분의 카테고리 데이터는 추론 과정도 포함 이미지와 텍스트 내용 매칭 정확도는 95% 이상 데이터는 가상 장면 생성, 이미지 합성, 데이터 증강 등 작업에 활용 가능
이미지 편집 추론형 편집 지식형 편집 물리 규칙 편집

loading

지금 바로 데이터를 맞춤 설정하세요

표준 데이터셋을 선택하는 이유

  • 저작권

    저작권

    명확한 저작권 쉽게 확인 가능
  • 보안

    보안

    적절한 권한 부여 안전하게 사용 가능
  • 전문성

    전문성

    AI 데이터 전문가들이 설계 및 제작
  • 다양성

    다양성

    다양한 실제 장면에서 수집
  • 비용 효율성

    비용 효율성

    맞춤형 데이터보다 비용 효율적
  • 효율성

    효율성

    즉시 제공, 빠른 납품
a141fd67-093d-49a6-b404-c606da40d368