Automatic collection
증분 크롤링과 변경 감지로 새 공고와 업데이트된 정보를 자동 수집합니다.
기관·기업별로 분산된 공고와 비정형 첨부 문서를 자동 수집하고, 공개 데이터 기반 검증·표준화·신뢰도 평가를 거쳐 RAG 및 지식그래프에 연계하는 운영 플랫폼을 구축했습니다.
수집부터 질의 응답까지의 흐름을 하나의 운영 체계로 연결해, 산재한 정보를 기준 있는 지식으로 전환합니다.
원문과 데이터의 근거를 유지하면서 검색, 탐색, 질의 응답에 필요한 지식 연결성을 확보합니다.
증분 크롤링과 변경 감지로 새 공고와 업데이트된 정보를 자동 수집합니다.
OCR, 필드 추출, KSIC 정규화로 비정형 문서와 공고 정보를 활용 가능한 구조로 정리합니다.
공개 데이터 보강, 중복 확인, 품질 점검과 신뢰도 평가를 통해 운영 기준을 관리합니다.
RAG와 지식그래프 인덱싱을 연결하고 Agent Q&A를 위한 근거 기반 탐색 흐름을 구성합니다.
화면 시제품이 아니라 데이터와 문서가 지식으로 연결되는 구조를 시각화했습니다. 각 단계는 원문 출처와 운영 검토 흐름을 유지하도록 설계됩니다.
공고·첨부 문서의 신규·변경 여부를 감지해 증분 수집하고, OCR·필드 추출·KSIC 정규화·중복 검증을 순차 수행합니다. 처리 결과는 RAG 인덱스와 지식그래프에 반영해 Agent 질의응답의 근거 데이터로 사용합니다.
기관·기업·도메인 공개 데이터를 연계해 주요 필드를 보강하고, 필수값·형식·중복·변경 상태를 점검합니다. 품질 및 신뢰도 결과는 원문 출처와 함께 관리해 운영자가 검색 결과와 답변 근거를 재검토할 수 있도록 구성했습니다.
파일 형식과 텍스트 레이어 유무를 판별한 뒤 문서 파서 또는 OCR을 적용합니다. 제목·기관·접수 기간·지원 대상 등 핵심 필드를 표준 스키마로 구조화하고, 원문과 추출 데이터를 연결해 검색과 재처리가 가능하도록 구성했습니다.
RAG는 원문 단위의 의미 검색과 근거 문맥 제공을 담당하고, 지식그래프는 기관·기업·산업분류·공고 간 관계 탐색을 담당합니다. 두 계층을 결합해 조건 기반 탐색과 출처 확인이 가능한 응답 흐름을 구성했습니다.