arxiv-wiki

Tytan: Interactive Neurosymbolic Construction of Analytic Semantic Schemas from Relational Data

← 2026-08-08 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: TYTAN overview. A database instance and an optional one-sentence description enter the pipeline.

Figure · 원문 PDF 3쪽 · Figure 1: TYTAN overview. A database instance and an optional one-sentence description enter the pipeline.

Figure 2: Anatomy of a generated ring (housing-rent

Figure · 원문 PDF 5쪽 · Figure 2: Anatomy of a generated ring (housing-rent

Figure 3: Example end-to-end system interaction

Figure · 원문 PDF 14쪽 · Figure 3: Example end-to-end system interaction

한 문장 요약

TYTAN은 관계형 데이터베이스 인스턴스(및 선택적 한 문장 설명)를 입력받아 심볼릭 프로파일링과 LLM 기반 의미추론을 결합하고 모든 LLM 제안을 데이터 기반 검증으로 걸러낸 뒤, 불확실한 경우에만 사용자에게 명확화 질문을 던져 분석용 의미적 스키마(‘ring’)를 자동 구성하는 인터랙티브 신경-심볼릭 파이프라인이다.

해결하려는 문제

오늘날 분석·자연어 질의용 시스템은 컬럼이 어떤 실세계 엔터티의 식별자/측정값/카테고리인지, 테이블 간의 유효한 조인 경로는 무엇인지 등을 담은 의미층(semantic layer)을 필요로 한다. 이 의미층은 보통 수작업으로 작성되어 확장성·유지보수·비전문가 접근성에서 병목이 된다. 기존의 기호적 기법(키/타입 추론 등)은 구조적 증거를 회복하지만 의미적 역할(예: 집계 가능한 측정인지, 단순 ID인지)을 결정하지 못하고, LLM은 의미추론은 잘 하지만 환각(hallucination)·비일관성·근거 없는 조인 제안 등 신뢰성 문제를 갖는다. 연구 질문은 (RQ1) 생성한 스키마가 관련 엔터티·속성을 포괄하는가? (RQ2) 스키마가 적시하는 테이블/컬럼/조인 경로가 실제로 데이터에서 실행 가능한가? (RQ3) 속성들의 분석적 역할(집계 가능/범주/시간 등) 지정이 정확한가? 이 문제들을 실용적·검증 가능한 방식으로 자동화하는 방법이 본문에서 제시된다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문 전체(본문, 표, 부록 포함)의 텍스트를 근거로 작성되었다. 본문에서 제시한 표(Table 1–7), 실험 절차(§4), 평가 결과(§5)와 한계(§6)를 직접 인용·요약하였다. 단, 초록과 본문 사이에 자기-생성 주장(claims)의 총계(초록의 1,678 vs 본문·표의 합계 3,758 등)처럼 숫자 표기 불일치가 일부 관찰된다. 본 요약은 본문과 표에 명시된 수치(특히 Table 2의 도메인별 카운트와 결론부의 총합)를 우선으로 삼아 작성했으며, 원문에 명시된 작은 불일치는 그대로 보고함.