구조는 합성 샘플에서, 분포는 본선 데이터에서: K-Health 대구 OMOP CDM 팀이 결과보고서 전에 나눠 볼 것 | DAKER 커뮤니티
2026 K-Health 미개방 의료데이터 활용 경진대회 본선은 11월 6일 금요일 16:00 마감까지 결과보고서, 발표자료, 안심존 방문 증빙을 모두 내야 합니다. 대구 OMOP CDM 데이터를 고른 팀이라면 예선 때 안심존에서 본 샘플을 떠올려 보세요. 공식 데이터 설명에 따르면 그 샘플은 구조와 컬럼을 파악하기 위한 합성 데이터였고, 본선에서는 심부전 환자 데이터가 제공될 예정입니다. 예선 때 샘플에서 본 숫자를 보고서 초안에 그대로 옮겨 두었다면, 지금 구조와 숫자를 나눠 다시 볼 때입니다.

먼저 답부터: 테이블 구조는 샘플에서, 숫자는 본선 데이터에서
합성 샘플에서 얻은 것 가운데 지금도 쓸 수 있는 것은 테이블 이름, 컬럼, 테이블 사이의 연결 방식 같은 구조 정보입니다. 반면 환자 수, 비율, 평균, 분포 같은 숫자는 합성 데이터의 성질을 반영할 뿐이므로 본선 데이터로 다시 계산해야 합니다. 보고서에 들어갈 숫자마다 어떤 데이터에서 나왔는지 적어 두면, 이 구분이 자연스럽게 지켜집니다.
예선 기간 중 안심존에서 확인할 수 있는 샘플은 구조·컬럼 파악용 합성(Synthea) 데이터이며, 본선에서는 심부전(HF) 환자 데이터가 제공될 예정입니다.
대구 OMOP CDM 데이터는 어떻게 생겼나요?
DAKER 해커톤 페이지의 데이터 설명에 따르면 계명대학교 동산병원 OMOP CDM은 관찰의료데이터를 공통데이터모델 OMOP CDM v5.3.1과 표준어휘로 변환한 데이터입니다. person, visit, condition, drug, procedure, measurement 같은 임상 테이블과 concept 계열 표준어휘, 파생 테이블을 합쳐 총 18개 테이블로 구성됩니다. OMOP CDM은 여러 기관의 데이터를 같은 틀로 맞추기 위한 공통데이터모델이므로, 예선 때 그려 둔 테이블 연결도는 본선에서도 출발점이 됩니다. 다만 본선 데이터에서 같은 테이블과 컬럼이 있는지는 직접 한 번씩 확인해야 합니다.
달라지는 것은 그 안에 담긴 사람들입니다. 합성 데이터는 실제 환자가 아닌 가상의 기록이고, 본선 데이터는 심부전이라는 특정 환자군입니다. 나이, 동반 질환, 측정값 분포가 다를 수밖에 없으니 합성 샘플에서 본 경향을 본선 결과처럼 서술하면, 발표평가가 보는 자료 이해 정도를 오히려 보여 주기 어렵습니다.
참가 포인트: 메모를 두 묶음으로 나눕니다
- 지금까지 모은 분석 메모를 테이블 구조에 관한 것과 숫자에 관한 것으로 나눕니다.
- 구조 메모는 본선 데이터에서 같은 테이블과 컬럼이 있는지 한 번씩 확인합니다.
- 숫자 메모는 모두 본선 데이터로 다시 계산하고, 예선 샘플에서 나온 숫자는 보고서에서 지웁니다.
- 결과보고서의 표와 그림마다 사용한 데이터셋명과 계산한 날을 함께 적습니다.
본선 발표평가 70점 가운데 적합성 20점은 데이터안심존 내 데이터 활용의 적절성과 데이터 가공·분석 방안의 타당성을, 실현성 15점은 작성 내용의 완성도와 자료 이해 정도를 봅니다. 구조와 숫자를 구분해 쓴 보고서는 두 항목 모두에 근거가 됩니다.
4~6컷 코믹 해설: 예선 숫자를 걸러 낸 팀
아래 5컷은 예선 때 샘플에서 본 숫자를 보고서 초안에 옮기던 팀에서 시작합니다. 팀원이 그 샘플이 구조 확인용 합성 데이터였다고 짚자, 구조 메모와 숫자 메모를 나누고 숫자는 본선 데이터로 다시 계산해 출처를 붙이는 데서 끝납니다.

결과보고서 점검 체크리스트
- 보고서의 모든 숫자가 본선 데이터에서 계산됐습니다.
- 예선 합성 샘플은 구조 확인 용도로만 언급했습니다.
- 표와 그림마다 데이터셋명과 계산한 날을 적었습니다.
- 선택한 데이터셋명이 발표자료에도 들어 있습니다.
일정과 숫자로 보는 오늘
작성 기준일인 2026년 10월 12일 DAKER 해커톤 페이지 기준 참가 417명입니다. 본선 제출 3종은 11월 6일 16:00에 마감되고, 수행평가는 11월 9일부터 10일까지, 발표평가와 시상식은 11월 13일입니다. 대구 계명대학교 동산의료원 안심활용센터는 평일 08:30부터 17:30까지 운영하며, 주말과 공휴일에는 쉽니다.
공식 출처
데이터 구성, 샘플 성격, 평가 배점, 운영 시간은 DAKER의 2026 K-Health 미개방 의료데이터 활용 경진대회 해커톤 페이지(데이터·규칙·평가 탭)에서 2026년 10월 12일 오전에 확인했습니다. 본선 데이터의 세부 규모는 공식 페이지에 따로 적혀 있지 않습니다.
- 2026 K-Health 미개방 의료데이터 활용 경진대회 해커톤 페이지
- DAKER 대회 글: 예선 제안서의 데이터는 바꿀 수 없습니다
- DAKER 대회 글: 광주 라이프로그 측정 항목 대응표
FAQ
예선 샘플에서 확인한 내용을 보고서에 전혀 쓰면 안 되나요?
테이블 구조와 컬럼을 어떻게 파악했는지는 분석 과정으로 설명할 수 있습니다. 다만 수치와 경향은 본선 데이터에서 다시 계산한 값만 결과로 쓰는 것이 공식 설명과 맞습니다.
광주나 대전 데이터를 고른 팀도 해당되나요?
합성 샘플 안내는 대구 OMOP CDM에 대한 설명입니다. 광주 라이프로그는 예선 샘플이 데이터셋별 50건, 본선 분석용은 1,000건 이상으로 안내돼 있어 규모가 다르니, 같은 방식으로 숫자의 출처를 구분해 두면 좋습니다.
여러분 팀의 보고서 초안에는 예선 때 본 숫자가 몇 개나 남아 있나요? 구조와 숫자를 나눠 정리한 방법을 댓글로 나눠 주세요.