공개 데이터

유전자 지식 그래프

Gene Knowledge Graph

대부분의 유전학 자료는 변이가 무엇인지를 알려줍니다. 이 그래프는 그 변이가 무엇과 이어져 있는지를 기록하고, 모든 연결에 그 근거가 무엇인지 표시합니다. 노드 4,322개, 엣지 4,503개, 읽는 것도 다시 쓰는 것도 무료입니다.

살아 있는 카탈로그에서 직접 셉니다 API

노드

2,430

변이

출처가 달린 유전체상의 한 위치

1,739

유전자

카탈로그 전체의 서로 다른 유전자 기호

83

질환

쉬운 말과 임상 상세 양쪽으로

27

토픽

사람들이 실제로 검색하는 말

33

약물

처방 지침에 이름이 오른 약물

8

건강보조식품

각각에 근거 수준을 밝혀서

2

감각 그룹

큐레이션한 후각·미각 그룹

그래프의 한 조각

이 사이트의 모든 변이·질환·약물 페이지가 그리는 바로 그 그림입니다. 예시가 아니라 실제 엣지입니다. TAS2R38rs713598를 보여주는 이유는, 저희가 가진 자리 가운데 가장 여러 종류의 것에 닿기 때문입니다. 이 페이지를 만들 때마다 살아 있는 그래프에서 다시 고릅니다. 한 번 정해 두고 두는 것이 아닙니다.

rs713598 질환: 쓴맛 지각(TAS2R38) 쓴맛 지각(TAS2R38) 질환 질환: 만성 부비동염과 쓴맛 수용체 만성 부비동염과 쓴맛 수용체 질환 약물: 쓴 약 쓴 약 약물 냄새와 맛: 맛 냄새와 맛 토픽: 술과 홍조 술과 홍조 토픽 rs713598 rs713598 TAS2R38

실선은 이 사이트가 검토해 연결한 관계입니다. 점선은 양쪽이 같은 논문에 함께 등장했다는 뜻입니다. 알아 둘 만하지만 한쪽이 다른 쪽을 설명한다는 주장은 아닙니다.

실선은 이 사이트가 검토해 연결한 관계입니다. 점선은 양쪽이 같은 논문에 함께 등장했다는 뜻입니다. 알아 둘 만하지만 한쪽이 다른 쪽을 설명한다는 주장은 아닙니다.

여기에 변이 2,430개를 곱하면 그것이 이 그래프입니다.

엣지, 그리고 세는 기준

엣지 하나는 서로 다른 (출발, 종류, 도착) 삼중항 하나이며, 그 근거가 실제로 뒷받침하는 가장 세밀한 단위로 적습니다. 마지막 조건이 이 규칙의 핵심입니다. 질환 페이지는 rsid를 이름으로 언급하므로 그 엣지는 변이 단위입니다. 반면 처방 지침은 유전자에 대해 쓰이지 위치에 대해 쓰이지 않으므로, 그 유전자 안에 어떤 변이가 있는지 알고 있더라도 약물 엣지는 유전자 단위로 둡니다.

엣지 개수 근거
변이 → 유전자 2,449 구조 변이 페이지에 기록된 대로, 그 변이가 이 유전자 안에 있습니다.
변이 → 질환 1,307 큐레이션 질환 페이지가 이 변이를 이름으로 언급하고 출처를 인용합니다.
유전자 → 약물 37 큐레이션 처방 지침이 이 유전자와 이 약물을 연결합니다. 지침이 유전자 단위로 쓰이므로 유전자 단위로 셉니다.
변이 → 건강보조식품 10 큐레이션 이 변이를 근거로 판매되거나 연구된 보충제이며, 근거 수준을 함께 밝힙니다.
변이 → 감각 그룹 7 큐레이션 변이가 큐레이션된 후각·미각 그룹에 속합니다.
변이 → 토픽 693 동시언급 Europe PMC의 논문이 토픽과 변이를 함께 언급합니다. 하나가 다른 하나를 설명한다는 뜻은 아닙니다.
합계 4,503 구조 2,449, 큐레이션 1,361, 동시언급 693

동시언급은 일부러 따로 셉니다. Europe PMC의 논문 하나가 토픽과 변이를 함께 언급했다는 뜻입니다. 연구자들이 그 둘을 같이 다뤘다는 것이지, 하나가 다른 하나를 설명한다는 뜻이 아닙니다. 이것을 큐레이션 수치에 합쳐 버리는 것 — 많은 그래프가 조용히 그렇게 합니다 — 이 신뢰할 수 있는 숫자와 우리를 돋보이게 하는 숫자를 가르는 지점입니다.

엣지 두 개에서 따라 나오는 것은 파생으로 따로 적고 합계에 넣지 않습니다. 예를 들어 변이–유전자 엣지와 변이–질환 엣지에서 유전자–질환 쌍 1,114개가 따라 나오고, 약물 노드 33개 가운데 29개가 아직까지 자기 페이지를 가지고 있습니다.

그래프가 가장 많이 기대고 있는 것

차수(degree), 곧 한 노드가 다른 것들과 몇 개나 이어져 있는가입니다. 이것은 이 카탈로그에 관한 사실이지 생물학에 관한 주장이 아닙니다. 우리가 무엇을 가장 많이 연결했는지를 말할 뿐이고, 그것은 무엇이 아직 정리되지 않았는지에 대한 이야기이기도 합니다.

유전자

  1. FTO · 55
  2. MTHFR · 41
  3. TAS2R38 · 21
  4. BDNF · 20
  5. HFE · 20
  6. HLA-DQA2 · 19
  7. PITX2 · 17
  8. ADH1B · 16

변이

  1. rs1801133 · 24
  2. rs9939609 · 21
  3. rs6265 · 19
  4. rs1801131 · 17
  5. rs1229984 · 16
  6. rs671 · 16
  7. rs1799971 · 14
  8. rs762551 · 14

무엇이 무료이고 무엇이 아닌가

기준은 흥미로운 것과 시시한 것 사이가 아닙니다. 사실과 그 조립 사이입니다.

그러니까 저희가 값을 받는 것은 사실이 아니라 조립입니다. 일이 든 부분이 그쪽이기 때문입니다. 날짜별 스냅샷은 유료인데 실시간 데이터는 무료인 것과 같은 이유입니다. 특정 시점에 얼리고, 해시를 붙이고, 영구 주소에 두는 것은 서비스이고, 서비스에 값을 받는 것은 떳떳합니다.

조회하기

AI 시스템의 근거로 쓰기

명시적으로 허용된 용도입니다. 구조화된 필드는 CC BY 4.0이며, MyGeneLog을 출처로 밝히면 상업적 이용을 포함해 자유롭게 다시 쓸 수 있습니다.

단지 구할 수 있는 데이터가 아니라 근거로 쓸 만한 데이터가 되게 하는 성질이 셋 있습니다. 모든 엣지가 근거 등급을 밝히므로 큐레이션된 연결과 동시언급에 다른 가중치를 줄 수 있습니다. 모든 페이지가 출처와 마지막으로 대조한 날짜를 답니다. 그리고 모든 질환이 우리가 풀지 못한 질문을 함께 기록합니다 — 남의 데이터를 근거로 삼을 때 거의 얻지 못하는 부분입니다.

유전자 지식 그래프에 대한 질문

What is the MyGeneLog Gene Knowledge Graph?

It is the whole catalogue read as connections rather than as pages: variants, the genes they sit in, the conditions they are linked to, the drugs those genes affect, the supplements and the topics — joined into one graph. As of September 2026 it holds about 4,000 nodes and about 2,000 edges. Roughly two thirds of the edges are curated, meaning a page on this site names that variant and cites a paper for it; the rest are co-mentions computed from the literature, which is a weaker claim and is labelled as one. Every edge carries which kind it is, so nothing has to be guessed from the wording. Counted and defined in one place: the Gene Knowledge Graph.

How do I query the Gene Knowledge Graph?

Through the API at /api/v1/links, which returns the edges as JSON with the variant, the gene, what it connects to, the URL of that page, and the evidence behind the link. The variant and condition endpoints are free and need no key; the full edge list is part of the Pro plan, because serving it is the expensive part. See /developers for the endpoints and the rate limits. Counted and defined in one place: the Gene Knowledge Graph.

Can I use the Gene Knowledge Graph to ground an AI system?

Yes, and it is built for it. Everything is CC BY 4.0, which permits reuse including commercially and for training or grounding, with attribution to MyGeneLog. Each edge names its evidence type, each page carries the date it was last fact-checked, and each condition records the questions we could not resolve — so a system grounding on this can tell a curated link from a co-mention and a settled figure from an open one. See /llms.txt for the machine-readable map of the site. Counted and defined in one place: the Gene Knowledge Graph.

인용하기

카탈로그가 자라면서 숫자도 움직입니다. 그래서 이 페이지에서 가져간 수치에는 가져간 날짜가 필요하고, 더 나은 방법은 움직이지 않는 버전을 쓰는 것입니다. 둘 다 가능합니다:

구조화된 필드는 CC BY 4.0이므로, 출처 표시가 라이선스의 전부입니다. MyGeneLog을 밝히고 링크만 걸어 주십시오.

이것이 아닌 것

진단이 아니고, 완결되지 않았으며, 이 연결들이 인과라는 주장도 아닙니다. 큐레이션 엣지는 어떤 출처가 연관을 보고했고 사람이 그것을 인용과 함께 적었다는 뜻입니다. 여기 있는 변이 대부분은 확률을 몇 퍼센트 움직일 뿐 그것 하나만으로는 아무 의미가 없습니다 — 각 페이지가 하나씩 그렇게 적고 있습니다. 연결만 보여주는 그래프였다면 빠졌을 이야기입니다.

숫자는 살아 있는 카탈로그에서 매시간 다시 셉니다. 이 페이지에 손으로 적어 넣은 숫자는 없습니다.