법의학 분야에서 미지의 생물학적 시료에 대한 출처 생물 특성 분석은 중요하나, 프로테오믹스 데이터 분석 적용에는 한계가 있었습니다. 본 연구는 이러한 간극을 해소하고자 새로운 계산 도구인 MARLOWE를 개발했습니다. MARLOWE는 de novo 펩타이드 시퀀싱을 통해 얻은 펩타이드 태그와 광범위한 서열 데이터베이스 기반의 통계적 접근 방식을 활용하여 잠재적 출처 생물 목록을 제공합니다.
MARLOWE는 사전 지식 없이 펩타이드를 분류학적으로 할당하고 점수를 매기는 확률론적 방식을 채택하여 편향 없는 결과를 도출합니다. 개념 증명 연구에서 Biodiversity 데이터셋과 Bacillus cereus 초종(superspecies) 데이터셋을 사용하여 MARLOWE의 성능을 평가했습니다. 그 결과, 단일 출처 및 이진 혼합 시료에서 기여 생물을 성공적으로 특성화했으며, 박테리아 초종 내 종을 구별할 수 있는 충분한 특이성을 보였습니다.
선도적인 프로테오믹스 기반 미생물 식별 도구인 MiCId와의 비교 연구에서는 225개의 질량 분석 데이터를 사용하여 유사한 성능을 확인했습니다. MiCId가 약간 더 높은 정확도와 특이성을 보였으나, MARLOWE는 종 수준에서 5% FDR 기준 91.4%의 특이도를 달성했습니다.
이러한 결과는 MARLOWE가 법의학적 맥락에서 단일 생물 및 이진 혼합 시료의 후보 또는 선도 물질 식별에 적합하며, 추가 분석을 위한 단서를 제공하고 적절한 후속 분석 선택에 기여할 수 있음을 시사합니다.
인간 건강 연구의 기반이 되는 단백질 코딩 유전체 특성화는 주요 과학적 과제이나, 기존 분석에서 놓쳤을 수 있는 부분에 대한 근본적인 질문이 남아있습니다. 지난 10년간 비정규적 오픈 리딩 프레임(ncORF)의 번역이 다양한 인간 세포 유형과 질병 상태에서 관찰되었으며, 이는 생물의학 분야에 중대한 영향을 미칩니다. 그러나 어떤 ncORF가 인간 프로테옴에 기여하는 작은 마이크로단백질 또는 대체 단백질 분자를 생성하는지에 대한 지식 격차가 있었습니다.
본 연구에서는 TransCODE 컨소시엄의 협력 노력을 통해 ncORF에 대한 단백질 수준 증거의 합의적 지형을 제시합니다. 95,520건의 대규모 프로테오믹스 실험 분석에서 7,264개 ncORF 중 약 25%가 검출 가능한 펩타이드를 생성함을 확인했습니다. 우리는 ncORF가 인코딩하는 마이크로단백질을 인간 단백질로 주석화하는 프레임워크를 개발하고, 기능성 단백질로서의 잠재력이 불확실한 마이크로단백질인 '펩타이딘(peptideins)'이라는 새로운 개념 모델을 정립했습니다.
펩타이딘의 생물학적 함의를 탐구하기 위해 ORF 상대 가지 길이(ORBL)라는 진화 분석 접근법을 개발했으며, 진화적 제약이 흔하며 ncORF 유래 펩타이드 관찰과 연관됨을 밝혀냈습니다. 또한 OLMALINC 긴 비코딩 RNA에서 유래한 한 펩타이딘에 대한 범세포 필수 표현형을 특성화했습니다.
종합적으로, 우리는 GENCODE 및 PeptideAtlas가 지원하는 공개 연구 도구를 생성하고, 인간 프로테옴의 미연구 구성 요소에 대한 생물의학적 발견을 진전시켰습니다. TransCODE 컨소시엄의 대규모 프로테오믹스 분석을 통해 많은 번역된 비정규적 오픈 리딩 프레임이 마이크로단백질과 펩타이딘을 인코딩함을 밝혀냈습니다.