ORTHRUS: attribution quality를 중심에 둔 provenance-based IDS

이 논문의 핵심은 “공격을 맞혔는가?”보다 “분석가가 실제로 조사해야 하는 노드를 얼마나 정확히 줄였는가?”를 묻는 데 있다. ORTHRUS는 whole-system provenance graph에서 node-level anomaly를 찾고, dependency analysis로 attack summary graph를 재구성해 alert fatigue를 줄이려는 시스템이다.

AuthorsBaoxiang Jiang, Tristan Bilot, Nour El Madhoun, Khaldoun Al Agha, Anis Zouaoui, Shahrear Iqbal, Xueyuan Han, Thomas Pasquier
VenueUSENIX Security 2025, Cycle 1
CategorySystem Security
ArtifactsPublic datasets, annotations, and source code are referenced by the paper.
TL;DR

기존 provenance IDS들은 높은 detection accuracy를 보고했지만, 평가 방식이 공격과 무관한 주변 노드까지 “malicious”로 넓게 잡는 경우가 많았다. ORTHRUS는 더 보수적인 node-level ground truth를 만들고, benign-only self-supervised temporal GNN과 causality tracing을 결합해 분석가가 볼 노드 수를 몇 자릿수 줄이는 것을 목표로 한다.

문제의식: IDS의 출력은 맞아도 사람이 못 쓸 수 있다

논문이 지적하는 실전 문제는 attribution이다. Provenance graph는 process, file, socket 같은 OS 객체와 system call 기반 상호작용을 그래프로 저장한다. 이 그래프에서 침입을 찾는 PIDS는 APT 같은 unknown attack을 잡는 데 유용하지만, 출력이 너무 크면 분석가는 root cause와 damage를 찾기 어렵다.

저자들은 이를 Quality of Attribution (QoA)라고 부른다. QoA는 IDS 출력에서 공격 원인, 영향 범위, false alarm 여부를 조사하는 데 필요한 인간 분석가의 노력을 의미한다. 따라서 이 논문에서 좋은 시스템은 단순히 많은 공격 노드를 recall하는 시스템이 아니라, 적은 수의 정확한 조사 대상을 제시하는 시스템이다.

왜 기존 평가 방식이 alert fatigue를 만들 수 있는가
Neighborhood / Batch 공격 주변까지 넓게 labeling Source Approach source 이후 descendant 과대 포함 ORTHRUS 목표 직접 관련 노드와 attack path 중심

설명용 재구성 그림이다. 논문 원본 figure를 복사한 것이 아니라, §2와 Table 1의 논지를 시각적으로 요약했다.

핵심 아이디어: detection과 investigation을 분리하지 않는다

ORTHRUS는 anomaly-based PIDS다. 공격 label 없이 benign execution으로 normal behavior를 학습하고, inference 시 reconstruction loss가 큰 edge/node를 suspicious하게 본다. 여기에 끝나지 않고, suspicious node 주변을 causality tracing으로 재구성해 analyst에게 attack summary graph를 제공한다.

1Graph Construction

system logs에서 process, file, netflow와 event를 provenance graph로 구성하고 Causality Preserved Reduction으로 redundant edge를 줄인다.

2Edge Featurization

event type, source/destination type, node attribute embeddings를 edge feature로 만든다.

3Temporal Graph Learning

최근 N개 temporal neighbors를 attention 기반 GNN encoder로 집계하고 decoder가 edge type을 예측한다.

4Anomaly Detection

validation set의 최대 anomaly score로 threshold를 자동 설정하고, K-means로 가장 suspicious한 outlier cluster를 남긴다.

5Attack Reconstruction

detected node에서 backward/forward tracing을 수행해 critical entry와 exit를 고르고 attack graph를 만든다.

ORTHRUS의 데이터 흐름
System logs process / file / netflow Provenance graph Temporal GNN edge type prediction loss = anomaly score Outliers Attack graph 논문 명시: N=10~20 temporal sampling과 z=32 embedding이 평균적으로 좋은 성능을 보임.

설명용 재구성 그림이다. 논문 Figure 1의 구조를 복사하지 않고 페이지용으로 단순화했다.

기술적 디테일

Feature 설계

노드 type과 edge/event type은 one-hot encoding으로 표현한다. file path, command line, IP address 같은 textual attribute는 tokenization 후 Word2vec Skip-gram으로 embedding하고 평균을 내 node feature로 사용한다.

Temporal sampling

edge (u, v)가 시간 t에 들어오면, v에 대해 t 이전에 발생한 incoming edge 중 최근 N개를 샘플링한다. 이렇게 고정 크기 context를 쓰기 때문에 temporal signal을 유지하면서 scalability를 제어한다.

Encoder/decoder

encoder는 GraphTransformer 계열 attention GNN으로 source/destination node와 edge feature를 집계한다. decoder는 source/destination embedding을 구분해 edge type을 예측하고 cross-entropy loss를 reconstruction error로 사용한다.

Attack reconstruction

detected node p를 중심으로 기본 15분 time window의 subgraph를 만들고 DAG로 변환한다. backward tracing으로 entry, forward tracing으로 exit를 찾은 뒤 degree score와 anomaly score를 결합한 criticality score로 핵심 path를 고른다.

Evaluation: “몇 개를 맞혔나”보다 “얼마나 적게 보여줬나”

평가는 DARPA Transparent Computing E3/E5 데이터셋을 사용했다. 세 capture mechanism인 CADETS, THEIA, CLEARSCOPE가 각각 FreeBSD, Linux, Android 환경에서 system provenance를 수집한다. 논문은 기존 기준 대신 직접 관련 malicious node만 보수적으로 labeling한 ground truth를 만들었다.

6evaluated dataset splits
41-123malicious nodes in the authors' ground truth per test set
1:10k-1:1Mreported malicious-node prevalence range
5state-of-the-art baselines
DatasetORTHRUS-fullBest contrast in paperTakeaway
E3-CADETS25 TP, 23 FP, precision 0.52, MCC 0.44Flash: 13 TP, 2,381 FP, precision 0.01ORTHRUS gives far fewer nodes to inspect.
E3-THEIA48 TP, 11 FP, precision 0.81, MCC 0.57MAGIC: 115 TP, 394,906 FPHigh recall alone can bury analysts.
E5-THEIA13 TP, 2 FP, precision 0.87, MCC 0.40Flash: 43 TP, 295,729 FPPrecision and QoA improve sharply.
E5-CADETS2 TP, 10 FP, precision 0.17, MCC 0.05All systems struggle hereCapture mechanism and missing graph elements matter.
Table 1의 핵심: ground truth 크기가 평가 철학을 바꾼다
E3-CADETS E3-THEIA E5-CADETS E5-THEIA Neighborhood Batch ORTHRUS ground truth

설명용 차트이며 bar height는 log-scale 직관화를 위해 재구성했다. 실제 값 예: E3-CADETS는 Neighborhood 12,852 / Batch 4,929 / Source 2,062 / Ours 68, E5-CADETS는 Batch 717,783 / Source 401,065 / Ours 123.

Contribution과 limitation

논문이 직접 주장하는 contribution

첫째, whole-system provenance graph에서 의미 있는 node-level detection을 수행하며 분석 대상 데이터를 몇 자릿수 줄이는 PIDS를 제안한다. 둘째, DARPA E3/E5 benchmark에 대해 더 보수적이고 공개된 node-level ground truth annotation을 만든다. 셋째, 구현과 artifact를 공개해 재현성을 높인다.

한계와 open question

false positive가 여전히 malicious node의 one-hop neighborhood에서 발생할 수 있다. E5-CADETS처럼 capture mechanism이 path나 netflow 정보를 덜 제공하거나 graph element가 누락될 수 있는 경우 성능이 약해진다. 또한 concept drift에 대응하기 위한 지속적 retraining 문제는 전용 dataset 부족으로 충분히 평가되지 않았다.

가져갈 핵심 insight

이 논문을 읽을 때 가장 중요한 관점은 “anomaly detection 성능”과 “forensic attribution 품질”을 분리해서 보아야 한다는 점이다. PIDS가 공격 근처의 수십만 노드를 anomalous하게 보여준다면 detection 논문으로는 좋아 보여도 운영 환경에서는 실패할 수 있다. ORTHRUS의 가치는 모델 구조 자체뿐 아니라, 평가 기준을 analyst workload에 맞게 다시 세운 데 있다.

이 페이지의 수치와 기술 설명은 제공/공식 PDF `usenixsecurity25-jiang-baoxiang.pdf`에서 확인한 내용을 기반으로 작성했다. 다이어그램은 이해를 돕기 위한 재해석이며 원본 figure 복사가 아니다.