Feature 설계
노드 type과 edge/event type은 one-hot encoding으로 표현한다. file path, command line, IP address 같은 textual attribute는 tokenization 후 Word2vec Skip-gram으로 embedding하고 평균을 내 node feature로 사용한다.
USENIX SECURITY 2025
Achieving High Quality of Attribution in Provenance-based Intrusion Detection Systems
SYSTEM SECURITY / PROVENANCE IDS
이 논문의 핵심은 “공격을 맞혔는가?”보다 “분석가가 실제로 조사해야 하는 노드를 얼마나 정확히 줄였는가?”를 묻는 데 있다. ORTHRUS는 whole-system provenance graph에서 node-level anomaly를 찾고, dependency analysis로 attack summary graph를 재구성해 alert fatigue를 줄이려는 시스템이다.
기존 provenance IDS들은 높은 detection accuracy를 보고했지만, 평가 방식이 공격과 무관한 주변 노드까지 “malicious”로 넓게 잡는 경우가 많았다. ORTHRUS는 더 보수적인 node-level ground truth를 만들고, benign-only self-supervised temporal GNN과 causality tracing을 결합해 분석가가 볼 노드 수를 몇 자릿수 줄이는 것을 목표로 한다.
논문이 지적하는 실전 문제는 attribution이다. Provenance graph는 process, file, socket 같은 OS 객체와 system call 기반 상호작용을 그래프로 저장한다. 이 그래프에서 침입을 찾는 PIDS는 APT 같은 unknown attack을 잡는 데 유용하지만, 출력이 너무 크면 분석가는 root cause와 damage를 찾기 어렵다.
저자들은 이를 Quality of Attribution (QoA)라고 부른다. QoA는 IDS 출력에서 공격 원인, 영향 범위, false alarm 여부를 조사하는 데 필요한 인간 분석가의 노력을 의미한다. 따라서 이 논문에서 좋은 시스템은 단순히 많은 공격 노드를 recall하는 시스템이 아니라, 적은 수의 정확한 조사 대상을 제시하는 시스템이다.
설명용 재구성 그림이다. 논문 원본 figure를 복사한 것이 아니라, §2와 Table 1의 논지를 시각적으로 요약했다.
ORTHRUS는 anomaly-based PIDS다. 공격 label 없이 benign execution으로 normal behavior를 학습하고, inference 시 reconstruction loss가 큰 edge/node를 suspicious하게 본다. 여기에 끝나지 않고, suspicious node 주변을 causality tracing으로 재구성해 analyst에게 attack summary graph를 제공한다.
system logs에서 process, file, netflow와 event를 provenance graph로 구성하고 Causality Preserved Reduction으로 redundant edge를 줄인다.
event type, source/destination type, node attribute embeddings를 edge feature로 만든다.
최근 N개 temporal neighbors를 attention 기반 GNN encoder로 집계하고 decoder가 edge type을 예측한다.
validation set의 최대 anomaly score로 threshold를 자동 설정하고, K-means로 가장 suspicious한 outlier cluster를 남긴다.
detected node에서 backward/forward tracing을 수행해 critical entry와 exit를 고르고 attack graph를 만든다.
설명용 재구성 그림이다. 논문 Figure 1의 구조를 복사하지 않고 페이지용으로 단순화했다.
노드 type과 edge/event type은 one-hot encoding으로 표현한다. file path, command line, IP address 같은 textual attribute는 tokenization 후 Word2vec Skip-gram으로 embedding하고 평균을 내 node feature로 사용한다.
edge (u, v)가 시간 t에 들어오면, v에 대해 t 이전에 발생한 incoming edge 중 최근 N개를 샘플링한다. 이렇게 고정 크기 context를 쓰기 때문에 temporal signal을 유지하면서 scalability를 제어한다.
encoder는 GraphTransformer 계열 attention GNN으로 source/destination node와 edge feature를 집계한다. decoder는 source/destination embedding을 구분해 edge type을 예측하고 cross-entropy loss를 reconstruction error로 사용한다.
detected node p를 중심으로 기본 15분 time window의 subgraph를 만들고 DAG로 변환한다. backward tracing으로 entry, forward tracing으로 exit를 찾은 뒤 degree score와 anomaly score를 결합한 criticality score로 핵심 path를 고른다.
평가는 DARPA Transparent Computing E3/E5 데이터셋을 사용했다. 세 capture mechanism인 CADETS, THEIA, CLEARSCOPE가 각각 FreeBSD, Linux, Android 환경에서 system provenance를 수집한다. 논문은 기존 기준 대신 직접 관련 malicious node만 보수적으로 labeling한 ground truth를 만들었다.
| Dataset | ORTHRUS-full | Best contrast in paper | Takeaway |
|---|---|---|---|
| E3-CADETS | 25 TP, 23 FP, precision 0.52, MCC 0.44 | Flash: 13 TP, 2,381 FP, precision 0.01 | ORTHRUS gives far fewer nodes to inspect. |
| E3-THEIA | 48 TP, 11 FP, precision 0.81, MCC 0.57 | MAGIC: 115 TP, 394,906 FP | High recall alone can bury analysts. |
| E5-THEIA | 13 TP, 2 FP, precision 0.87, MCC 0.40 | Flash: 43 TP, 295,729 FP | Precision and QoA improve sharply. |
| E5-CADETS | 2 TP, 10 FP, precision 0.17, MCC 0.05 | All systems struggle here | Capture mechanism and missing graph elements matter. |
설명용 차트이며 bar height는 log-scale 직관화를 위해 재구성했다. 실제 값 예: E3-CADETS는 Neighborhood 12,852 / Batch 4,929 / Source 2,062 / Ours 68, E5-CADETS는 Batch 717,783 / Source 401,065 / Ours 123.
첫째, whole-system provenance graph에서 의미 있는 node-level detection을 수행하며 분석 대상 데이터를 몇 자릿수 줄이는 PIDS를 제안한다. 둘째, DARPA E3/E5 benchmark에 대해 더 보수적이고 공개된 node-level ground truth annotation을 만든다. 셋째, 구현과 artifact를 공개해 재현성을 높인다.
false positive가 여전히 malicious node의 one-hop neighborhood에서 발생할 수 있다. E5-CADETS처럼 capture mechanism이 path나 netflow 정보를 덜 제공하거나 graph element가 누락될 수 있는 경우 성능이 약해진다. 또한 concept drift에 대응하기 위한 지속적 retraining 문제는 전용 dataset 부족으로 충분히 평가되지 않았다.
이 논문을 읽을 때 가장 중요한 관점은 “anomaly detection 성능”과 “forensic attribution 품질”을 분리해서 보아야 한다는 점이다. PIDS가 공격 근처의 수십만 노드를 anomalous하게 보여준다면 detection 논문으로는 좋아 보여도 운영 환경에서는 실패할 수 있다. ORTHRUS의 가치는 모델 구조 자체뿐 아니라, 평가 기준을 analyst workload에 맞게 다시 세운 데 있다.
이 페이지의 수치와 기술 설명은 제공/공식 PDF `usenixsecurity25-jiang-baoxiang.pdf`에서 확인한 내용을 기반으로 작성했다. 다이어그램은 이해를 돕기 위한 재해석이며 원본 figure 복사가 아니다.