Six-Stage Pipeline
Pipeline Stages
- Ingestion — Data acquisition through platform-specific adapters. Raw digital artifacts are collected and validated.
- Feature Extraction — Modality-specific feature computation with normalization. The 372-dimensional fingerprint is constructed from semantic embedding (256 dims), lexical features (16 dims), and character n-grams (100 dims).
- Profile Construction — Fingerprint generation with quality assessment. Profiles are stored in SQLite database.
- Comparison — Similarity computation using configured metrics. FAISS IndexFlatIP with L2 normalization (cosine similarity).
- Evidence Evaluation — Score calibration and likelihood ratio computation. Requires ALG-023 (Confidence Calibration) at TBD status.
- Decision — Threshold-based classification with confidence quantification.
Stages 1–4 are implemented in the prototype (Anubis Twitter v2.5). Stages 5–6 are PROPOSED and await implementation.
Prototype Implementation
Anubis Twitter v2.5 implements the stylometric modality for Arabic Twitter data with 47 Python source files (~2,800 LOC) organized into five packages:
- Core — 372-dimensional feature extraction using paraphrase-multilingual-MiniLM-L12-v2
- Search — FAISS IndexFlatIP index management and cosine similarity search
- Verification — Egyptian linguistic verification (keyword dictionaries, slang patterns)
- Database — SQLite fingerprint storage
- Utilities — Arabic text preprocessing (URL removal, Unicode normalization)