Experimental Evidence
The AnubisX Framework prototype (Anubis Twitter v2.5) was evaluated through 15 proof-of-concept experiments designed to test individual framework claims. These experiments provide initial feasibility evidence for the stylometric modality. This section describes the dataset, experimental results, failure cases, negative results, and reproducibility information.
Dataset
| Property | Value |
|---|---|
| Platform | Twitter (archived public data) |
| Language | Egyptian Arabic (colloquial) |
| Accounts | 31 Egyptian Twitter accounts |
| Data type | Public timeline tweets |
| Format | CSV with tweet text, timestamps, metadata |
| Collection | Via Twitter API v2 (academic research access) |
| Privacy | Anonymized; only publicly available data used |
Experimental Results
EXP-001: Fingerprint Dimensional Consistency
All 31 accounts successfully produce 372-dimensional behavioral fingerprint vectors, confirming dimensional consistency of the feature extraction pipeline. No accounts produced malformed or incomplete vectors.
EXP-002: Cross-User Cosine Similarity
Cross-user cosine similarity across 465 unique account pairs yields a mean of 0.697 with standard deviation 0.105. This distribution demonstrates that behavioral fingerprints carry user-specific signal but also exhibit substantial inter-user similarity, motivating the need for discriminative analysis methods.
EXP-004: Lexical Feature Discriminability
Lexical feature analysis reveals significant variation in word frequency distributions, character n-gram patterns, and punctuation usage across the 31 accounts. Feature-level analysis confirms that lexical features contribute meaningful discriminative power for user attribution.
EXP-006: FAISS Search Latency
FAISS-based similarity search achieves 6–8 μs per query in single-threaded mode on consumer hardware (Intel i7). This latency is well within real-time requirements for operational deployment and scales to much larger databases.
EXP-015: Egyptian Content Verification
The Egyptian Arabic content verification pipeline identifies 144 domain-specific keywords, 58 colloquial slang terms, and 12 location references across the dataset. This experiment validates the language-specific preprocessing required for accurate feature extraction in non-English contexts.
Failure Cases
| Issue | Description | Status |
|---|---|---|
| Hash non-determinism | Some feature hashing methods produce inconsistent output across library versions | UNRESOLVED |
| Small sample size | 31 accounts from a single demographic insufficient for generalizability | LIMITATION |
| Single modality | Only stylometric features tested; 4 of 5 modalities have no empirical evidence | LIMITATION |
| No baseline comparison | No comparison against existing authorship attribution methods | PENDING |
Negative Results
- No evidence for cross-modal correlation — the relationship between stylometric, chrono, terminal, network, and media features remains uncharacterized.
- No evidence for optimal feature dimensionality — 372-dim was selected by convention, not by systematic optimization.
- No evidence for generalizability beyond Egyptian Arabic Twitter users.
- No evidence for temporal stability of fingerprints over time scales exceeding the collection window.
- No evidence for robustness against adversarial obfuscation or stylometric countermeasures.
Reproducibility
All experiments are reproducible using the open-source Anubis Twitter v2.5 prototype (47 Python files, ~2,800 LOC). Requirements include:
- Python 3.9+ with dependencies listed in requirements.txt
- FAISS for similarity search (CPU version sufficient for 31 accounts)
- Twitter API v2 credentials (academic research access recommended)
- Alternatively, the provided sample dataset CSV can be used without API access
- Consumer hardware (Intel i7 or equivalent) is sufficient for all 15 experiments