Experimental Evidence

The AnubisX Framework prototype (Anubis Twitter v2.5) was evaluated through 15 proof-of-concept experiments designed to test individual framework claims. These experiments provide initial feasibility evidence for the stylometric modality. This section describes the dataset, experimental results, failure cases, negative results, and reproducibility information.

Dataset

PropertyValue
PlatformTwitter (archived public data)
LanguageEgyptian Arabic (colloquial)
Accounts31 Egyptian Twitter accounts
Data typePublic timeline tweets
FormatCSV with tweet text, timestamps, metadata
CollectionVia Twitter API v2 (academic research access)
PrivacyAnonymized; only publicly available data used

Experimental Results

EXP-001: Fingerprint Dimensional Consistency

All 31 accounts successfully produce 372-dimensional behavioral fingerprint vectors, confirming dimensional consistency of the feature extraction pipeline. No accounts produced malformed or incomplete vectors.

EXP-002: Cross-User Cosine Similarity

Cross-user cosine similarity across 465 unique account pairs yields a mean of 0.697 with standard deviation 0.105. This distribution demonstrates that behavioral fingerprints carry user-specific signal but also exhibit substantial inter-user similarity, motivating the need for discriminative analysis methods.

EXP-004: Lexical Feature Discriminability

Lexical feature analysis reveals significant variation in word frequency distributions, character n-gram patterns, and punctuation usage across the 31 accounts. Feature-level analysis confirms that lexical features contribute meaningful discriminative power for user attribution.

EXP-006: FAISS Search Latency

FAISS-based similarity search achieves 6–8 μs per query in single-threaded mode on consumer hardware (Intel i7). This latency is well within real-time requirements for operational deployment and scales to much larger databases.

EXP-015: Egyptian Content Verification

The Egyptian Arabic content verification pipeline identifies 144 domain-specific keywords, 58 colloquial slang terms, and 12 location references across the dataset. This experiment validates the language-specific preprocessing required for accurate feature extraction in non-English contexts.

Failure Cases

IssueDescriptionStatus
Hash non-determinismSome feature hashing methods produce inconsistent output across library versionsUNRESOLVED
Small sample size31 accounts from a single demographic insufficient for generalizabilityLIMITATION
Single modalityOnly stylometric features tested; 4 of 5 modalities have no empirical evidenceLIMITATION
No baseline comparisonNo comparison against existing authorship attribution methodsPENDING

Negative Results

Reproducibility

All experiments are reproducible using the open-source Anubis Twitter v2.5 prototype (47 Python files, ~2,800 LOC). Requirements include: