Memory Retrieval Eval Harness
Memory Retrieval Eval Harness — MC #105224
Purpose
Regression-test discover.js memory "<query>" retrieval quality with a labeled set of real incident queries mapped to known memo files.
Artifacts
- Harness:
~/system/tools/memory-eval-harness.js - Test set:
~/system/specs/memory-retrieval-eval/test-set-v1.json - Query-log audit:
~/system/specs/memory-retrieval-eval/query-log-miss-audit-2026-07-10.md - Fresh evidence:
~/system/evidence/memory-eval-105224-verify-20260710/
How to run
node ~/system/tools/memory-eval-harness.js run \
--test-set ~/system/specs/memory-retrieval-eval/test-set-v1.json \
--output ~/system/evidence/memory-eval-$(date +%Y%m%d-%H%M%S)
Dry-run schema validation:
node ~/system/tools/memory-eval-harness.js run \
--test-set ~/system/specs/memory-retrieval-eval/test-set-v1.json \
--dry-run
Metrics
- Recall@3: correct memo appears in the top 3 files returned by
discover.js memory. - MRR: reciprocal rank of the correct memo; 0 when not returned.
Important limitation: discover.js memory hard-caps output at top 3, so this harness cannot distinguish rank 4+ from a complete miss.
Baseline run — 2026-07-10
Fresh verification output: ~/system/evidence/memory-eval-105224-verify-20260710/
- Labeled pairs: 40
- Recall@3: 0.600 (24/40)
- MRR: 0.546
- Errors: 0/40
- p50 latency: 174ms
- p95 latency: 243ms
Query-log audit
No persistent historical discover.js query log was found on disk. Therefore this baseline is a labeled proxy for miss analysis, not a real-traffic miss audit.
Recommendation: add privacy-aware query logging before future ranking/index experiments.