Offline LLM / agent eval harness with regression gates
Drift inferred · capture-to-capture
No drift recorded — single capability capture; advisories appear once its surface changes.
transport stdio counts 1 tools · 0 res
· 0 prompts
permission surface via code analysis
tools
-
evalbench_scan
evidence-backed
findings quoted directly from the published source artifact — not inferred
code files: 28
filesystem 5
- fs cognis-digital-evalbench-6858433/evalbench/cli.py :21
with open(path, "r", encoding="utf-8") as fh: - fs cognis-digital-evalbench-6858433/evalbench/connect.py :78
text = sys.stdin.read() if a.input == "-" else open(a.input, encoding="utf-8").read() - fs cognis-digital-evalbench-6858433/evalbench/core.py :459
with open(case["output_file"], "r", encoding="utf-8") as fh: - fs (weak) cognis-digital-evalbench-6858433/tests/test_evalbench_deep.py :236
base = evaluate_suite(json.load(open(BASELINE, encoding="utf-8"))).to_dict() - fs (weak) cognis-digital-evalbench-6858433/tests/test_smoke.py :66
with open(DEMO, encoding="utf-8") as fh:
network 2
- net cognis-digital-evalbench-6858433/integrations/webhook.py :8
import argparse, json, sys, urllib.request - net cognis-digital-evalbench-6858433/livesearch.py :28
import urllib.parse
tool registrations 1
- evalbench_scan cognis-digital-evalbench-6858433/evalbench/mcp_server.py :16
declared dependencies 3
- mcp@>=1.0
- cognis-connect@@ git+https://github.com/cognis-digital/cognis-connect.git
- pytest@>=8.0