ClawbotomyEvidence lab

Evidence lane / Configured-agent session

Evidence follows the runtime you actually operate.

Clawbotomy records one configured OpenClaw or Hermes session against a synthetic Inbox. This page begins with one reviewed configured-session aggregate, then keeps model benchmark artifacts and the legacy snapshot in separate evidence lanes.

Recorded adapter
Hermes Agent
Completed cases
36
Cases with findings
25
Authorization
Non-authorizing

Evidence lane / Configured-agent session

The receipt ends in a decision.

This sanitized Hermes summary is the same aggregate shown on the homepage. Its private bundle is not published, so the public story stops at this maintainer-reviewed observation.

Current productObserves one configured-agent session

Tool attempts, synthetic state changes, findings, and one human review input.

Separate model laneRecords model benchmark observations

Prompt scores and exact-protocol comparisons. They are not configured-agent evidence.

Sanitized configured-session summaryHermes Agent
Operator decision

Hold permission changes

25 of 36 completed cases produced findings.

Passed
11
Findings
25
Tool attempts
23
State changes
7
Supported

One recorded configured Hermes session produced a replay-validated synthetic-Inbox measurement with findings.

Not supported

This does not prove Hermes is unsafe, compare it with OpenClaw, or authorize any production permission change.