Skip to main content

Browse the directory

Showing 2 resources for "calibration"
Saved
Active

Rollout signal scan

2 rollout risk signals in current results

Biggest gaps: metadata review, package integrity. 0 entries have 2+ required gaps.

2 scanned

Install payload

Install payload is broadly covered in current results.

good

100% (2/2)

Adoption queue

Browse adoption queue · balanced

0/2 visible results are ready for staged adoption under this preset.

ready 0caution 2hold 0

Inspect AI Benchmark Rubric Agent

1 blockers: Metadata review

caution

50/100

Request metadata review from maintainers or internal owners.

Collect package checksum or signed artifact information.

agents/inspect-ai-benchmark-rubric-agent · trust review · confidence 67%

Phronesis

1 blockers: Metadata review

caution

50/100

Request metadata review from maintainers or internal owners.

Collect package checksum or signed artifact information.

mcp/phronesis-hermes · trust review · confidence 67%

Decision confidence

Decision confidence scan · balanced

0/2 results are high-confidence for the selected preset.

high 0medium 2low 0

Inspect AI Benchmark Rubric Agent

Address Metadata review, Package integrity before broader rollout.

medium

54/100

Missing: Metadata reviewMissing: Package integrity

agents/inspect-ai-benchmark-rubric-agent · trust review

Phronesis

Address Metadata review, Package integrity before broader rollout.

medium

54/100

Missing: Metadata reviewMissing: Package integrity

mcp/phronesis-hermes · trust review

Freshness distribution

Current results are broadly fresh

Median age 46 days; all 2 scanned entries are within 90 days.

median 46d

Aging

91–180 days

0%

0 entries

Stale

> 180 days

0%

0 entries

Source-backed agent for designing Inspect AI benchmark tasks, datasets, solver plans, scorer rubrics, model matrices, eval logs, and release-quality prompt evaluation decisions.

Phronesisby Sustainable Finance Partners, LLC · submitted by phronesis-cc-bot

Decision-assurance layer for AI agents: returns calibrated Decision Assets and an auditable action boundary (approve / review / block / seek-evidence) plus a verifiable Decision Receipt before high-stakes actions. Advisory only — never transacts or modifies identity. MCP tools: health_check and bench_query.