Skip to main content

Browse the directory

Showing 2 resources for "swe-bench"
Saved
Active

Rollout signal scan

2 rollout risk signals in current results

Biggest gaps: metadata review, package integrity. 0 entries have 2+ required gaps.

2 scanned

Install payload

Install payload is mixed and needs spot-checking.

watch

50% (1/2)

Adoption queue

Browse adoption queue · balanced

1/2 visible results are in hold tier and need mitigation before adoption.

ready 0caution 1hold 1
caution

50/100

Request metadata review from maintainers or internal owners.

Collect package checksum or signed artifact information.

guides/repeatable-ai-coding-tool-benchmarks · trust review · confidence 67%

mini-SWE-agent

2 blockers: Metadata review, Install payload

hold

36/100

Request metadata review from maintainers or internal owners.

Add install/config payload for reproducible team rollout.

Collect package checksum or signed artifact information.

tools/mini-swe-agent · trust review · confidence 50%

Decision confidence

Decision confidence scan · balanced

1/2 results are low-confidence and need review before adoption.

high 0medium 1low 1

mini-SWE-agent

Hold adoption until Metadata review, Package integrity are resolved.

low

36/100

Missing: Metadata reviewMissing: Package integrityMissing: Install payload

tools/mini-swe-agent · trust review

Freshness distribution

Current results are broadly fresh

Median age 48 days; all 2 scanned entries are within 90 days.

median 48d

Aging

91–180 days

0%

0 entries

Stale

> 180 days

0%

0 entries

A practical guide for comparing AI coding tools with repeatable benchmarks, fixed task sets, controlled environments, transparent scoring, and privacy-safe artifacts.

mini-SWE-agent logo
mini-SWE-agentby SWE-agent · submitted by oktofeesh1

MIT-licensed command-line software-engineering agent for local coding tasks, GitHub issue fixing, trajectory inspection, and SWE-bench style evaluation.