Skip to main content

Browse the directory

Showing 14 resources for "evals"
Saved
Active

1 trusted · 11 review · 2 limited in this set — compare to see which signals differ.

Trust snapshot

14 results in this view

Claimed
0%(0/14)

3 trust signals differ in this sample: Package trust, Source provenance, Submitter

Signals differ on Package trust, Source provenance, Submitter — add entries to compare before you install.

Rollout signal scan

2 rollout risk signals in current results

Biggest gaps: metadata review, package integrity. 0 entries have 2+ required gaps.

12 scanned

Install payload

Install payload is broadly covered in current results.

good

83% (10/12)

Adoption queue

Browse adoption queue · balanced

5/14 visible results are in hold tier and need mitigation before adoption.

ready 0caution 9hold 5

Agent Evals Regression Gate Skill

1 blockers: Metadata review

caution

70/100

Request metadata review from maintainers or internal owners.

skills/agent-evals-regression-gate · trust trusted · confidence 83%

Arize Phoenix MCP Server for Claude

1 blockers: Metadata review

caution

50/100

Request metadata review from maintainers or internal owners.

Collect package checksum or signed artifact information.

mcp/arize-phoenix-mcp-server · trust review · confidence 67%

Inspect AI Benchmark Rubric Agent

1 blockers: Metadata review

caution

50/100

Request metadata review from maintainers or internal owners.

Collect package checksum or signed artifact information.

agents/inspect-ai-benchmark-rubric-agent · trust review · confidence 67%

Langfuse Docs MCP Server for Claude

1 blockers: Metadata review

caution

50/100

Request metadata review from maintainers or internal owners.

Collect package checksum or signed artifact information.

mcp/langfuse-docs-mcp-server · trust review · confidence 67%

Open Source Evals Prompt Testing

1 blockers: Metadata review

caution

50/100

Request metadata review from maintainers or internal owners.

Collect package checksum or signed artifact information.

collections/open-source-evals-prompt-testing · trust review · confidence 67%

OpenAI Evals

1 blockers: Metadata review

caution

50/100

Request metadata review from maintainers or internal owners.

Collect package checksum or signed artifact information.

tools/openai-evals · trust review · confidence 67%

Opik MCP Server for Claude

1 blockers: Metadata review

caution

50/100

Request metadata review from maintainers or internal owners.

Collect package checksum or signed artifact information.

mcp/opik-mcp-server · trust review · confidence 67%

Decision confidence

Decision confidence scan · balanced

3/14 results are low-confidence and need review before adoption.

high 1medium 10low 3

Arize Phoenix MCP Server for Claude

Address Metadata review, Package integrity before broader rollout.

medium

54/100

Missing: Metadata reviewMissing: Package integrity

mcp/arize-phoenix-mcp-server · trust review

Inspect AI Benchmark Rubric Agent

Address Metadata review, Package integrity before broader rollout.

medium

54/100

Missing: Metadata reviewMissing: Package integrity

agents/inspect-ai-benchmark-rubric-agent · trust review

Langfuse Docs MCP Server for Claude

Address Metadata review, Package integrity before broader rollout.

medium

54/100

Missing: Metadata reviewMissing: Package integrity

mcp/langfuse-docs-mcp-server · trust review

Open Source Evals Prompt Testing

Address Metadata review, Package integrity before broader rollout.

medium

54/100

Missing: Metadata reviewMissing: Package integrity

collections/open-source-evals-prompt-testing · trust review

OpenAI Evals

Address Metadata review, Package integrity before broader rollout.

medium

54/100

Missing: Metadata reviewMissing: Package integrity

tools/openai-evals · trust review

Opik MCP Server for Claude

Address Metadata review, Package integrity before broader rollout.

medium

54/100

Missing: Metadata reviewMissing: Package integrity

mcp/opik-mcp-server · trust review

Freshness distribution

Mostly fresh with a few aging entries

Median age 48 days; 11 fresh, 1 aging or stale of 12 scanned.

median 48d

Aging

91–180 days

8%

1 entry

Stale

> 180 days

0%

0 entries

Theme distribution

Results center on evals

71% of this view shares the top theme. Leading themes: evals, tracing, evaluation.

Focused

48 distinct themes across 14 scanned

Build repeatable eval suites that catch quality regressions in AI agent behavior before merge or release.

Level:advancedType:generalVerified:draft
Safety ✓ Privacy ✓
Laminar logo
Laminarby lmnr-ai · submitted by davion-knight

Open-source observability platform purpose-built for AI agents, with OpenTelemetry-native tracing, plain-English signals, an evals SDK and CLI, SQL dashboards, dataset annotation, and MCP/CLI access, self-hostable with Apache-2.0 SDKs for Python and TypeScript.

Debug, evaluate, and monitor LLM applications from Claude — read traces and spans, score outputs, save prompts, run evaluation experiments, and query project metrics — with the official Opik MCP server by Comet.

VoltAgent logo

Open-source TypeScript agent engineering framework and platform for building AI agents with tools, memory, workflows, RAG, guardrails, evals, MCP, voice, and VoltOps observability.

OpenAI Evalsby OpenAI · submitted by JSONbored

Open-source framework from OpenAI for evaluating LLM and agent behavior with reusable eval definitions, grading logic, datasets, and regression workflows.

Pydantic AI logo
Pydantic AIby Pydantic · submitted by oktofeesh1

Python agent framework from the Pydantic team for type-safe GenAI apps, tools, structured outputs, MCP, evals, and durable workflows.

OpenAI logo

Source-backed guide for converting OpenAI Agents SDK traces into regression eval cases, trace grades, tool-call assertions, and release checks for agentic workflows.

A source-backed collection for building repeatable LLM eval and prompt testing workflows with open-source tools: prompt regression tests, RAG and agent metrics, human review datasets, traces, prompt optimization, and release gates.

Inspect LLM traces and spans, manage prompts, explore datasets, and review evaluation experiments from Claude — with the official Arize Phoenix MCP server, built into the open-source Phoenix AI observability platform.

Langfuse logo

Connect Claude Code, Cursor, Copilot, Windsurf, and other MCP clients to the public Langfuse documentation MCP server for tracing, prompt management, evaluation, and agent observability implementation help.

Slash command runbook for designing and running prompt evaluations: define tasks, success criteria, golden outputs, regression checks, and privacy-safe reporting using Anthropic test-and-evaluate guidance.

Invocation:/prompt-eval-runbook <feature-or-prompt-name>
Safety ✓ Privacy ✓

A practical guide for comparing AI coding tools with repeatable benchmarks, fixed task sets, controlled environments, transparent scoring, and privacy-safe artifacts.

Ragas logo
Ragasby Vibrant Labs · submitted by oktofeesh1

Open-source evaluation framework for testing RAG systems, prompts, agents, workflows, and other LLM application behavior.

Source-backed agent for designing Inspect AI benchmark tasks, datasets, solver plans, scorer rubrics, model matrices, eval logs, and release-quality prompt evaluation decisions.