Skip to main content

Browse the directory

Showing 8 resources for "evals"
Saved
Active

Source-backed filter active — add entries to compare trust side by side.

Trust snapshot

8 results in this view

Claimed
0%(0/8)

1 trust signal differs in this sample: Submitter

Signals differ on Submitter — add entries to compare before you install.

Rollout signal scan

2 rollout risk signals in current results

Biggest gaps: metadata review, package integrity. 0 entries have 2+ required gaps.

8 scanned

Install payload

Install payload is mixed and needs spot-checking.

watch

63% (5/8)

Adoption queue

Browse adoption queue · balanced

3/8 visible results are in hold tier and need mitigation before adoption.

ready 0caution 5hold 3

Arize Phoenix MCP Server for Claude

1 blockers: Metadata review

caution

50/100

Request metadata review from maintainers or internal owners.

Collect package checksum or signed artifact information.

mcp/arize-phoenix-mcp-server · trust review · confidence 67%

Inspect AI Benchmark Rubric Agent

1 blockers: Metadata review

caution

50/100

Request metadata review from maintainers or internal owners.

Collect package checksum or signed artifact information.

agents/inspect-ai-benchmark-rubric-agent · trust review · confidence 67%

OpenAI Evals

1 blockers: Metadata review

caution

50/100

Request metadata review from maintainers or internal owners.

Collect package checksum or signed artifact information.

tools/openai-evals · trust review · confidence 67%

Opik MCP Server for Claude

1 blockers: Metadata review

caution

50/100

Request metadata review from maintainers or internal owners.

Collect package checksum or signed artifact information.

mcp/opik-mcp-server · trust review · confidence 67%

VoltAgent

1 blockers: Metadata review

caution

50/100

Request metadata review from maintainers or internal owners.

Collect package checksum or signed artifact information.

tools/voltagent · trust review · confidence 67%

Laminar

2 blockers: Metadata review, Install payload

hold

36/100

Request metadata review from maintainers or internal owners.

Add install/config payload for reproducible team rollout.

Collect package checksum or signed artifact information.

tools/laminar · trust review · confidence 50%

Pydantic AI

2 blockers: Metadata review, Install payload

hold

36/100

Request metadata review from maintainers or internal owners.

Add install/config payload for reproducible team rollout.

Collect package checksum or signed artifact information.

tools/pydantic-ai · trust review · confidence 50%

Ragas

2 blockers: Metadata review, Install payload

hold

36/100

Request metadata review from maintainers or internal owners.

Add install/config payload for reproducible team rollout.

Collect package checksum or signed artifact information.

tools/ragas · trust review · confidence 50%

Decision confidence

Decision confidence scan · balanced

3/8 results are low-confidence and need review before adoption.

high 0medium 5low 3

Arize Phoenix MCP Server for Claude

Address Metadata review, Package integrity before broader rollout.

medium

54/100

Missing: Metadata reviewMissing: Package integrity

mcp/arize-phoenix-mcp-server · trust review

Inspect AI Benchmark Rubric Agent

Address Metadata review, Package integrity before broader rollout.

medium

54/100

Missing: Metadata reviewMissing: Package integrity

agents/inspect-ai-benchmark-rubric-agent · trust review

OpenAI Evals

Address Metadata review, Package integrity before broader rollout.

medium

54/100

Missing: Metadata reviewMissing: Package integrity

tools/openai-evals · trust review

Opik MCP Server for Claude

Address Metadata review, Package integrity before broader rollout.

medium

54/100

Missing: Metadata reviewMissing: Package integrity

mcp/opik-mcp-server · trust review

VoltAgent

Address Metadata review, Package integrity before broader rollout.

medium

54/100

Missing: Metadata reviewMissing: Package integrity

tools/voltagent · trust review

Laminar

Hold adoption until Metadata review, Package integrity are resolved.

low

36/100

Missing: Metadata reviewMissing: Package integrityMissing: Install payload

tools/laminar · trust review

Pydantic AI

Hold adoption until Metadata review, Package integrity are resolved.

low

36/100

Missing: Metadata reviewMissing: Package integrityMissing: Install payload

tools/pydantic-ai · trust review

Ragas

Hold adoption until Metadata review, Package integrity are resolved.

low

36/100

Missing: Metadata reviewMissing: Package integrityMissing: Install payload

tools/ragas · trust review

Freshness distribution

Current results are broadly fresh

Median age 47 days; all 8 scanned entries are within 90 days.

median 47d

Aging

91–180 days

0%

0 entries

Stale

> 180 days

0%

0 entries

Theme distribution

Results center on evals

50% of this view shares the top theme. Leading themes: evals, evaluation, tracing.

Focused

32 distinct themes across 8 scanned

Laminar logo
Laminarby lmnr-ai · submitted by davion-knight

Open-source observability platform purpose-built for AI agents, with OpenTelemetry-native tracing, plain-English signals, an evals SDK and CLI, SQL dashboards, dataset annotation, and MCP/CLI access, self-hostable with Apache-2.0 SDKs for Python and TypeScript.

Debug, evaluate, and monitor LLM applications from Claude — read traces and spans, score outputs, save prompts, run evaluation experiments, and query project metrics — with the official Opik MCP server by Comet.

VoltAgent logo

Open-source TypeScript agent engineering framework and platform for building AI agents with tools, memory, workflows, RAG, guardrails, evals, MCP, voice, and VoltOps observability.

OpenAI Evalsby OpenAI · submitted by JSONbored

Open-source framework from OpenAI for evaluating LLM and agent behavior with reusable eval definitions, grading logic, datasets, and regression workflows.

Pydantic AI logo
Pydantic AIby Pydantic · submitted by oktofeesh1

Python agent framework from the Pydantic team for type-safe GenAI apps, tools, structured outputs, MCP, evals, and durable workflows.

Inspect LLM traces and spans, manage prompts, explore datasets, and review evaluation experiments from Claude — with the official Arize Phoenix MCP server, built into the open-source Phoenix AI observability platform.

Ragas logo
Ragasby Vibrant Labs · submitted by oktofeesh1

Open-source evaluation framework for testing RAG systems, prompts, agents, workflows, and other LLM application behavior.

Source-backed agent for designing Inspect AI benchmark tasks, datasets, solver plans, scorer rubrics, model matrices, eval logs, and release-quality prompt evaluation decisions.