Google tells you what exists. Faceabot tells you what holds up.
A standardized testing harness for MCP servers and agent workflows
Package npm :mcp-eval-runner · website · measurements and detailsEvaluate one public URL for WebMCP readiness: intent, tools observed, recommended, do-not-expose.
MCP endpoint :https://mcp.webmcp-eval.com/mcp · website · measurements and detailsEvaluate a+b style arithmetic. Expression discarded.
MCP endpoint :https://agent-observatory-sensor.nolimit-observatory.workers.dev/s/calc-eval/mcp · website · measurements and detailsRun up to 25 Apify Actors in order in one call, passing each step's dataset to the next.
MCP endpoint :https://mcp.apify.com/?tools=nerolabs/actor-pipeline-runner · website · measurements and detailsRegression checks for Japanese order automations: six free cases, strict JSON scoring and CI gates.
MCP endpoint :https://shigoto-dogu.netlify.app/mcp/order-eval · website · measurements and detailsPay-per-call AI evaluation MCP server. Score LLM outputs against benchmark rubrics via Workers AI.
MCP endpoint :https://eval.zuluworksai.com/mcp · website · measurements and detailsLocal test execution and coverage summaries for onboarding agents.
Package pypi :lovranran-mcp-test-runner · website · measurements and detailsSelf-hosted MCP for controlled AI development and staging without a general-purpose remote shell.
Package pypi :aifordable-runner-mcp · website · measurements and detailsCloudflare Workers MCP server: ai-eval
MCP endpoint :https://api.lazy-mac.com/ai-eval/mcp · website · measurements and detailsFastAPI-native Model Context Protocol framework and stdio runner.
Package pypi :mcp-fastapi · website · measurements and detailsRights-aware censorship, China-economic status, and tamper-evident AI evaluation tools.
MCP endpoint :https://api.seiche.info/palimpsest/mcp · website · measurements and detailsStockfish chess eval: best move, score, principal variation, multipv. $0.005/call via x402.
MCP endpoint :https://chess-eval.x402supply.com/mcp · website · measurements and detailsPrompt evals over MCP: run a prompt on your dataset, score each output 1-5 with an LLM judge.
MCP endpoint :https://completionkit.com/mcp · website · measurements and detailsCode Runner MCP Server which can run code in various programming languages.
Package npm :mcp-server-code-runner · website · measurements and detailsJSON-driven E2E test runner with parallel Chrome pool execution and 16 MCP tools.
Package npm :@matware/e2e-runner · website · measurements and detailsRemote MCP for Gemini upgrade evals, prompt regressions, output diffs, and eval receipts.
MCP endpoint :https://geminiupgradeqa.clauxel.com/mcp · website · measurements and detailsAuthor verifiable eval records through a draft→review→revise→submit loop with enforced graders.
Package npm :@cyanheads/evals-mcp-server · website · measurements and detailsRevit model query + APS Design Automation runner.
MCP endpoint :https://mcp.scanbimlabs.io/revit · website · measurements and detailsWraps the slop-eval CLI as a single generic MCP tool for genericness scoring of AI UI output.
Package pypi :slop-eval-cli · website · measurements and detailsWindows-only headless LLM task automation engine with scheduling via Windows Task Scheduler.
Package nuget :FieldCure.AssistStudio.Runner · website · measurements and detailsAI agents: all of this is available without keys over MCP https://faceabot.com/api/mcp · HTTP https://faceabot.com/api/catalog?q=… · Guide : llms.txt
Pulse: what is changing in agent commerce · Is your store ready for AI shopping agents? · State of MCP (weekly) · MCP server doctor · Open reliability data · Add Faceabot to your AI · Help · Privacy · Terms