CompletionKit is answering right now. Last checked 5 min ago. It exposes 54 tools. Last commit 16 Sep 2026.
Prompt evals over MCP: run a prompt on your dataset, score each output 1-5 with an LLM judge.
Every tool that appeared, vanished or quietly changed what it asks for. Recorded since 12 August 2026. No other catalogue keeps this.
We read the source, 22 h ago · tools taken from the live server · rules 3dff92dd89df
What this server is able to do. For an MCP server this is often the job itself — a terminal server runs commands because that is what it is for. Listed so you know what you are plugging in, not as an accusation.
kept = sort_by_score(scored.select { |id| in_range?(averages[id]) }, averages)
filtering? ? kept : kept + unscored
Is this your server and something here is wrong? Tell us — corrections are free and do not require a plan.
We found places where it runs commands, builds paths or queries from values it is given. None of that is a flaw by itself — it becomes one when the code changes, and code changes quietly between releases. We re-read it on every one.
Endpoint below is the one we actually reach during checks — not the one copied from a README. Last verified 5 min ago.
claude mcp add evals --transport http https://completionkit.com/mcp
{
"mcpServers": {
"evals": {
"url": "https://completionkit.com/mcp"
}
}
}
[mcp_servers.evals]
url = "https://completionkit.com/mcp"
{
"mcpServers": {
"evals": {
"url": "https://completionkit.com/mcp"
}
}
}
{
"mcpServers": {
"evals": {
"url": "https://completionkit.com/mcp"
}
}
}
Read directly from the server with tools/list, grouped by what they act on.
If a tool disappears, we record the date.
runs_create
runs_delete
runs_generate
runs_get
runs_list
runs_regrade
runs_rerun
runs_retry_failures
runs_update
metric_groups_create
metric_groups_delete
metric_groups_get
metric_groups_list
metric_groups_update
metric_versions_dismiss
metric_versions_list
metric_versions_publish
prompts_create
prompts_delete
prompts_get
prompts_list
prompts_publish
prompts_suggest_improvement
prompts_update
datasets_create
datasets_create_from_url
datasets_delete
datasets_get
datasets_list
datasets_update
metrics_create
metrics_delete
metrics_get
metrics_list
metrics_suggest_variants
metrics_update
provider_credentials_create
provider_credentials_delete
provider_credentials_get
provider_credentials_list
provider_credentials_update
tags_create
tags_delete
tags_get
tags_list
tags_update
agreements_create
agreements_list
judges_compare
judges_replay
responses_get
responses_list
promptfoo_import
usage_get
| URL | Transport | State | Latency | Checked |
|---|---|---|---|---|
| https://completionkit.com/mcp | streamable-http | answering | 387 ms | 5 min ago |
Call your local Ollama or vLLM model over MCP with schema-validated JSON output
The prediction MCP — score your prompt before you generate, so you never waste a credit.
Block prompt injection, evasive spacing, and obscene content before it reaches your LLM.
Score your specs before feeding them to an LLM. MCP server with radar chart visualization.
Give your AI a research team. Forecast, score, classify, or research every row of a dataset.
Lint, curate & prepare computer-vision datasets from your AI assistant — MCP server, 67 tools
LLM evals as MCP tools: score outputs for faithfulness, relevancy, and hallucination.
Scan, enumerate, and risk-score every MCP server configured on your machine.
Answers built from our own checks of this server.