CompletionKit is answering right now. Last checked 11 min ago. It exposes 54 tools. Last commit 4 Aug 2026.
Prompt evals over MCP: run a prompt on your dataset, score each output 1-5 with an LLM judge.
Endpoint below is the one we actually reach during checks — not the one copied from a README. Last verified 11 min ago.
claude mcp add evals --transport http https://completionkit.com/mcp
{
"mcpServers": {
"evals": {
"url": "https://completionkit.com/mcp"
}
}
}
[mcp_servers.evals]
url = "https://completionkit.com/mcp"
{
"mcpServers": {
"evals": {
"url": "https://completionkit.com/mcp"
}
}
}
{
"mcpServers": {
"evals": {
"url": "https://completionkit.com/mcp"
}
}
}
Read directly from the server with tools/list, grouped by what they act on.
If a tool disappears, we record the date.
runs_create
runs_delete
runs_generate
runs_get
runs_list
runs_regrade
runs_rerun
runs_retry_failures
runs_update
metric_groups_create
metric_groups_delete
metric_groups_get
metric_groups_list
metric_groups_update
metric_versions_dismiss
metric_versions_list
metric_versions_publish
prompts_create
prompts_delete
prompts_get
prompts_list
prompts_publish
prompts_suggest_improvement
prompts_update
datasets_create
datasets_create_from_url
datasets_delete
datasets_get
datasets_list
datasets_update
metrics_create
metrics_delete
metrics_get
metrics_list
metrics_suggest_variants
metrics_update
provider_credentials_create
provider_credentials_delete
provider_credentials_get
provider_credentials_list
provider_credentials_update
tags_create
tags_delete
tags_get
tags_list
tags_update
agreements_create
agreements_list
judges_compare
judges_replay
responses_get
responses_list
promptfoo_import
usage_get
| URL | Transport | State | Latency | Checked |
|---|---|---|---|---|
| https://completionkit.com/mcp | streamable-http | answering | 396 ms | 11 min ago |
Answers built from our own checks of this server.