{
  "$schema": "/schemas/skill-manifest-v1.schema.json",
  "schemaVersion": 1,
  "name": "eval-driven-dev",
  "description": "Improve AI application with evaluation-driven development. Define eval criteria, instrument the application, build golden datasets, observe and evaluate application runs, analyze results, and produce a concrete action plan for improvements. ALWAYS USE THIS SKILL when the user asks to set up QA, add tests, add evals, evaluate, benchmark, fix wrong behaviors, improve quality, or do quality assurance for any Python project that calls an LLM model.",
  "license": "MIT",
  "compatibility": null,
  "metadata": {
    "version": "0.8.4",
    "compatibility": "Python 3.10+",
    "pixie-qa-version": ">=0.8.4,<0.9.0",
    "pixie-qa-source": "https://github.com/yiouli/pixie-qa/"
  },
  "revision": "291d5ac93ab061b43ab20c57c0335f7b39bcccdd",
  "generatedAt": "2026-07-26T23:35:15.967Z",
  "source": {
    "repository": "https://github.com/mleem97/mm-skills",
    "path": "eval-driven-dev",
    "ref": "291d5ac93ab061b43ab20c57c0335f7b39bcccdd"
  },
  "manifestUrl": "/registry/v1/skills/eval-driven-dev.json",
  "pageUrl": "/skills/eval-driven-dev",
  "fileCount": 21,
  "totalBytes": 171153,
  "clients": {
    "agents": {
      "label": "Shared Agent Skills",
      "user": "~/.agents/skills",
      "project": ".agents/skills"
    },
    "codex": {
      "label": "Codex",
      "user": "~/.agents/skills",
      "project": ".agents/skills"
    },
    "opencode": {
      "label": "OpenCode",
      "user": "~/.config/opencode/skills",
      "project": ".opencode/skills"
    },
    "antigravity": {
      "label": "Antigravity",
      "user": "~/.gemini/config/skills",
      "project": ".agents/skills"
    }
  },
  "files": [
    {
      "path": "LICENSE.txt",
      "size": 1059,
      "sha256": "e32449d23085399adc1222f7a17408b730550258e51627c153cb108ca9955823",
      "url": "/raw/eval-driven-dev/LICENSE.txt"
    },
    {
      "path": "references/1-a-project-analysis.md",
      "size": 5883,
      "sha256": "ae4ca94629f12e148f576d0dd5346f53d28c413b59a101c04a7346743ca4f32a",
      "url": "/raw/eval-driven-dev/references/1-a-project-analysis.md"
    },
    {
      "path": "references/1-b-entry-point.md",
      "size": 2348,
      "sha256": "1ca870ff6b8c95ee63bc03f476c4e3867d8830ed3427d1c0d2c092ad3e6b7837",
      "url": "/raw/eval-driven-dev/references/1-b-entry-point.md"
    },
    {
      "path": "references/1-c-eval-criteria.md",
      "size": 7700,
      "sha256": "d6fd399ad610f7dd993d078d2065bc9700f73eb1e46f4d4c29d1a1be95d227cc",
      "url": "/raw/eval-driven-dev/references/1-c-eval-criteria.md"
    },
    {
      "path": "references/2a-instrumentation.md",
      "size": 7447,
      "sha256": "3a3e03d6ae22ce849efbd62b8f5225a4e096092db5392e6eac423c0249c99576",
      "url": "/raw/eval-driven-dev/references/2a-instrumentation.md"
    },
    {
      "path": "references/2b-implement-runnable.md",
      "size": 7535,
      "sha256": "885df118e7aa6a12ceacd748ff686c0eb08d3170f68b138d82a855ea8303541e",
      "url": "/raw/eval-driven-dev/references/2b-implement-runnable.md"
    },
    {
      "path": "references/2c-capture-and-verify-trace.md",
      "size": 5815,
      "sha256": "8ea63dce59fdbd454b9bb8b4456f7d02ab5b635d94ce3457477b43f12f4cc537",
      "url": "/raw/eval-driven-dev/references/2c-capture-and-verify-trace.md"
    },
    {
      "path": "references/3-define-evaluators.md",
      "size": 10571,
      "sha256": "97d04840adb1015bb61a762f8854f41615eab193768b616830b69c83a2d27157",
      "url": "/raw/eval-driven-dev/references/3-define-evaluators.md"
    },
    {
      "path": "references/4-build-dataset.md",
      "size": 22080,
      "sha256": "97307710d6122650ce51340aae01ec5ccedc75f74b4aeb85a9f6b7a99430e07f",
      "url": "/raw/eval-driven-dev/references/4-build-dataset.md"
    },
    {
      "path": "references/5-run-tests.md",
      "size": 6105,
      "sha256": "ee23d3c3e51a20331e92e0c72b3a0dbee8f8e16b23394ce1780fde41c39462f0",
      "url": "/raw/eval-driven-dev/references/5-run-tests.md"
    },
    {
      "path": "references/6-analyze-outcomes.md",
      "size": 16606,
      "sha256": "c7bd8f28c2dba162e33266ce84d09bbafa37e43c6d393da554c6e47ed2a94ac2",
      "url": "/raw/eval-driven-dev/references/6-analyze-outcomes.md"
    },
    {
      "path": "references/evaluators.md",
      "size": 17977,
      "sha256": "0f4b9792fbc069ffc3dc27b513f1c671570eaac84ba42373b71caccb9e8e6b37",
      "url": "/raw/eval-driven-dev/references/evaluators.md"
    },
    {
      "path": "references/runnable-examples/cli-app.md",
      "size": 2022,
      "sha256": "946cb0dbcef4da49a12c9c571ce4be678372c8e7b665966f0605c3bc2967ccb6",
      "url": "/raw/eval-driven-dev/references/runnable-examples/cli-app.md"
    },
    {
      "path": "references/runnable-examples/fastapi-web-server.md",
      "size": 4149,
      "sha256": "31114e24828244b8a14c5e9d2a3aed2775b465226dcaf5f652b474faf265a836",
      "url": "/raw/eval-driven-dev/references/runnable-examples/fastapi-web-server.md"
    },
    {
      "path": "references/runnable-examples/standalone-function.md",
      "size": 1811,
      "sha256": "d8726623e0471c7cab0fde622bb02fe9a327b751839ea537019fdb8f83b8aaa3",
      "url": "/raw/eval-driven-dev/references/runnable-examples/standalone-function.md"
    },
    {
      "path": "references/testing-api.md",
      "size": 16684,
      "sha256": "8ff719243f80adbec76208fdf8567e37e210c4e41980a50275970a97e2b39368",
      "url": "/raw/eval-driven-dev/references/testing-api.md"
    },
    {
      "path": "references/wrap-api.md",
      "size": 8984,
      "sha256": "57af731780a7790e4954f224e49d092d49f6a14bcdf6e72914f9186fc33a8450",
      "url": "/raw/eval-driven-dev/references/wrap-api.md"
    },
    {
      "path": "resources/setup.sh",
      "size": 3169,
      "sha256": "3917afb5af193abfc1591b6685beed935267468e533dcc7546f3dc6160735705",
      "url": "/raw/eval-driven-dev/resources/setup.sh"
    },
    {
      "path": "resources/verify_step6_completion.py",
      "size": 4525,
      "sha256": "8048ae2e7f7005c50091b1434f45af2d2e0f9cea4c71630ca87b27a2ef076910",
      "url": "/raw/eval-driven-dev/resources/verify_step6_completion.py"
    },
    {
      "path": "SKILL.md",
      "size": 18016,
      "sha256": "e8418e08b54407e279ee5348e450badee5441a541fbffbc2a7a6a894237305f1",
      "url": "/raw/eval-driven-dev/SKILL.md"
    },
    {
      "path": "SOURCE.md",
      "size": 667,
      "sha256": "ae0f377ed64519878658f6f2cb9214e2664b156658452337b2b63a349bf482e3",
      "url": "/raw/eval-driven-dev/SOURCE.md"
    }
  ]
}
