Benchmarks
Published DeepORG Runs
The public archive of shareable DeepORG reports, built and published by GraphJin.
Each page is generated from the same shareable projection as its local eval report. It contains aggregate metrics and public task identifiers, never the prompts, answers, rows, queries, credentials, or private trajectory paths.
No run page is written automatically by an eval. A human publishes it with
graphjin eval publish <run-id> --benchmark deeporg, reviews the
two generated files, and commits them.
Gemini 3.5 Flash-Lite benchmark run
Verified report from DeepORG — The Organizational Agent Benchmark for Gemini 3.5 Flash-Lite.
OpenAI GPT-5.4 mini benchmark run
Verified report from DeepORG — The Organizational Agent Benchmark for OpenAI GPT-5.4 mini.
Gemini 3.5 Flash-Lite benchmark run
Verified report from DeepORG — The Organizational Agent Benchmark for Gemini 3.5 Flash-Lite.
OpenAI GPT-5.4 mini benchmark run
Verified report from DeepORG — The Organizational Agent Benchmark for OpenAI GPT-5.4 mini.
OpenAI GPT-5.4 mini benchmark run
Verified DeepORG report for OpenAI GPT-5.4 mini.
OpenAI GPT-4o mini benchmark run
Verified DeepORG report for OpenAI GPT-4o mini.
Gemini 3.5 Flash-Lite benchmark run
Verified DeepORG report for Gemini 3.5 Flash-Lite.
Gemini 3.5 Flash-Lite benchmark run
Verified DeepORG report for Gemini 3.5 Flash-Lite.