{"as_of":"2026-08-22T12:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f5911c2b7dfb25d38db82f8de03816ac459a764ba70e07aac7acdf035e22755e","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T04:28:31.474196Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13705/citation-record","integrity":"/paper/2607.13705/integrity","json":"/paper/2607.13705/citation-record.json","paper":"/paper/2607.13705"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:26.157020Z","title":"Claude Opus 4.8.https://www.anthropic.com/news/claude-opus-4-8, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:26.157020Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:7b34e9e03c0a3d1966a8f7df8311e115f8adc00a795009b93b95ce2ec2013272","observation_id":"4a112a73-3bc9-4612-951c-4ead398886c6","resolution":{"observed_at":"2026-08-02T04:28:26.157020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-08-14T06:34:01.114459Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-02T04:28:26.267570Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:26.267570Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:e729e921af0fd5124317baf4fc4f6665a630df2d697bb35e511e08a665bb4160","observation_id":"197f83e3-e884-4221-a905-adeffc39534b","resolution":{"observed_at":"2026-08-02T04:28:26.267570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:26.341590Z","title":"Aider: Ai pair programming in your terminal.https://github.com/paul-gauthier/ aider, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:26.341590Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:9dd88d3dc2191a83fe83ec36ff54845c06ce52f773581b4a6d5af80baad3472f","observation_id":"5e756433-4acc-4421-a16a-e033447bb6a5","resolution":{"observed_at":"2026-08-02T04:28:26.341590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:26.414940Z","title":"Deepeval: The open-source evaluation framework for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:26.414940Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:70f13a728cdd8e154e9de25da8db26955ec0fb26173444fc57b988b57d2ff264","observation_id":"1c0267d8-ec3e-49d9-bd85-4bbe61cacb1b","resolution":{"observed_at":"2026-08-02T04:28:26.414940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:26.533532Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:26.533532Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:a3c5030a2be56dc10a2ad7b70438739573d8c16e0ba4d722db7b177f11c0ad8b","observation_id":"db8cf8cc-22ef-4809-918a-9c251ef70962","resolution":{"observed_at":"2026-08-02T04:28:26.533532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-08-02T04:28:26.606904Z","title":"Swe-bench pro: Can ai agents solve long-horizon software engineering tasks?arXiv preprint arXiv:2509.16941, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:26.606904Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:0708110295654348166542fd07a14aab89ee3ef27cd7080a46d0851265845af7","observation_id":"8cb58207-0634-4b68-810d-6d1f5a17cd6b","resolution":{"observed_at":"2026-08-02T04:28:26.606904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:26.727577Z","title":"Benchmarking reward hack detection in code environments via contrastive analysis, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:26.727577Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:1f6780db49a4d1b272df9634a19f09c0dc9b40f24a8c5d626cac499dc296dc91","observation_id":"b0621a85-e7c8-4429-bb8b-4a912848320e","resolution":{"observed_at":"2026-08-02T04:28:26.727577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:26.849276Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:26.849276Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:08d3373dd6abb63a9d1272a12bdc4c3b38ade64ea66f098d035be0131c694887","observation_id":"47f28693-c565-41e0-b0f6-20393d4d0686","resolution":{"observed_at":"2026-08-02T04:28:26.849276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:26.907095Z","title":"Glm-5: from vibe coding to agentic engineering, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:26.907095Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:fe5a5c76626eb91e1c4054f3d92518cf58096ee83f4a3c9302d93f71f408392d","observation_id":"7fc53bdf-3f4c-49eb-aef5-d0090c36e8c4","resolution":{"observed_at":"2026-08-02T04:28:26.907095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:26.985290Z","title":"Gemini 3.1 Pro.https://deepmind.google/models/gemini/pro/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:26.985290Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:a5b3baf2f2dc0b9ef439ebc55ea406f58e6dc53d1a5e67d076f7f664cd44564a","observation_id":"cfd8b8f3-f1e3-4fb0-9ecf-4919009c8635","resolution":{"observed_at":"2026-08-02T04:28:26.985290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:27.068755Z","title":"Deepsearchqa: Bridging the comprehensiveness gap for deep research agents.arXiv preprint arXiv:2601.20975, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:27.068755Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:823ea36732e2bf83346c2375ffd57f950474f8b98ca8a513aa757300a7f60f92","observation_id":"9253900d-2b6c-4451-b062-8554366a7783","resolution":{"observed_at":"2026-08-02T04:28:27.068755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:27.178873Z","title":"Harbor: A framework for evaluating and optimizing agents and models in container environments.https://github.com/harbor-framework/harbor, January 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:27.178873Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:4df53e2924704e16c0a2990d99cea473d0e433944b26f76cf3528338fdd71651","observation_id":"7ede13a8-3b84-471b-b69b-284509b152dd","resolution":{"observed_at":"2026-08-02T04:28:27.178873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07946","last_updated":"2026-07-08T21:45:34Z","snapshot_observed_at":"2026-08-20T10:05:34.064862Z","submitted_at":"2026-07-08T21:45:34Z","title":"DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07946","snapshot_observed_at":"2026-08-02T04:28:27.333960Z","title":"Deepswe: Measuring frontier coding agents on original, long-horizon engineering tasks.arXiv preprint arXiv:2607.07946, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:27.333960Z"},"links":{"cited_paper":"/paper/2607.07946","citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:12c718a850a52cd8bc77b97259c8b3a1d64b6ab6fcf3b3b5f851269f9e98c615","observation_id":"e2605cf5-3fb8-439a-a162-913c218c1c0f","resolution":{"observed_at":"2026-08-02T04:28:27.333960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:27.464856Z","title":"Waytowich, and Boyuan Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:27.464856Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:15926f4f3c0bc29c005da565491ca40b34cf88db09cd33c8733b656ead27c2a3","observation_id":"1fa3d58b-de38-402d-b2f9-55ec33559f62","resolution":{"observed_at":"2026-08-02T04:28:27.464856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:27.576474Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:27.576474Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:92a1a30eb22566fa856fb6cdcc5b49b113c95870a4a1ca1e2b6680dc319b74a5","observation_id":"778216b8-cfd7-42ba-9ad0-4a7ce3779317","resolution":{"observed_at":"2026-08-02T04:28:27.576474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:27.656925Z","title":"Langsmith: A unified platform for debugging, testing, evaluating, and monitoring your llm applications.https://www.langchain.com/langsmith, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:27.656925Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:5db212c6935e22981f22905ce3ecfc27e5a1947f38e991b0ed02af4f23f5853f","observation_id":"515bd38a-6e16-4164-94d7-361d9deb0406","resolution":{"observed_at":"2026-08-02T04:28:27.656925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:27.756312Z","title":"Camel: Communicative agents for \"mind\" exploration of large language model society","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:27.756312Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:effbd905447dd38261c24ecb05e267d0274216b7a270231827cbfbf34e57fc54","observation_id":"8eed8db8-3e40-415e-b90e-b0319d14ee78","resolution":{"observed_at":"2026-08-02T04:28:27.756312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12670","last_updated":"2026-03-13T07:33:01Z","snapshot_observed_at":"2026-08-12T09:12:28.700231Z","submitted_at":"2026-02-13T07:06:06Z","title":"SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12670","snapshot_observed_at":"2026-08-02T04:28:27.859425Z","title":"Skillsbench: Benchmarking how well agent skills work across diverse tasks.arXiv preprint arXiv:2602.12670, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:27.859425Z"},"links":{"cited_paper":"/paper/2602.12670","citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:f5f00914315cadcfc9e695267551b147c419885f98c4b93bad5ccc983917e1cf","observation_id":"dff3998e-bff5-43ad-9dca-5334fd0dc904","resolution":{"observed_at":"2026-08-02T04:28:27.859425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:27.968828Z","title":"Agentbench: Evaluating llms as agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:27.968828Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:cc135c48cc59725c7f3caa38bae73754e7b269181757cd8bcac109c2e36981b1","observation_id":"d03511ce-8668-43c1-8e3b-9d94ad913832","resolution":{"observed_at":"2026-08-02T04:28:27.968828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:28.078610Z","title":"Agentboard: An analytical evaluation board of multi-turn llm agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:28.078610Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:34c9253f52d4f25ce3530be1b3126d896b216764088f7f3bda21bc4cea539062","observation_id":"7ea47235-b6e9-4555-9be9-a5c3d6bf63c3","resolution":{"observed_at":"2026-08-02T04:28:28.078610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-08-20T02:32:10.164015Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-02T04:28:28.175736Z","title":"Terminal-bench: Benchmarking agents on hard, realistic tasks in command line interfaces.arXiv preprint arXiv:2601.11868, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:28.175736Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:0319ce14f4ee42078ad4de3cbb2ddb738ebb04a10dc46dbd0f5c0207df478026","observation_id":"f4fe4edb-6a58-43a1-a89a-dd60664ede31","resolution":{"observed_at":"2026-08-02T04:28:28.175736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:28.281304Z","title":"GAIA: a benchmark for general AI assistants","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:28.281304Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:1da85d4d6f3099b01fe88c77fe527f84fae83d74ec22346e48da2f7151ae7010","observation_id":"f239a4a5-de51-4a96-8ed6-93f86c96d445","resolution":{"observed_at":"2026-08-02T04:28:28.281304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:28.368950Z","title":"Kimi-k2.6.https://www.kimi.com/en/blog/kimi-k2-6, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:28.368950Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:2f089d9475126078c387070b3acd6c43f79f7d6e3eb55a982f163ddfc2cf87d4","observation_id":"bbbbfff6-7fa6-4e5c-b36a-0b8310de683c","resolution":{"observed_at":"2026-08-02T04:28:28.368950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:28.455201Z","title":"Introducing GPT-5.5.https://openai.com/index/introducing-gpt-5-5/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:28.455201Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:fbaf9d509db8b6b28e82924377f6975f528f28d5669722334826b8add7dc1bc5","observation_id":"28d8c413-4466-4b37-b33e-aa99afdd43ba","resolution":{"observed_at":"2026-08-02T04:28:28.455201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:28.567579Z","title":"OpenClaw.https://github.com/openclaw/openclaw, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:28.567579Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:392a807c9e7eb455d2e2bbde00edf438cc952316741dca65dcbc1ce7cf83ba5e","observation_id":"926f82ef-149c-43eb-b510-5c63a8a3defc","resolution":{"observed_at":"2026-08-02T04:28:28.567579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:28.665658Z","title":"Patil, Huanzhi Mao, Cheng-Jie Ji, Fanjia Yan, Vishnu Suresh, Ion Stoica, and Joseph E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:28.665658Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:e47941a39113d89d1b0dbb3297733206e67773baf601c9f20fdf9c728039e999","observation_id":"cb0821aa-585c-40b1-96b2-b63bd253c2f1","resolution":{"observed_at":"2026-08-02T04:28:28.665658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04374","last_updated":"2025-10-05T21:36:43Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T21:36:43Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04374","snapshot_observed_at":"2026-08-02T04:28:28.774561Z","title":"Gdpval: Evaluating ai model performance on real-world economically valuable tasks.arXiv preprint arXiv:2510.04374, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:28.774561Z"},"links":{"cited_paper":"/paper/2510.04374","citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:341ae46664527fe907759c5aee72e8940e71d0f301143c2debc0fc788f107ad3","observation_id":"13666849-670e-4f99-bd67-eded6936b09e","resolution":{"observed_at":"2026-08-02T04:28:28.774561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-08-20T14:04:31.329156Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-02T04:28:28.856099Z","title":"Humanity’s last exam.arXiv preprint arXiv:2501.14249,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:28.856099Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:a3a86743ad0413dbbf30bc871415f6aecb8508b5a020eca542bd6f7f891e5843","observation_id":"2ec5f367-1567-4f62-8d14-1e4b669df13c","resolution":{"observed_at":"2026-08-02T04:28:28.856099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:28.922495Z","title":"Pinchbench: Real-world benchmarks for ai coding agents, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:28.922495Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:b55f686e1d1632737174c764abcc02dd2e83057fb4cf40f45c2ff41121364bd4","observation_id":"ecab5476-e8e8-477f-abeb-72eff4d96610","resolution":{"observed_at":"2026-08-02T04:28:28.922495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:29.010111Z","title":"Qwen3.5: Accelerating productivity with native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:29.010111Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:51df5ac55bab1621268e19c77a2abd8014d7e97cf725111e1207338a1503bda0","observation_id":"260d6c22-6de8-4797-8d2a-2c3fafcc2707","resolution":{"observed_at":"2026-08-02T04:28:29.010111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:29.095446Z","title":"2, 1, 4.1 10 AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:29.095446Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:88f7981477d219128c063bc7f07abb791c7c42a7eabee414ab61d982ae7aa5c3","observation_id":"84cbb913-4bfd-4424-b91a-7bdc7c8f31fb","resolution":{"observed_at":"2026-08-02T04:28:29.095446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:29.175292Z","title":"EvalScope: Evaluation framework for large models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:29.175292Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:4555696255d1782f93657be1c54096fd1d86486eee290520aecf568e89990a7b","observation_id":"66914381-83cf-4a6b-bb9e-772d72f0424c","resolution":{"observed_at":"2026-08-02T04:28:29.175292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:29.244098Z","title":"Terminal-bench: A benchmark for ai agents in terminal environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:29.244098Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:73aba8d0b0a31d93c70c3f43a76c5415accbfec99e836cadb30a8a750b84e0c0","observation_id":"d7a09ceb-9aff-4413-8f89-761301debeae","resolution":{"observed_at":"2026-08-02T04:28:29.244098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:29.359750Z","title":"Scicode: A research coding benchmark curated by scientists.Advances in Neural Information Processing Systems, 37:30624–30650, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:29.359750Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:1082c9b49258dd017f66b55b98d7bb23216c919e6636254b88f349840f7e27e2","observation_id":"2eb6d0aa-92c0-461d-9201-071e9e450411","resolution":{"observed_at":"2026-08-02T04:28:29.359750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:29.466375Z","title":"Frontier- science: Evaluating ai’s ability to perform expert-level scientific tasks.arXiv preprint arXiv:2601.21165,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:29.466375Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:7d673cd547c70c61b620ed0766e83929380a01bc09ce5f08451588046a04c51e","observation_id":"ff36f398-609b-4664-86b7-4fc02010694c","resolution":{"observed_at":"2026-08-02T04:28:29.466375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:29.570199Z","title":"Openhands: An open platform for ai software developers as generalist agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:29.570199Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:d133d3fd11ca61caf3018f5f1f3be7935de6e22c7b5f1956afe398252b2b44b1","observation_id":"76426af5-bab2-4688-a7b0-9e3c42294efa","resolution":{"observed_at":"2026-08-02T04:28:29.570199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-19T14:42:43.739745Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-02T04:28:29.673169Z","title":"Browsecomp: Asimpleyetchallengingbenchmark for browsing agents.arXiv preprint arXiv:2504.12516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:29.673169Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:a2b11a5914a6f6581c18324533e17c6307219558294aebd6d2e1a0c6d902c3fc","observation_id":"925e1fb1-34ad-4886-a120-3bc1b06c90c1","resolution":{"observed_at":"2026-08-02T04:28:29.673169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:29.820203Z","title":"Autogen: Enablingnext-genllmapplicationsviamulti-agentconversations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:29.820203Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:a600e2e2624d4691d16fac2135dde6dcf8732b306bd9b4c2c9e4a67354eda814","observation_id":"fc9af247-75da-40ef-8ce2-a2f447e9aefb","resolution":{"observed_at":"2026-08-02T04:28:29.820203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:29.916914Z","title":"Mitchell, and Yuanzhi Li","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:29.916914Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:dbec25e4bb33dfa72313983e53104a78cf570d5e98f0780f95077811e1e9833a","observation_id":"0b2f40a7-5177-4628-a744-fec252b6d472","resolution":{"observed_at":"2026-08-02T04:28:29.916914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:30.000535Z","title":"Agentgym: Evolving large language model-based agents across diverse environments, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:30.000535Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:3ed27a89b9654792374a620d0a37e3cf16f4723343419f4b87cca45d9725d5c5","observation_id":"5a1ef50f-53d0-443b-86cc-7469c83d35f1","resolution":{"observed_at":"2026-08-02T04:28:30.000535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:30.094777Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence.arXiv preprint arXiv:2606.19348, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:30.094777Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:dc111f6fb4503f79e83e043839bd387e0f687e94f1abd93cea3337130a135433","observation_id":"26cd8ed4-7d82-40ce-b02c-f3dc5927545e","resolution":{"observed_at":"2026-08-02T04:28:30.094777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.07591","last_updated":"2026-07-03T01:40:25Z","snapshot_observed_at":"2026-08-14T09:41:17.327665Z","submitted_at":"2026-05-28T16:27:40Z","title":"ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.07591","snapshot_observed_at":"2026-08-02T04:28:30.208799Z","title":"Researchclawbench: A benchmark for end-to-end autonomous scientific research.arXiv preprint arXiv:2606.07591, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:30.208799Z"},"links":{"cited_paper":"/paper/2606.07591","citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:536104d2f2c16521cf025a6bc87b5326a83c745e468c95eb6ab8558de03d92de","observation_id":"cc637492-3a41-4958-b1a6-694c775d4164","resolution":{"observed_at":"2026-08-02T04:28:30.208799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:30.343249Z","title":"Probing scientific general intelligence of llms with scientist-aligned workflows.arXiv preprint arXiv:2512.16969, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:30.343249Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:8922e9a8eb366ccf3d4e02592cf3bfe8f93d219a784fafbd28144b3dd4c11519","observation_id":"0c33621c-975c-4203-8a9f-f86446e16545","resolution":{"observed_at":"2026-08-02T04:28:30.343249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:30.483827Z","title":"SWE-agent: Agent-computer interfaces enable automated software engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:30.483827Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:4d4e7b16395ea87956112b0d19fa9b081910912f907c263b1ce1080dcf165b7a","observation_id":"ea311c2f-4163-47fd-89e5-73c79f2ffb0a","resolution":{"observed_at":"2026-08-02T04:28:30.483827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:30.579259Z","title":"Jimenez, Alexander Wettig, Kabir Khandpur, Yanzhe Zhang, Binyuan Hui, Ofir Press, Ludwig Schmidt, and Diyi Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:30.579259Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:a2afec897f92f704abcca38f31d8b1721efa03b040c2bcbd3d96ac430e60001c","observation_id":"966e94a1-5a41-4de1-9250-2658777dbadd","resolution":{"observed_at":"2026-08-02T04:28:30.579259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-17T20:31:29.818313Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-02T04:28:30.672460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:30.672460Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:3472a8caaee5144c72f69a3f41555ca56c69e470ef4fb6cd82247938f5666245","observation_id":"c2602e56-b100-4cdf-b869-33d3361eba6a","resolution":{"observed_at":"2026-08-02T04:28:30.672460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:30.792653Z","title":"Maslab: A unified and comprehensive codebase for llm-based multi-agent systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:30.792653Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:ef9210fbb74597b1fee2253b0ac061f5d92fcee38f5d3008eccb9d1c3640f534","observation_id":"8be112a3-3113-4d1a-a1a5-cf830076da6d","resolution":{"observed_at":"2026-08-02T04:28:30.792653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:30.979644Z","title":"Hle-verified: A systematic verification and structured revision of humanity’s last exam.arXiv preprint arXiv:2602.13964, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:30.979644Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:c5e5fb9a3cf474a393b4577215ce8e0e8723ee2da5b758e2b03016ac10b485b7","observation_id":"6f64c576-bd5a-4cd7-97a7-2df81a0ea21c","resolution":{"observed_at":"2026-08-02T04:28:30.979644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19314","last_updated":"2025-05-01T05:02:57Z","snapshot_observed_at":"2026-08-12T22:48:20.392456Z","submitted_at":"2025-04-27T17:32:43Z","title":"BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19314","snapshot_observed_at":"2026-08-02T04:28:31.131799Z","title":"Browsecomp-zh: Benchmarking web browsing ability of large language models in chinese.arXiv preprint arXiv:2504.19314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:31.131799Z"},"links":{"cited_paper":"/paper/2504.19314","citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:5057bea668dec575420984e6dbe347df07e6938443dbc283cb314a04515203f1","observation_id":"0555dc90-65cd-45b4-8ee0-76f1a24b4115","resolution":{"observed_at":"2026-08-02T04:28:31.131799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01935","last_updated":"2025-03-03T05:18:50Z","snapshot_observed_at":"2026-08-17T09:51:49.005671Z","submitted_at":"2025-03-03T05:18:50Z","title":"MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01935","snapshot_observed_at":"2026-08-02T04:28:31.310957Z","title":"Multiagentbench: Evaluating the collaboration and competition of llm agents.arXiv preprint arXiv:2503.01935, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:31.310957Z"},"links":{"cited_paper":"/paper/2503.01935","citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:cbf30651cbeae7b79660c0396f6f68fe975184d2225a77e2ec0fd20d9d9d54d8","observation_id":"a261d788-53f4-44ef-8fe5-4c0af4caab2d","resolution":{"observed_at":"2026-08-02T04:28:31.310957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:28:31.474196Z","title":"Intern-s1-pro: Scientific multimodal foundation model at trillion scale, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T04:28:31.474196Z"},"links":{"citing_paper":"/paper/2607.13705"},"observation_digest":"sha256:a22842db1c1ed9e282770df79fcc593a1821258c0c80f112361e87b63bdcfb6c","observation_id":"1af9b981-42f3-4e70-b372-90d68eef9244","resolution":{"observed_at":"2026-08-02T04:28:31.474196Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13705","last_updated":"2026-07-15T11:11:17Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T16:35:19.596791Z","submitted_at":"2026-07-15T11:11:17Z","title":"AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2607.13705."}