{"as_of":"2026-08-06T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3449c33887d34abf0d28d40bcca34306a6488fb5167dcd3758c93dc40de6dd0","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T00:36:15.896432Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:38:16.681296Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14989","snapshot_observed_at":"2026-08-01T03:38:16.681296Z","title":"Omniabench: Benchmarking general ai agents across diverse scenarios, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23124","last_updated":"2026-07-25T09:58:24Z","snapshot_observed_at":"2026-08-01T21:13:06.083655Z","submitted_at":"2026-07-25T09:58:24Z","title":"AgentOmnia: Scaling Agentic Models for Full-Scenario Applications","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T03:38:16.681296Z"},"links":{"cited_paper":"/paper/2607.14989","citing_paper":"/paper/2607.23124"},"observation_digest":"sha256:24e10a71ad48f8bfcedf29827e6d7c5d545c97ef63deb3279b27e05333aa5210","observation_id":"2bc7ea6a-b277-4acd-9cb3-21332b85d0d0","resolution":{"observed_at":"2026-08-01T03:38:16.681296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.14989/citation-record","integrity":"/paper/2607.14989/integrity","json":"/paper/2607.14989/citation-record.json","paper":"/paper/2607.14989"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.15840","last_updated":"2025-02-20T15:52:29Z","snapshot_observed_at":"2026-08-05T01:43:00.778707Z","submitted_at":"2025-02-20T15:52:29Z","title":"Vending-Bench: A Benchmark for Long-Term Coherence of Autonomous Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15840","snapshot_observed_at":"2026-08-02T00:36:15.686510Z","title":"Vending-bench: A benchmark for long-term coherence of autonomous agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.686510Z"},"links":{"cited_paper":"/paper/2502.15840","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:7ea321622a51556f417c3aa23c60b8fcbc9e7af89a4a20f3afd72bb5ffedb612","observation_id":"f92f1d4b-46d7-4c3f-81e9-094a084376a9","resolution":{"observed_at":"2026-08-02T00:36:15.686510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00933","last_updated":"2026-05-19T23:26:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-31T23:19:39Z","title":"MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.00933","snapshot_observed_at":"2026-08-02T00:36:15.692389Z","title":"Mcp-atlas: A large-scale benchmark for tool-use competency with real mcp servers","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.692389Z"},"links":{"cited_paper":"/paper/2602.00933","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:813496d0f38d91d0550f996a4a3789b475c97171d580ab05b5aef4e28f90e0bc","observation_id":"ee70646b-4454-4e07-8009-a1e1c2d75d7b","resolution":{"observed_at":"2026-08-02T00:36:15.692389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-02T00:36:15.697891Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.697891Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:a896743c124346c4d02574b8c1dd63658b227f54871256fbdd050f40d1914999","observation_id":"98ecf2b2-2b0c-4c1a-8cae-d008ec31a237","resolution":{"observed_at":"2026-08-02T00:36:15.697891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.703133Z","title":"Workarena++: Towards compositional planning and reasoning-based common knowledge work tasks.Advances in Neural Information Processing Systems, 37:5996–6051, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.703133Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:6b445e6cf4529ffcb6f4017c2f4f106092baf266d004faa95aa829ebf6609511","observation_id":"69d89396-9c19-42f5-9f52-506cad14fab0","resolution":{"observed_at":"2026-08-02T00:36:15.703133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.708055Z","title":"Acebench: Who wins the match point in tool usage?arXiv preprint arXiv:2501.12851, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.708055Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:39c8dafeb71d40ce54fe300221fcce861c99fc4f443f8a6ed915b2886fe01051","observation_id":"92e1de46-1928-4ce4-ba49-12da0a77ca13","resolution":{"observed_at":"2026-08-02T00:36:15.708055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-02T00:36:15.712554Z","title":"Training verifiers to solve math word problems, 2021.URL https://arxiv","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.712554Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:3e07c7044136e861d4f525da864d31aff7a83a00fc48803906d771e652720c88","observation_id":"d2222a21-b736-4cfe-8275-ce8d485c1f75","resolution":{"observed_at":"2026-08-02T00:36:15.712554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.717827Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.717827Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:b68c79677bfffb6cbf34769dce641a2774ae7a5ab5cc04505892159869553637","observation_id":"d9ac0475-4325-4b21-8e75-df4f7b354e95","resolution":{"observed_at":"2026-08-02T00:36:15.717827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18292","last_updated":"2026-04-20T14:01:10Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:01:10Z","title":"Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18292","snapshot_observed_at":"2026-08-02T00:36:15.722166Z","title":"Agent-world: Scaling real-world environment synthesis for evolving general agent intelligence.arXiv preprint arXiv:2604.18292, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.722166Z"},"links":{"cited_paper":"/paper/2604.18292","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:686c7ff0739744c0854fd0fefa00e61576d6f2057fdbba2175f66edbe55346a3","observation_id":"f80d6b94-f83a-4286-9116-df602d194120","resolution":{"observed_at":"2026-08-02T00:36:15.722166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.726706Z","title":"Gaia2: Benchmarking llm agents on dynamic and asynchronous environments.arXiv preprint arXiv:2602.11964, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.726706Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:7307bc5fb519d672e56b8bfdb533aa86becb4af267199d4289b7aa7941e0417a","observation_id":"cfadd12e-87fa-42be-8641-d1fbb1574dde","resolution":{"observed_at":"2026-08-02T00:36:15.726706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-02T00:36:15.731165Z","title":"Glm-5: from vibe coding to agentic engineering, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.731165Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:e11c92b6b6372bc404125a8950b54f1ded115fef13378a7eac9c6189342eb8fe","observation_id":"c345dfa9-7688-4b25-b7ca-c55a6fe11a38","resolution":{"observed_at":"2026-08-02T00:36:15.731165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.736318Z","title":"Vitabench: Benchmarking llm agents with versatile interactive tasks in real-world applications.arXiv preprint arXiv:2509.26490, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.736318Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:8d72e5713dc10cec9523cd2dd64ca38e4843aa7f47284b60ce442da7f14bef43","observation_id":"a1ad8539-97f9-47ff-874d-8edd8998011c","resolution":{"observed_at":"2026-08-02T00:36:15.736318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.740857Z","title":"Swe-bench: Can language models resolve real-world github issues? In International Conference on Learning Representations, volume 2024, pages 54107–54157, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.740857Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:2983ccaa7d1487283dc35ef60d7dbde0594a5994968271f9dd995bcb40be7fa3","observation_id":"d532e613-26c8-4670-99cf-ee37c8d0485f","resolution":{"observed_at":"2026-08-02T00:36:15.740857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.745842Z","title":"The tool decathlon: Bench- marking language agents for diverse, realistic, and long-horizon task execution.arXiv preprint arXiv:2510.25726, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.745842Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:dc6a20aa43f25dce3ed869795bc1e16952b376033d8c43f4cb77a3e8d6395cdd","observation_id":"de01f234-0ee2-40bb-a02f-ae99aa420a8e","resolution":{"observed_at":"2026-08-02T00:36:15.745842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.750217Z","title":"Dataflow: An llm-driven framework for unified data preparation and workflow automation in the era of data-centric ai, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.750217Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:4817a09aa4846eb6048df980d4b73f713ae3b9f7e4ae4e615dddc66f3bd75b36","observation_id":"ae5b7737-562e-4b11-abc5-8bf9457f9a66","resolution":{"observed_at":"2026-08-02T00:36:15.750217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.754402Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation benchmark for llm tool use capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.754402Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:28db859711bdc421e30f448f54a6f7a6d353d31cc5638bcbab35269a758c1427","observation_id":"dcec0a53-67d5-4c3d-bcb9-1ae873084715","resolution":{"observed_at":"2026-08-02T00:36:15.754402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23781","last_updated":"2026-05-05T15:32:46Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T16:05:02Z","title":"ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23781","snapshot_observed_at":"2026-08-02T00:36:15.758892Z","title":"Clawmark: A living-world benchmark for multi-turn, multi-day, multimodal coworker agents.arXiv preprint arXiv:2604.23781, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.758892Z"},"links":{"cited_paper":"/paper/2604.23781","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:baa679de4dcbec254fb549e29a5bf1d417f7195d7e78acc819869c46907a5bc0","observation_id":"35d0ddb8-f4d3-4ac4-920f-1a718e7be0cb","resolution":{"observed_at":"2026-08-02T00:36:15.758892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.763968Z","title":"Gorilla: Large language model connected with massive apis.Advances in Neural Information Processing Systems, 37:126544–126565, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.763968Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:f92170d289fe67c4af1aa286dae05dbff55d9e31d5a5ccb13a34700e5968da3d","observation_id":"57e6884d-83e8-4a3e-aa7c-f3d8bac50212","resolution":{"observed_at":"2026-08-02T00:36:15.763968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.768484Z","title":"The berkeley function calling leaderboard (bfcl): From tool use to agentic evaluation of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.768484Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:2fbf51c4c47c985d18703e8d602ff4b5ecaa2f2e7fbf9a975f828532b530d2a2","observation_id":"c13722e1-b478-40ba-a0d6-96a425633d9a","resolution":{"observed_at":"2026-08-02T00:36:15.768484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04374","last_updated":"2025-10-05T21:36:43Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T21:36:43Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04374","snapshot_observed_at":"2026-08-02T00:36:15.772715Z","title":"Gdpval: Evaluating ai model performance on real-world economically valuable tasks.arXiv preprint arXiv:2510.04374, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.772715Z"},"links":{"cited_paper":"/paper/2510.04374","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:04052c30cb676ed698cf940373b458e2358b08402908437c702952e67a186dbe","observation_id":"146c6ecc-0f79-4997-83da-47bd6ce570af","resolution":{"observed_at":"2026-08-02T00:36:15.772715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.777037Z","title":"QwenClawBench: Real-user-distribution benchmark for openclaw agents, April","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.777037Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:eb971662be94b8d1dc96c2ea54f968a391a08bddb381e814a4bdefbeb288e3c9","observation_id":"d90dc87d-f0b7-4e55-b017-cfc8530cc58c","resolution":{"observed_at":"2026-08-02T00:36:15.777037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.785663Z","title":"One-eval: An agentic system for automated and traceable llm evaluation.arXiv preprint arXiv:2603.09821, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.785663Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:745a212ab9bfc84817c5e66a89e4012ea2379dd878d84db5fd11265a71772555","observation_id":"8d291883-7561-47ed-b00e-4e53a70b11b8","resolution":{"observed_at":"2026-08-02T00:36:15.785663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.789506Z","title":"URLhttps://arxiv.org/abs/2603.04370","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.789506Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:7e3eaa9348dedeae33db4c21871091c25b37307ca624ced9037d102b37db1bf2","observation_id":"8a43c760-0979-454d-9dcb-148f7ee0153a","resolution":{"observed_at":"2026-08-02T00:36:15.789506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-02T00:36:15.794297Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.794297Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:ac2150686827fe2bc978bcc0c44526f4b3949a047583ce70d508f98fee8246a7","observation_id":"e55cf75c-035a-4b25-a140-5a352ebe7b0d","resolution":{"observed_at":"2026-08-02T00:36:15.794297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.799456Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.Advances in Neural Information Processing Systems, 37:95266–95290, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.799456Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:c8ef689ff16b4965c0b4f6c752d225895b24cdd624707c8cd8a79f40db327434","observation_id":"bb12d6ba-b891-44d2-be04-6d568462a14a","resolution":{"observed_at":"2026-08-02T00:36:15.799456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.804245Z","title":"Swe-agent: Agent-computer interfaces enable automated software engineering.Advances in Neural Information Processing Systems, 37:50528–50652, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.804245Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:7041447915f7d9c126d6661e70ccea8dfa2d3d4e1c3bd14988ab74b40a5d6d8a","observation_id":"af412506-04f8-471c-97d8-06db166c7e8e","resolution":{"observed_at":"2026-08-02T00:36:15.804245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-02T22:19:29.043854Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-02T00:36:15.809267Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.809267Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:31392740e962fcd39e0f228d35c7d339dc3ac85f61a29375fa253f39e3bf526e","observation_id":"380c0c35-124a-4edf-9d35-aae77bbfd9a5","resolution":{"observed_at":"2026-08-02T00:36:15.809267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06132","last_updated":"2026-05-07T14:06:23Z","snapshot_observed_at":"2026-07-06T22:54:40.349479Z","submitted_at":"2026-04-07T17:43:18Z","title":"Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06132","snapshot_observed_at":"2026-08-02T00:36:15.814013Z","title":"Claw-eval: Towards trustworthy evaluation of autonomous agents.arXiv preprint arXiv:2604.06132, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.814013Z"},"links":{"cited_paper":"/paper/2604.06132","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:2afe8d17970263be7744535711310a063164af33f2c586e237d080101984f0ae","observation_id":"f7303418-7fa0-46ef-9090-43c43d571a79","resolution":{"observed_at":"2026-08-02T00:36:15.814013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.818900Z","title":"Deepplanning: Bench- marking long-horizon agentic planning with verifiable constraints.arXiv preprint arXiv:2601.18137, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.818900Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:be8bc213143a843cd2952b6c4d8aa37b82d3f94e3805a7938bee9a688043fef4","observation_id":"6fe38867-3a50-4928-8cc1-323641177e9f","resolution":{"observed_at":"2026-08-02T00:36:15.818900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.824559Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.824559Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:47a86e12dc77051bae441c666aa2fedc0bd0a1d31157809175ddafc4cae92a3f","observation_id":"532400e7-adb4-410f-acfd-6b22622c9a7c","resolution":{"observed_at":"2026-08-02T00:36:15.824559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.828684Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.828684Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:4c16908c72c55f9edcb202eb0b4350e904def12c281b04ca716b3439cc4bde73","observation_id":"7099790e-86de-4bb8-89bc-b4636ce2f1e0","resolution":{"observed_at":"2026-08-02T00:36:15.828684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.833186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.833186Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:18b2c799090902bd31595b19bf706e91d2346d17d20d485a1ae3ba1c8c5a42ee","observation_id":"72246456-5f0d-4556-9518-d2adf7b427e4","resolution":{"observed_at":"2026-08-02T00:36:15.833186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.837265Z","title":"This protocol evaluates not only task execution, but also clarification, constraint tracking, adaptation to user feedback, and state maintenance across multiple turns","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.837265Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:8b7906c66c2a2c5e5ffe25a7a8a5e7650a76561dbb930b424e288ccad3c8b40c","observation_id":"67998d9a-8708-4d4e-b59d-12469d9c2195","resolution":{"observed_at":"2026-08-02T00:36:15.837265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.842384Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.842384Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:d6734c6f18f594d446bce4de25042c99ae028eb67a7e4decea304fb83bc637a7","observation_id":"714e253d-0a79-4272-8875-05d696ed5080","resolution":{"observed_at":"2026-08-02T00:36:15.842384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.846871Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.846871Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:91f2a199028a887cde2baefca640189c545fd81da6b93abe783f6a1dd4812774","observation_id":"77acbd66-6a2b-476f-bf2d-f0b21dcb3264","resolution":{"observed_at":"2026-08-02T00:36:15.846871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.852162Z","title":"4.VerifyCodechecks the trajectory and final observation and returns a binary pass/fail result","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.852162Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:efbcbfedac6eb0056a140a71216cd8aae5670aea26e0ccb796b4efcaf7f5ab8c","observation_id":"ef31ed00-4acd-458d-83e4-0b45f1df8868","resolution":{"observed_at":"2026-08-02T00:36:15.852162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.856453Z","title":"[...additional description omitted ...]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.856453Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:090979b7495f2e50b2555a70e53cd5389c0866dfd25ccb2a141c56d53e75b658","observation_id":"e7af32ea-81ca-4c1b-bc37-92a81124aa3d","resolution":{"observed_at":"2026-08-02T00:36:15.856453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.860557Z","title":"[...additional tools omitted ...]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.860557Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:3b30827c49cccabbb2b41544b6979011169522d66cc4dd221799037985df34c8","observation_id":"fcd424a9-9c6d-47a2-8ee4-9f4dde5f68d8","resolution":{"observed_at":"2026-08-02T00:36:15.860557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.865246Z","title":"Your goal is to complete the user’s request in an interactive environment by gradually calling the available tools step by step, and to proactively communicate with the user","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.865246Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:3284f599af32611030b061d68f516952cd02d3c928d081f99ad4b46b42def16b","observation_id":"10c3a754-e51a-4626-9ef3-498b001c9a3b","resolution":{"observed_at":"2026-08-02T00:36:15.865246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.869397Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.869397Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:f880d96be0339e3db14d657d748bfa81ae14773ee5f2ed91b4eb9e54c00c1074","observation_id":"85bd7733-9245-40e0-89a5-575d6b867983","resolution":{"observed_at":"2026-08-02T00:36:15.869397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.874308Z","title":"<Judge reason> The trajectory correctly resolvesLF-2024-PI-024, confirms Yunhe Foods / Lin Qiaoxue / He Shan, verifiesVER-004 as current, and flags the self-referentialLNK-003link","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.874308Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:4e24fe7beab330168d33991d85d27a7067f85c2700bc697a3514faa17fdab54d","observation_id":"e457aacb-d23d-48fc-92db-2e1a7301f1e2","resolution":{"observed_at":"2026-08-02T00:36:15.874308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.878606Z","title":"store surveillance screenshots and incident timeline explanation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.878606Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:7c9cb4a959b5862e623ddfdf4e705ca594c278109330eaec78363076ecec27f0","observation_id":"3b900804-95e7-4063-82de-3f3bce04cd52","resolution":{"observed_at":"2026-08-02T00:36:15.878606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.883109Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.883109Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:fb9ba786e6a793fed10839d2de75c3657d504bb64d55eb3aa38529c216ab0e70","observation_id":"008c583d-9452-4fa5-936d-392a1db75110","resolution":{"observed_at":"2026-08-02T00:36:15.883109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.887535Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.887535Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:c2e1bb1b81b20d453ec6df2266b8f8953fa2c764bf2ec0bc1617c70b82b50b1a","observation_id":"8db42b9d-0575-4d7e-9996-7269cca3ffab","resolution":{"observed_at":"2026-08-02T00:36:15.887535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.892243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.892243Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:53346bb6d8b78ecaa064a0d15bab6b0df8dd34346ffcff39fb7411fde5cc165a","observation_id":"bd688285-357f-4f79-a60f-60a168ba8c39","resolution":{"observed_at":"2026-08-02T00:36:15.892243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.896432Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.896432Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:a6af8419bb414a9bd75ba51e8ded034fa349369fb9c087670f6dc82dcd1a8aaf","observation_id":"ecf144a3-b8d9-41c8-9c6e-b03b254a77ae","resolution":{"observed_at":"2026-08-02T00:36:15.896432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.781239Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.781239Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:feb3e0293bbc45f853ad7fc1006d7f707401ce3183d1daba3d434d976b0d6d01","observation_id":"2861883a-b8c8-47d8-b643-7ac88668d0c4","resolution":{"observed_at":"2026-08-02T00:36:15.781239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T02:20:09.336067Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2607.14989."}