{"as_of":"2026-08-05T03:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b9d4c60458216919cd03a8d521f0f04114e05e49dbb721dcec68572946c45ee","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:13:41.995563Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T01:37:42.801023Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2512.13168","last_updated":"2026-04-15T17:46:00Z","snapshot_observed_at":"2026-07-31T12:41:54.136440Z","submitted_at":"2025-12-15T10:28:45Z","title":"Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T22:43:48.618334Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2512.13168"},"observation_digest":"sha256:cb16eb08e72026a22431c3bb81f1299feb3fba3475011ec2a619e0c4ed0e768c","observation_id":"65d346f4-7218-450b-a8d3-1038b655014f","resolution":{"observed_at":"2026-05-16T22:48:38.315116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-08-03T04:08:12.299526Z","title":"M., Xu, J., R \\\"u hle, V., and Rajmohan, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05843","last_updated":"2026-06-04T17:59:52Z","snapshot_observed_at":"2026-08-03T04:08:05.711718Z","submitted_at":"2026-02-05T16:31:43Z","title":"OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T04:08:12.299526Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2602.05843"},"observation_digest":"sha256:80c3b912516dcdfb63e5aefba23f80adcb1a07ee76dff836fe53b5ec071f94ae","observation_id":"5072d6c0-9b4a-4c27-8feb-cd934da8508e","resolution":{"observed_at":"2026-08-03T04:08:12.299526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-13T23:45:24.809791Z","title":"Preprint, arXiv:2508.09124","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16453","last_updated":"2026-07-08T13:11:31Z","snapshot_observed_at":"2026-07-13T23:45:24.236059Z","submitted_at":"2026-03-17T12:35:52Z","title":"RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T23:45:24.809791Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2603.16453"},"observation_digest":"sha256:d1eb29b246d31452aa013defc2ee25f6eb100f00e361bff5022331ec228c445a","observation_id":"c62324e5-15e4-4783-944e-7ea13ed7d6c7","resolution":{"observed_at":"2026-07-13T23:45:24.809791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2604.02522","last_updated":"2026-04-02T21:23:00Z","snapshot_observed_at":"2026-08-03T01:43:37.179078Z","submitted_at":"2026-04-02T21:23:00Z","title":"Opal: Private Memory for Personal AI","version":1},"reference_index":239,"source":"pdf_text","source_observed_at":"2026-05-13T21:09:06.320543Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2604.02522"},"observation_digest":"sha256:5689ad23305968193d8f5ee493f429293912b3f11b7175b22a6f316637c3fca2","observation_id":"24c38b31-9cb7-4baa-9c58-338a028a99f0","resolution":{"observed_at":"2026-05-13T21:13:16.664821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2604.15715","last_updated":"2026-04-17T05:36:00Z","snapshot_observed_at":"2026-08-01T15:43:04.529409Z","submitted_at":"2026-04-17T05:36:00Z","title":"GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T08:42:57.035226Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2604.15715"},"observation_digest":"sha256:650627464b2e25134ea62543e9a854adf62fd211c271b21b7e346722521e86e3","observation_id":"6b0e752a-c0bd-4e4b-ae6e-4ebeb9b0e139","resolution":{"observed_at":"2026-05-10T08:43:01.095541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2604.23455","last_updated":"2026-05-01T07:18:53Z","snapshot_observed_at":"2026-07-06T23:09:38.799345Z","submitted_at":"2026-04-25T22:10:53Z","title":"CUJBench: Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T07:47:51.195882Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2604.23455"},"observation_digest":"sha256:0370b82664f855b318b9597d46662c99d9695834966606eebdf53444e41a5152","observation_id":"1bea0ef8-cb73-4380-9fa3-c3f46052a504","resolution":{"observed_at":"2026-05-11T20:51:13.490188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2605.07339","last_updated":"2026-05-08T06:44:11Z","snapshot_observed_at":"2026-07-31T12:37:52.379547Z","submitted_at":"2026-05-08T06:44:11Z","title":"Tools as Continuous Flow for Evolving Agentic Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T01:30:19.859374Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2605.07339"},"observation_digest":"sha256:ab7141ac53f17b4bc027e221e35af6e4f088a6cca1961ee488de0ebaa19ec7b9","observation_id":"4fa2cec6-8f8b-4a61-b35c-6e1a2595bf5d","resolution":{"observed_at":"2026-05-11T01:45:51.700933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2605.10912","last_updated":"2026-05-11T17:49:43Z","snapshot_observed_at":"2026-08-03T00:15:01.823825Z","submitted_at":"2026-05-11T17:49:43Z","title":"WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T03:40:00.725327Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2605.10912"},"observation_digest":"sha256:75e158c7501119be2d39ea55990a17c3449faaca3e0da3a74af80c4c0f9ba30d","observation_id":"4d5e23ff-a394-4099-9135-f654742b73de","resolution":{"observed_at":"2026-05-12T07:11:23.957989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2605.15230","last_updated":"2026-08-03T14:38:56Z","snapshot_observed_at":"2026-08-05T02:46:16.321399Z","submitted_at":"2026-05-13T18:03:51Z","title":"EnergyAgentBench: Benchmarking LLM Agents on Live Energy Infrastructure Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T17:43:11.038874Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2605.15230"},"observation_digest":"sha256:10f97a47d8db2bdfdcd8047720016f5abf66420030361754a86b871c156d0c16","observation_id":"f5a64f86-eeb9-4c68-ba41-61067e440367","resolution":{"observed_at":"2026-05-19T17:47:42.076382Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-08-04T05:13:41.995563Z","title":"arXiv preprint arXiv:2508.09124, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.15230","last_updated":"2026-08-03T14:38:56Z","snapshot_observed_at":"2026-08-05T02:46:16.321399Z","submitted_at":"2026-05-13T18:03:51Z","title":"EnergyAgentBench: Benchmarking LLM Agents on Live Energy Infrastructure Data","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T05:13:41.995563Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2605.15230"},"observation_digest":"sha256:b889e9ec34fce651af327837a8a5a12a7d399182956bc8d8c401b76d4536efc5","observation_id":"6e0420ee-eb3c-4c33-8f04-924fbe58b065","resolution":{"observed_at":"2026-08-04T05:13:41.995563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2606.05342","last_updated":"2026-06-05T17:19:56Z","snapshot_observed_at":"2026-07-06T23:45:23.749718Z","submitted_at":"2026-06-03T18:32:00Z","title":"SentinelBench: A Benchmark for Long-Running Monitoring Agents","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T06:09:38.698353Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.05342"},"observation_digest":"sha256:66a7ea7d0e1745e8e6beabda58366a44d0d23994ca46f762a16f78a42fe82c23","observation_id":"4d295bdd-2f3e-46ed-8708-8acc3d463185","resolution":{"observed_at":"2026-07-02T08:16:48.301325Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2606.08340","last_updated":"2026-06-06T21:13:43Z","snapshot_observed_at":"2026-07-31T22:58:06.517022Z","submitted_at":"2026-06-06T21:13:43Z","title":"Benchmarking Open-Ended Multi-Agent Coordination in Language Agents","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T19:18:56.039587Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.08340"},"observation_digest":"sha256:db3d26ddccb6fa24791f83270fd097ddcfe0eaa1a0a6fe7bf2ce78f7dffb4698","observation_id":"2fb866c7-3830-4bb4-b3fb-a9ecb1dd1d5a","resolution":{"observed_at":"2026-07-02T21:57:26.489813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2606.14397","last_updated":"2026-06-25T10:49:26Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T12:32:24Z","title":"Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T04:35:38.527140Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.14397"},"observation_digest":"sha256:7565d44f2f0d38bfa8adddb7091b029855deac8e6130f5fdf917725d969a8dda","observation_id":"a4eb0f97-5ceb-46e3-8957-5d90ae170888","resolution":{"observed_at":"2026-07-03T17:08:43.394326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-02T11:01:11.072388Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-27T00:19:47.396643Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:c590d4a8d1f8e83ac8372de903369ef60a871227dacce9066b1e0ecadeb07b00","observation_id":"3ab79eeb-82cd-4ef1-80d5-1a74c4fe99e4","resolution":{"observed_at":"2026-07-03T21:38:58.671790Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-08-02T11:01:20.504958Z","title":"OdysseyBench : Evaluating LLM agents on long-horizon complex office application workflows","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-02T11:01:11.072388Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:20.504958Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:a51f76b5da740a8a2e4fc3a43418a205567233b25cb51a040844069f2a70e281","observation_id":"f8e0eeee-4f78-4a5a-94ab-21a3e66e5da5","resolution":{"observed_at":"2026-08-02T11:01:20.504958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2606.21654","last_updated":"2026-06-19T18:00:14Z","snapshot_observed_at":"2026-08-04T06:52:55.694202Z","submitted_at":"2026-06-19T18:00:14Z","title":"ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T14:05:28.423719Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.21654"},"observation_digest":"sha256:89add4b7393d21a1f8af25a95e49c027a3f74aa1f0b0fc77f1224583ce207313","observation_id":"ad13d3d4-f532-4450-96d8-0ce87595a72a","resolution":{"observed_at":"2026-07-04T06:49:38.855626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2606.26346","last_updated":"2026-06-24T19:38:21Z","snapshot_observed_at":"2026-08-01T10:31:00.655586Z","submitted_at":"2026-06-24T19:38:21Z","title":"How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T01:34:10.103638Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.26346"},"observation_digest":"sha256:2e462f63fd52c999bc5cb9e24feaf2a544e0017b39171166bff9b719039fa479","observation_id":"561a7d5e-68da-4aaa-9250-13b69716b9d0","resolution":{"observed_at":"2026-07-04T15:29:56.687129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2607.01245","last_updated":"2026-05-29T03:19:32Z","snapshot_observed_at":"2026-07-07T00:06:49.412663Z","submitted_at":"2026-05-29T03:19:32Z","title":"Office Comprehension Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-04T00:20:42.974208Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2607.01245"},"observation_digest":"sha256:1b8d5140e73d879dc295252d68b03d7565ae4770efe86238972630ca975e9bb8","observation_id":"0adcedff-cf5d-4e65-ac83-237afa52fb7e","resolution":{"observed_at":"2026-07-04T00:29:15.017566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T20:03:47.212663Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:381c48509805a99ebe8070ec0719980635141a475208f75140cae60cfbd9b4dd","observation_id":"662aa882-8fc7-40db-979c-6a923384bff0","resolution":{"observed_at":"2026-07-08T20:05:34.092723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:68202b0787ecc47936d001ea33aa3c526cdd27885161bc228f482d447f3acedd","observation_id":"3d6e37f4-3f48-4ee5-9232-60d5934d89f5","resolution":{"observed_at":"2026-07-11T01:37:42.831140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-30T10:50:09.643083Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27155","last_updated":"2026-07-29T17:33:47Z","snapshot_observed_at":"2026-08-03T10:37:01.473880Z","submitted_at":"2026-07-29T17:33:47Z","title":"OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-30T10:50:09.643083Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2607.27155"},"observation_digest":"sha256:066f791caa00c19b4487b596f18b8fe61a9a77b5786051c0485f7ff3d64bf8d2","observation_id":"35539d15-0a15-41c9-9662-f7ecf4bb764c","resolution":{"observed_at":"2026-07-30T10:50:09.643083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.09124/citation-record","integrity":"/paper/2508.09124/integrity","json":"/paper/2508.09124/citation-record.json","paper":"/paper/2508.09124"},"outbound":[],"paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2508.09124."}