{"as_of":"2026-08-15T02:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bbe6c59e69d05a1afb234dea044e008bfbba91158fb23e18d4f50aba7b1af424","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:01:21.667271Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:33:37.994926Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T22:11:21.828304Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"cited_work":{"arxiv_id":"2606.18543","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.18543","snapshot_observed_at":"2026-08-07T22:11:21.828304Z","title":"CEO-Bench: Can Agents Play the Long Game?","venue":"cs.AI","work_id":"b8be380f-b53a-4101-b4c6-bd6923a0a66c","year":2026},"citing_paper":{"arxiv_id":"2608.05864","last_updated":"2026-08-06T10:43:33Z","snapshot_observed_at":"2026-08-13T14:54:56.407916Z","submitted_at":"2026-08-06T10:43:33Z","title":"Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T22:11:21.464319Z"},"links":{"cited_paper":"/paper/2606.18543","citing_paper":"/paper/2608.05864"},"observation_digest":"sha256:d07b9883768420337eeaec62ca59f7d730fbef0e4ac67f891222b2b8af9ed456","observation_id":"260e24c5-8e75-4aaa-bf60-7fc501ab394a","resolution":{"observed_at":"2026-08-07T22:11:21.833602Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.18543","snapshot_observed_at":"2026-08-14T04:33:37.994926Z","title":"CEO-Bench: can agents play the long game?arXiv preprint arXiv:2606.18543, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08621","last_updated":"2026-08-09T10:08:21Z","snapshot_observed_at":"2026-08-14T05:28:04.803536Z","submitted_at":"2026-08-09T10:08:21Z","title":"Business Arena: Benchmarking LLM Agents in a Realistic Marketplace","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:37.994926Z"},"links":{"cited_paper":"/paper/2606.18543","citing_paper":"/paper/2608.08621"},"observation_digest":"sha256:9f46b66f2764a999a0a39dfd7eb1a893fd5c8707bceaa3f1f38f0e6b4caf8801","observation_id":"dea5f72d-7b4b-42f1-9634-e4d28f5a3e4a","resolution":{"observed_at":"2026-08-14T04:33:37.994926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.18543/citation-record","integrity":"/paper/2606.18543/integrity","json":"/paper/2606.18543/citation-record.json","paper":"/paper/2606.18543"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:16.054281Z","title":"Claude code overview","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:16.054281Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:c2f52eb601c5c5db4c2103916820c9de0ed9afa1672728d805d618531c7da088","observation_id":"4b94e559-eb69-4348-8aed-e163c3e7cd56","resolution":{"observed_at":"2026-08-02T11:01:16.054281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15840","last_updated":"2025-02-20T15:52:29Z","snapshot_observed_at":"2026-08-10T13:31:57.703896Z","submitted_at":"2025-02-20T15:52:29Z","title":"Vending-Bench: A Benchmark for Long-Term Coherence of Autonomous Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15840","snapshot_observed_at":"2026-08-02T11:01:16.111772Z","title":"Vending-bench: A benchmark for long-term coherence of autonomous agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:16.111772Z"},"links":{"cited_paper":"/paper/2502.15840","citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:ab63d19982115828a8d16e55383e528fe9d48a04943a48d3042aec1c75e109c9","observation_id":"ee76460d-f7df-49d9-a7a4-fdc5bcfc724e","resolution":{"observed_at":"2026-08-02T11:01:16.111772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:16.188924Z","title":"Vending-bench 2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:16.188924Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:df2155d7225aaddb7c8f75850f7e98be516a3e5ef682cab151cb27ed3b262f23","observation_id":"289abba0-fb62-4c07-a2f5-773c96146f7a","resolution":{"observed_at":"2026-08-02T11:01:16.188924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:16.250015Z","title":"LongBench : A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:16.250015Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:a04cae9e23966ed282b4387bde07dfb720cad0519d27599850fe03056932ba00","observation_id":"30fa8db3-5be4-4ec7-bc7f-df3fe755b899","resolution":{"observed_at":"2026-08-02T11:01:16.250015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:16.304358Z","title":"MLE-bench : Evaluating machine learning agents on machine learning engineering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:16.304358Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:7cd49cfdc93cd1ff25b35b4f0ad005c03ead59642ce417bf0ac2d2d0d25f36c0","observation_id":"290df872-7749-4bcf-adb8-24f9ee527474","resolution":{"observed_at":"2026-08-02T11:01:16.304358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-02T11:01:16.365255Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:16.365255Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:8c0935b152ea3872d515c7fd49efed26c56caea010c04bb419bf0a226552923c","observation_id":"638f9136-0d33-4f00-b554-c0895ee1cf84","resolution":{"observed_at":"2026-08-02T11:01:16.365255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:16.421654Z","title":"Laradji, Manuel Del Verme, Tom Marty, L \\'e o Boisvert, Megh Thakkar, Quentin Cappart, David Vazquez, Nicolas Chapados, and Alexandre Lacoste","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:16.421654Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:b93eed14cabd980d9e0a28f94ec00ef8756682b95a16a6d20c3d673df786f91f","observation_id":"5ed1e187-1f1b-4442-8fe0-f523b5bb1d74","resolution":{"observed_at":"2026-08-02T11:01:16.421654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:16.526678Z","title":"YC-Bench : Benchmarking AI agents for long-term planning and consistent execution","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:16.526678Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:cea5cfedf260f5fcc55b92359b2c140b9182b28719dcef8aefc98eeb2d48e08a","observation_id":"523908d5-4c62-406f-b89e-789e76b7d052","resolution":{"observed_at":"2026-08-02T11:01:16.526678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:16.586810Z","title":"MemoryArena : Benchmarking agent memory in interdependent multi-session agentic tasks","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:16.586810Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:d6be8902355100ff52c3dfaa2a0065177a9556ef4ca097d170d3bff13a615b3a","observation_id":"bbbc256e-5fc9-4eeb-98af-6044ee01f9b1","resolution":{"observed_at":"2026-08-02T11:01:16.586810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:16.646172Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:16.646172Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:01ba0006884e4fec886219c8718764fa87044160ea7065ffc22f2e9982487a4e","observation_id":"8fb8a7a7-f17d-4b72-bb0b-9cc94f186707","resolution":{"observed_at":"2026-08-02T11:01:16.646172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:16.728299Z","title":"RULER : What's the real context size of your long-context language models? In COLM, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:16.728299Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:adf9aa857af555eca699b36c7bf49e4b4955fb0c5dbc13a4c1ce60ea935b896e","observation_id":"62e985e2-5550-4e14-85b2-b6ae95bc3a44","resolution":{"observed_at":"2026-08-02T11:01:16.728299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:16.945575Z","title":"Evaluating memory in LLM agents via incremental multi-turn interactions","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:16.945575Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:8ed226bfb549d862ec3aaeaacd0dc61109c6a9e16d231cf125755a5a67678602","observation_id":"24ef1de7-afb4-47da-84c2-6b2e0a8014fb","resolution":{"observed_at":"2026-08-02T11:01:16.945575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:17.004141Z","title":"SWE-bench : Can language models resolve real-world GitHub issues? In ICLR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:17.004141Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:469c174092d5fc7f4b8c51358539cd021ee5318e1d1b57cd9550c350abf5b1d0","observation_id":"f826748a-302d-4339-80f7-81972f0c5aa9","resolution":{"observed_at":"2026-08-02T11:01:17.004141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:17.067032Z","title":"Prospect theory: An analysis of decision under risk","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:17.067032Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:a6b5d6b98a74d61b0d6288145329a7221ead9e460240357c5c2b27ce616ad9c2","observation_id":"a308ff0b-a033-46bf-abd4-8075ae5ab811","resolution":{"observed_at":"2026-08-02T11:01:17.067032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:17.120321Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:17.120321Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:bf9de515ba58e45128e00af64ee5edcc3309ce5932e96738bd95f9dac3fb9c27","observation_id":"a99994b1-0ecf-4d18-bfe9-25ddd6463d8f","resolution":{"observed_at":"2026-08-02T11:01:17.120321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:17.200167Z","title":"In-context reinforcement learning with algorithm distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:17.200167Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:e9351d8fbff43f1166391d38fb47bbaec9070de8fa81bdec193f0ce9eaf54213","observation_id":"e8632933-1e5e-4f2b-84f4-3791dba12689","resolution":{"observed_at":"2026-08-02T11:01:17.200167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:17.277898Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:17.277898Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:19038b153cb4c1edc1032867f8f5bf4335867ed420a97ab49dac0255625ac5b7","observation_id":"eb43a0c1-c50f-40ff-8db6-d87df085f72f","resolution":{"observed_at":"2026-08-02T11:01:17.277898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:17.312153Z","title":"AgentBench : Evaluating LLMs as agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:17.312153Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:a8588794ab5170e105b873a9d428ff1bdc3f781abf960d89b9a3cb63328a50be","observation_id":"854d62f6-3627-4ed2-a276-6eecbc0114d2","resolution":{"observed_at":"2026-08-02T11:01:17.312153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:17.399266Z","title":"Fung, Chun Yuan, and Li Shen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:17.399266Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:55d3931c4a9541c0bb624a3246a7fc458e0e976f469010d2aa7fdb4574b22944","observation_id":"1083307d-398f-4963-b8b0-6d288c996123","resolution":{"observed_at":"2026-08-02T11:01:17.399266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:17.488082Z","title":"AgentBoard : An analytical evaluation board of multi-turn LLM agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:17.488082Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:e8de5f0b9c36dc5adc8d88d17738f62fac57727442d07c3fbfe75d044102230d","observation_id":"9bdd9ada-030f-429f-a388-e0dd3a5743c3","resolution":{"observed_at":"2026-08-02T11:01:17.488082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:17.662371Z","title":null,"venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:17.662371Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:f951fd622818566dd366439f26586b7ac3a312362b05783c1534d63396049fcb","observation_id":"f0372826-4e86-4100-9080-54469957039e","resolution":{"observed_at":"2026-08-02T11:01:17.662371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:17.814841Z","title":"GAIA : A benchmark for general AI assistants","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:17.814841Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:45b3afba688da0ca6071f4fff4d9594aadb447626ca3dcce1b2daabc9f590647","observation_id":"2c4e665f-57a8-4de9-a25b-994023688c5e","resolution":{"observed_at":"2026-08-02T11:01:17.814841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:17.953272Z","title":"SWE-Lancer : Can frontier LLMs earn \\ 1 million from real-world freelance software engineering? In ICML, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:17.953272Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:734d91432a368e515ebce92bcbdf9f1f0887cf0584a586cf563984cab38989ad","observation_id":"3e6f6d4f-86c8-44da-bd3c-9c05d3c33a75","resolution":{"observed_at":"2026-08-02T11:01:17.953272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:18.065780Z","title":"LLMs are in-context bandit reinforcement learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:18.065780Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:95353e148ebd4a362b038fa5d60e7a17d1ad4630855519494facfb1d4d1f70ab","observation_id":"35e02d1e-06f7-41f2-971d-a8d6c7eb898a","resolution":{"observed_at":"2026-08-02T11:01:18.065780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:18.133474Z","title":"Monopoly and product quality","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:18.133474Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:eda07b51f49ef3d1b0257e7d681984be137338fd16f9f087de1a157881193b62","observation_id":"238a1fe3-5d84-4215-81b1-50da710a0d46","resolution":{"observed_at":"2026-08-02T11:01:18.133474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:18.189853Z","title":null,"venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:18.189853Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:5ffa50a53a8c79b88b47232d10aa6c762e7e0b309b82a036eb36d00b5de9ccff","observation_id":"70e21c99-18db-4b4b-b65f-68f68eecf601","resolution":{"observed_at":"2026-08-02T11:01:18.189853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:18.294544Z","title":null,"venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:18.294544Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:2700d71c00134084881952c1223019bc1c1c420c72022657412e08808056461d","observation_id":"2c65afb4-82cd-46d9-ac40-69234894b59a","resolution":{"observed_at":"2026-08-02T11:01:18.294544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:18.419131Z","title":"Codex cli","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:18.419131Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:cb08fc8bc965f469310493d683912926931ea4203298452c2d36b7ac1977ffdf","observation_id":"73f4677f-18d2-4c22-8428-dbe72d5eb77c","resolution":{"observed_at":"2026-08-02T11:01:18.419131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:18.532370Z","title":"Opencode: The open source ai coding agent","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:18.532370Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:2c2135fd67b350c975d669c188e69939b100f5b8bd3e012a76ba0ed2e317c419","observation_id":"bd0f5185-d516-47e9-b0c3-30c53cb92f62","resolution":{"observed_at":"2026-08-02T11:01:18.532370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:18.642907Z","title":"Patil, Huanzhi Mao, Fanjia Yan, Charlie Cheng-Jie Ji, Vishnu Suresh, Ion Stoica, and Joseph E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:18.642907Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:31faf6c128d03fdaa65040b25bb536e33086bcac0ec7147ce318e3305d2a7269","observation_id":"d5aa51e8-7ffe-4eca-b85c-2219a0cc6005","resolution":{"observed_at":"2026-08-02T11:01:18.642907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04374","last_updated":"2025-10-05T21:36:43Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T21:36:43Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04374","snapshot_observed_at":"2026-08-02T11:01:18.746468Z","title":"Kim, Patrick Chao, Samuel Miserendino, Gildas Chabot, David Li, Michael Sharman, Alexandra Barr, Amelia Glaese, Jerry Tworek, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:18.746468Z"},"links":{"cited_paper":"/paper/2510.04374","citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:b330128f36ab949c71ad254e72ddb865f495a5ffbce17cc6e5fda3a961f9e91a","observation_id":"a6d26ff4-4eba-453b-adda-7664d72bd22e","resolution":{"observed_at":"2026-08-02T11:01:18.746468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:18.845752Z","title":"AccountingBench : Evaluating LLMs on real long-horizon business tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:18.845752Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:bc0c8d9a8cb6e78f9dd0b24ea33227a5ff7e78e6bb5ee1ae5ad306d15ede9266","observation_id":"511bdb01-c132-4814-9a0e-bf2e90593ab6","resolution":{"observed_at":"2026-08-02T11:01:18.845752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:18.967131Z","title":"Pi documentation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:18.967131Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:53dafa808f235e38a4f9aea9f530ac5c6784f2279293ba552fe5025518af6807","observation_id":"d8510299-f776-4312-8ee7-0704eab3fd16","resolution":{"observed_at":"2026-08-02T11:01:18.967131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:19.158535Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:19.158535Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:1aaf82d6889c0689134fd00bb8a27a033701f9beffa155a141c1cab974ad3360","observation_id":"1a9d7978-c028-4f1a-9344-1bd6d9d2de51","resolution":{"observed_at":"2026-08-02T11:01:19.158535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:19.287222Z","title":null,"venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:19.287222Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:80f95fe8bea68ce38d48d29ccdd846f0d02647ef29951fb1ce1e74ab9ee72a1e","observation_id":"ad7e2657-ce5f-4e08-9353-7cacf7e092e1","resolution":{"observed_at":"2026-08-02T11:01:19.287222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:19.423697Z","title":"Brown, Adam Santoro, Aditya Gupta, Adri \\`a Garriga-Alonso, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:19.423697Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:cf472504a28895cb898e14bb20672aa42dc7ef13ba48732a931b6645d979ac83","observation_id":"003f865d-1816-4de2-91d5-9fbec79417b3","resolution":{"observed_at":"2026-08-02T11:01:19.423697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-02T11:01:19.550132Z","title":"PaperBench : Evaluating AI 's ability to replicate AI research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:19.550132Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:ee3b74e8f5e4bcae9d5496c0227235035d4f91168ee266fcb511478f55fae8f9","observation_id":"f89ac7ef-4e0c-45e3-8b49-535dd0b668e1","resolution":{"observed_at":"2026-08-02T11:01:19.550132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:19.762252Z","title":"Testing for mean reversion in processes of Ornstein--Uhlenbeck type","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:19.762252Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:2a5d445cfe23b6716d32c127f1f9559bd44249350b2d509c33b3613cfc211100","observation_id":"a84da436-ee31-4581-ae0c-54f4f70392b2","resolution":{"observed_at":"2026-08-02T11:01:19.762252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:19.955347Z","title":"Teece, Gary Pisano, and Amy Shuen","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:19.955347Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:03cc9e83afee61fb4822846276032181da98b498bb048827d1a8f7a0e680c030","observation_id":"91c0460a-ac62-45b5-9d5d-e24c88489da9","resolution":{"observed_at":"2026-08-02T11:01:19.955347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:20.179108Z","title":"AppWorld : A controllable world of apps and people for benchmarking interactive coding agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:20.179108Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:d8318b16c00ca7a234568c5b0d497688a198fc82116d9fe53f2aea07cb1e1003","observation_id":"f05f4a23-8121-4b52-9520-16b05542753e","resolution":{"observed_at":"2026-08-02T11:01:20.179108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:20.302082Z","title":"Uhlenbeck and Leonard S","venue":null,"work_id":null,"year":1930},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:20.302082Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:5120ef049088a8e0a1ac0b3459bebd634104a922e83df9846844dd8fa277c605","observation_id":"e9720f86-773c-4235-8f0e-96c245658cfb","resolution":{"observed_at":"2026-08-02T11:01:20.302082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-08-06T17:04:47.204008Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-08-02T11:01:20.504958Z","title":"OdysseyBench : Evaluating LLM agents on long-horizon complex office application workflows","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:20.504958Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:f9345b5e00364b874af9d2e64c8c0ce81158e26e3a458d3aed040cb3a2b94672","observation_id":"f8e0eeee-4f78-4a5a-94ab-21a3e66e5da5","resolution":{"observed_at":"2026-08-02T11:01:20.504958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06762","last_updated":"2023-10-10T16:38:49Z","snapshot_observed_at":"2026-08-13T05:52:51.911336Z","submitted_at":"2023-10-10T16:38:49Z","title":"TRACE: A Comprehensive Benchmark for Continual Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06762","snapshot_observed_at":"2026-08-02T11:01:20.674778Z","title":"TRACE : A comprehensive benchmark for continual learning in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:20.674778Z"},"links":{"cited_paper":"/paper/2310.06762","citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:ea12ba61c3022b061fcbcf05ebcd8d21e9dc4173fc967552388e26b90c34fdf1","observation_id":"30248c63-19bc-41f6-a4bc-daa595ee7885","resolution":{"observed_at":"2026-08-02T11:01:20.674778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:20.868340Z","title":"LongMemEval : Benchmarking chat assistants on long-term interactive memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:20.868340Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:8edfe817cb83c4d1755ebc1998dca31a8ca169d36812336e391602dc0184667e","observation_id":"5380880c-f308-499b-8c5b-ca3f9390dc96","resolution":{"observed_at":"2026-08-02T11:01:20.868340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:21.067223Z","title":"Mitchell, and Yuanzhi Li","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:21.067223Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:fa02d4b856bc9ba1c5470294f4a22a97b08f8e74fbb8feed1588d3d2239cd276","observation_id":"ca89e086-9de7-4f2f-a0e6-47e034abbec6","resolution":{"observed_at":"2026-08-02T11:01:21.067223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:21.197481Z","title":"TravelPlanner : A benchmark for real-world planning with language agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:21.197481Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:40c58e9300fb70848015e0342db5d2b29b7c9490fbb8daa8cd5509819c125486","observation_id":"555277b5-5a48-488f-bd32-9c808d8f9ea8","resolution":{"observed_at":"2026-08-02T11:01:21.197481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:21.252122Z","title":"OSWorld : Benchmarking multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:21.252122Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:a0c622869c71f3fca076965ea635fb6cd48e83aa3e8daed86f8ed287c339389c","observation_id":"3c8cd380-346f-4a1c-bf55-8d1c67e6583d","resolution":{"observed_at":"2026-08-02T11:01:21.252122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:21.320261Z","title":"Xu, Yufan Song, Boxuan Li, Yuxuan Tang, Kritanjali Jain, Mengxue Bao, Zora Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:21.320261Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:5674d5038828b1066bf137e496f350c25ac109cb069e6a06e398822e25d6c29d","observation_id":"5c1fa3c7-078e-49b3-8a59-39c2de8f6100","resolution":{"observed_at":"2026-08-02T11:01:21.320261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:21.409635Z","title":"-bench: A benchmark for tool-agent-user interaction in real-world domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:21.409635Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:e16f19674a54d6e6e09c6030fd8d9686dd31acf667ce38090560dc0ba081cf9d","observation_id":"531f8473-1492-4cb7-8c10-9f9578ab3e8b","resolution":{"observed_at":"2026-08-02T11:01:21.409635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:21.519125Z","title":"AssistantBench : Can web agents solve realistic and time-consuming tasks? In EMNLP, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:21.519125Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:25ab7aeae59c87c488b5f0a33e44acf39854160a0ccc43cc66b172cc0a2961e8","observation_id":"6999fc5c-48f3-46e0-ade9-67cc96802d2d","resolution":{"observed_at":"2026-08-02T11:01:21.519125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:01:21.667271Z","title":"WebArena : A realistic web environment for building autonomous agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:21.667271Z"},"links":{"citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:05bcec6b812ddc085c73aa0d9396f7f5a13d7e24f025908a0cfc40a196d19e1b","observation_id":"695d8ff8-7116-461e-856f-49466b9276d4","resolution":{"observed_at":"2026-08-02T11:01:21.667271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T11:07:46.747541Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 2 inbound Pith citation observations for arXiv:2606.18543."}