{"as_of":"2026-08-08T01:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f0b85dc2c71fea97be1faed04bb13ca5963a1dc61073c69a77b1858684c49575","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:34:34.819687Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2410.09024","last_updated":"2025-04-18T14:30:31Z","snapshot_observed_at":"2026-08-02T12:38:54.249632Z","submitted_at":"2024-10-11T17:39:22Z","title":"AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-14T01:35:50.992477Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2410.09024"},"observation_digest":"sha256:4391c14794928897be31345e2760db8125bdd369361a724a7a5918f795be1737","observation_id":"0ad1fd50-ca3d-45cd-9304-6f5c1a5f1f4f","resolution":{"observed_at":"2026-05-14T01:35:51.215921Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2503.23278","last_updated":"2025-10-07T07:13:32Z","snapshot_observed_at":"2026-07-06T21:00:55.979837Z","submitted_at":"2025-03-30T01:58:22Z","title":"Model Context Protocol (MCP): Landscape, Security Threats, and Future Research Directions","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T09:02:40.294491Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2503.23278"},"observation_digest":"sha256:a312322491f337277d317b2d23c09a09916283c6f39847d1f2b4ee05190f8145","observation_id":"9602fd78-0b64-4afa-9e40-bb39925730e3","resolution":{"observed_at":"2026-05-13T09:02:40.376710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-07T14:34:34.819687Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation benchmark for llm tool use capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18471","last_updated":"2025-05-24T02:26:49Z","snapshot_observed_at":"2026-08-07T21:54:09.971572Z","submitted_at":"2025-05-24T02:26:49Z","title":"Invisible Tokens, Visible Bills: The Urgent Need to Audit Hidden Operations in Opaque LLM Services","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:34.819687Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2505.18471"},"observation_digest":"sha256:f2a43bb9de65563047c6f8e5e63b55e05024cd70e8a4cd91df7020a56df65c81","observation_id":"dbd88b35-1cd6-4f4d-a67a-46f92a7aa064","resolution":{"observed_at":"2026-08-07T14:34:34.819687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-07T14:12:01.284289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19683","last_updated":"2025-05-26T08:44:53Z","snapshot_observed_at":"2026-08-07T14:06:07.358887Z","submitted_at":"2025-05-26T08:44:53Z","title":"Large Language Models for Planning: A Comprehensive and Systematic Survey","version":1},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:01.284289Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2505.19683"},"observation_digest":"sha256:d442ae11a4d5b5ee61691ea79b2b1d94b427568cdbe66257fc74c9d8ede7166a","observation_id":"55ff60d1-758d-4466-8142-ea7b84b5ab8c","resolution":{"observed_at":"2026-08-07T14:12:01.284289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-07T11:36:38.571897Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01859","last_updated":"2025-06-02T16:48:11Z","snapshot_observed_at":"2026-08-07T23:24:20.735513Z","submitted_at":"2025-06-02T16:48:11Z","title":"CONFETTI: Conversational Function-Calling Evaluation Through Turn-Level Interactions","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:36:38.571897Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2506.01859"},"observation_digest":"sha256:99db99d76d11f5ba99c656ef5d97a6eafc32dcd730d4e372026ef2f50c88070e","observation_id":"cd43e93d-4be5-4004-9d58-f5834c6c6f73","resolution":{"observed_at":"2026-08-07T11:36:38.571897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T07:52:17.174347Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2506.07982"},"observation_digest":"sha256:04696143cf41625be804c062a9fd3bd6ea40dee4c80f7f0d36bde7a05b82acc9","observation_id":"f533e183-3092-407c-839d-ffecd6c4733d","resolution":{"observed_at":"2026-05-12T07:52:17.432112Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-07T06:00:19.628526Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation benchmark for llm tool use capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11102","last_updated":"2025-06-06T17:52:18Z","snapshot_observed_at":"2026-08-07T05:54:56.593167Z","submitted_at":"2025-06-06T17:52:18Z","title":"Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey","version":1},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:19.628526Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2506.11102"},"observation_digest":"sha256:58ac80406b309a61eb493ab2ecebccdde82e29bb44cd0c4bec31dec7f521ed48","observation_id":"546c32d9-a530-4dc0-9c0d-1bde942dbe87","resolution":{"observed_at":"2026-08-07T06:00:19.628526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T23:26:54.497019Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation benchmark for llm tool use capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18019","last_updated":"2025-07-04T14:29:40Z","snapshot_observed_at":"2026-08-07T07:31:09.988028Z","submitted_at":"2025-06-22T12:59:12Z","title":"Graphs Meet AI Agents: Taxonomy, Progress, and Future Opportunities","version":3},"reference_index":216,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:54.497019Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2506.18019"},"observation_digest":"sha256:0bdc1faf78a8b5476b50f3c68bd9f982ff5591ba36afcc62e15a3f08944cfc12","observation_id":"90fb7440-f45f-4f79-b44e-d8638061cfa0","resolution":{"observed_at":"2026-08-06T23:26:54.497019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T21:48:47.975577Z","title":"arXiv preprint arXiv:2408.04682","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23394","last_updated":"2025-06-29T20:47:27Z","snapshot_observed_at":"2026-08-07T20:47:43.953021Z","submitted_at":"2025-06-29T20:47:27Z","title":"Teaching a Language Model to Speak the Language of Tools","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:48:47.975577Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2506.23394"},"observation_digest":"sha256:05ad08c6d221cd7fcbd01b400ae57a4ee0cd1901612e46e9233b6a746a93e58f","observation_id":"4e5ac1d4-53b1-4a8f-881b-74a20ced8816","resolution":{"observed_at":"2026-08-06T21:48:47.975577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T16:26:58.622125Z","title":"Fanxu Meng, Zhaohui Wang, and Muhan Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13575","last_updated":"2025-08-27T16:34:47Z","snapshot_observed_at":"2026-08-06T16:19:23.253511Z","submitted_at":"2025-07-17T23:37:19Z","title":"Apple Intelligence Foundation Language Models: Tech Report 2025","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:26:58.622125Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2507.13575"},"observation_digest":"sha256:919e94d1015eae83733764cff639c341cf26d396d5ed49aa489123dca7f720f3","observation_id":"9c5b7e91-0ef3-44f7-ba03-612cb3886353","resolution":{"observed_at":"2026-08-06T16:26:58.622125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T15:39:57.418255Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15296","last_updated":"2025-07-21T06:55:37Z","snapshot_observed_at":"2026-08-06T15:33:04.507427Z","submitted_at":"2025-07-21T06:55:37Z","title":"Butterfly Effects in Toolchains: A Comprehensive Analysis of Failed Parameter Filling in LLM Tool-Agent Systems","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:39:57.418255Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2507.15296"},"observation_digest":"sha256:13c2fd0da0e687cccf93f3d8659b4b10e5f96cb7c2a1da14a6ba322515e9e92e","observation_id":"2065dfca-4776-4ec4-b6fd-34ad20d7434b","resolution":{"observed_at":"2026-08-06T15:39:57.418255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T15:34:30.254612Z","title":"Harsh Jhamtani, Hao Fang, Patrick Xia, Eran Levy, Ja- cob Andreas, and Ben Van Durme","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15501","last_updated":"2025-07-21T11:07:05Z","snapshot_observed_at":"2026-08-06T15:28:09.314982Z","submitted_at":"2025-07-21T11:07:05Z","title":"ASPERA: A Simulated Environment to Evaluate Planning for Complex Action Execution","version":1},"reference_index":4976,"source":"pdf_text","source_observed_at":"2026-08-06T15:34:30.254612Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2507.15501"},"observation_digest":"sha256:e36bf10089198a5ca9c01f4e51d179708ab19a9200b3417727d39bf923278a19","observation_id":"17b85ac1-5fe6-4332-a284-bd791f769b3d","resolution":{"observed_at":"2026-08-06T15:34:30.254612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T14:57:06.486170Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities, August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17257","last_updated":"2025-07-23T06:56:15Z","snapshot_observed_at":"2026-08-06T18:04:24.113657Z","submitted_at":"2025-07-23T06:56:15Z","title":"Agent Identity Evals: Measuring Agentic Identity","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:57:06.486170Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2507.17257"},"observation_digest":"sha256:98c6b13838621bea9b9e9e8799edeac48298616fb132c347569c3ae53226d673","observation_id":"8985ac9c-af6b-44df-94c6-5f026bf80eae","resolution":{"observed_at":"2026-08-06T14:57:06.486170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:f5f12f43a5b7384e6f43e649f365c5c8b17a32496510eed3311b60880839a932","observation_id":"384f4a7a-5d99-4c71-ad96-646df71eaa06","resolution":{"observed_at":"2026-05-14T22:23:15.733725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T12:09:26.408309Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22034","last_updated":"2025-07-29T17:34:12Z","snapshot_observed_at":"2026-08-07T20:29:47.386254Z","submitted_at":"2025-07-29T17:34:12Z","title":"UserBench: An Interactive Gym Environment for User-Centric Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T12:09:26.408309Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2507.22034"},"observation_digest":"sha256:fe7e9bdd8ef6e7ebe5004411dbab72a3ddfd3e7c75fbddd6942970b68a1d957d","observation_id":"32adb8cd-f031-49ee-82e3-dc87d140ae16","resolution":{"observed_at":"2026-08-06T12:09:26.408309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T17:57:28.102393Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15456","last_updated":"2025-08-21T11:22:57Z","snapshot_observed_at":"2026-08-05T17:57:25.594068Z","submitted_at":"2025-08-21T11:22:57Z","title":"PyTOD: Programmable Task-Oriented Dialogue with Execution Feedback","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T17:57:28.102393Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2508.15456"},"observation_digest":"sha256:2a9dd355383eefbb0b8c48a6ab6a77ea3c30bb5ed976ef7ee342d92365cd271b","observation_id":"96b63d17-0dd0-4f62-96de-03c8dc107cf8","resolution":{"observed_at":"2026-08-05T17:57:28.102393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T14:49:00.685400Z","title":"arXiv preprint arXiv:2408.04682","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20931","last_updated":"2025-09-01T18:05:06Z","snapshot_observed_at":"2026-08-06T12:07:20.093124Z","submitted_at":"2025-08-28T15:57:33Z","title":"How Can Input Reformulation Improve Tool Usage Accuracy in a Complex Dynamic Environment? A Study on $\\tau$-bench","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:49:00.685400Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2508.20931"},"observation_digest":"sha256:15917f16d5a0c7ce373221c6dd0110f27e5625a1e111c62a2e7a47e302667feb","observation_id":"dcde5d88-8512-4bb9-bea9-bbb2d01f6287","resolution":{"observed_at":"2026-08-05T14:49:00.685400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2510.07043","last_updated":"2026-04-16T19:10:44Z","snapshot_observed_at":"2026-08-02T21:31:45.999075Z","submitted_at":"2025-10-08T14:09:46Z","title":"COMPASS: Benchmarking Constrained Optimization in LLM Agents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T08:45:11.334594Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2510.07043"},"observation_digest":"sha256:549259ac16d3015285a2822338b18bd018a79530c2757bb98389b67440c5c779","observation_id":"2acc08f8-df26-4463-b47c-75c18ec09782","resolution":{"observed_at":"2026-05-18T08:46:07.880209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-03T18:03:37.341452Z","title":"Controlllm: Augment language models with tools by searching on graphs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.07287","last_updated":"2026-06-28T11:58:42Z","snapshot_observed_at":"2026-08-05T13:20:26.960914Z","submitted_at":"2025-12-08T08:27:24Z","title":"Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T18:03:37.341452Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2512.07287"},"observation_digest":"sha256:08e37c98fccf08273cc8ecb47d48f7badd2e2b8c9160d3b4eb961808476d70a8","observation_id":"cdcb1055-214e-49e5-9335-e7073b300fa1","resolution":{"observed_at":"2026-08-03T18:03:37.341452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-03T14:20:31.274272Z","title":"Toolsand- box: A stateful, conversational, interactive evaluation benchmark for llm tool use capabilities.arXiv preprint arXiv:2408.04682,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20957","last_updated":"2026-05-26T05:07:52Z","snapshot_observed_at":"2026-08-03T18:14:05.259857Z","submitted_at":"2025-12-24T05:27:53Z","title":"One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T14:20:31.274272Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2512.20957"},"observation_digest":"sha256:3bb94c3581e469ab62d565531a5687c46686685642199e9be96a93dc564d45bd","observation_id":"cbc00d68-b687-49dd-93f7-3e8128ef1c4f","resolution":{"observed_at":"2026-08-03T14:20:31.274272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-02T21:46:33.312636Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation bench- mark for llm tool use capabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19218","last_updated":"2026-06-09T15:02:00Z","snapshot_observed_at":"2026-08-05T17:29:43.215311Z","submitted_at":"2026-02-22T15:02:00Z","title":"Gecko: A Simulation Environment with Stateful Feedback for Refining Agent Tool Calls","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T21:46:33.312636Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2602.19218"},"observation_digest":"sha256:ce2b838c479ca21f7fd01f86951b5ea7c710337d2581f0e002f7faeb13f0c606","observation_id":"7671de91-1088-487d-ae66-8bcdfc4e3373","resolution":{"observed_at":"2026-08-02T21:46:33.312636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-04T05:51:29.394088Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation benchmark for llm tool use capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11245","last_updated":"2026-07-31T22:23:28Z","snapshot_observed_at":"2026-08-06T23:11:00.598771Z","submitted_at":"2026-03-11T19:12:31Z","title":"Mind the Sim2Real Gap in User Simulation for Agentic Tasks","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T05:51:29.394088Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2603.11245"},"observation_digest":"sha256:fcd54003be722f66f24bedc56cc1c3fdc584a1243726c3ef532a0adf4b1fb641","observation_id":"1e99cad8-ad5f-4498-af27-6b33117f8164","resolution":{"observed_at":"2026-08-04T05:51:29.394088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2603.14987","last_updated":"2026-05-21T06:24:06Z","snapshot_observed_at":"2026-08-03T21:30:30.993382Z","submitted_at":"2026-03-16T08:51:33Z","title":"Beyond Benchmark Islands: Toward Representative Trustworthiness Evaluation for Agentic AI","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T10:19:56.003219Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2603.14987"},"observation_digest":"sha256:7c74a008baf46167fe41043cde996846c093c5a9929eb3e9126f992c9ff22994","observation_id":"303b2907-089e-4a5c-b292-3012610353e9","resolution":{"observed_at":"2026-05-22T10:21:23.276299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-07-13T09:29:51.204678Z","title":"Kevin Lu and Thinking Machines Lab","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.05333","last_updated":"2026-05-27T08:01:13Z","snapshot_observed_at":"2026-07-13T09:29:44.671622Z","submitted_at":"2026-04-07T02:09:11Z","title":"Graph-of-Skills: Dependency-Aware Structural Retrieval for Massive Agent Skills","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T09:29:51.204678Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2604.05333"},"observation_digest":"sha256:397b4653e6589c0af952214a16c3716c95f9f712aa305266ac38d98f921df057","observation_id":"f512d45f-3c96-4cc1-8cb9-a12791cb8bc4","resolution":{"observed_at":"2026-07-13T09:29:51.204678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2604.12116","last_updated":"2026-05-24T06:41:18Z","snapshot_observed_at":"2026-08-02T05:40:32.176239Z","submitted_at":"2026-04-13T22:50:21Z","title":"The A-R Behavioral Space: Execution-Level Profiling of Tool-Using Language Model Agents in Organizational Deployment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:26.128263Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2604.12116"},"observation_digest":"sha256:fe065a31b27a52e41afab20647ea6288576a48287dacabef8853a90086129da9","observation_id":"b64fd55d-3560-4fae-b973-1d1382b4c779","resolution":{"observed_at":"2026-05-11T10:41:02.948205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-07-12T21:35:10.173253Z","title":"Available: http://arxiv.org/abs/2408.04682","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.12116","last_updated":"2026-05-24T06:41:18Z","snapshot_observed_at":"2026-08-02T05:40:32.176239Z","submitted_at":"2026-04-13T22:50:21Z","title":"The A-R Behavioral Space: Execution-Level Profiling of Tool-Using Language Model Agents in Organizational Deployment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T21:35:10.173253Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2604.12116"},"observation_digest":"sha256:5ffbb7cd7b330451a5d5664ed3932ba997afe20aa31b6ae993e1db41103f31b3","observation_id":"cb9d7391-7d34-42db-a282-a7f59a02b766","resolution":{"observed_at":"2026-07-12T21:35:10.173253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2604.25318","last_updated":"2026-04-28T07:28:14Z","snapshot_observed_at":"2026-08-01T08:58:27.586129Z","submitted_at":"2026-04-28T07:28:14Z","title":"Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T14:01:23.894966Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2604.25318"},"observation_digest":"sha256:7c9ea8cb16c4c7e59c49e9a7ba5ab84d3c47cc4ea6acf2ab94cea58aeda65c1d","observation_id":"a9d309d2-bd28-4d6d-b504-e79a0a1ae000","resolution":{"observed_at":"2026-05-12T08:41:25.973584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:28.114140Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:3583d8208d123a14f8e50a8e9e774f882353ca4aa6bdec6c47406a7e66788c0c","observation_id":"78643d9a-d7a8-4f1b-9013-46192bceb7f3","resolution":{"observed_at":"2026-05-22T05:51:07.975780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-25T06:05:27.736494Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:9b7e5eea309cb4232593834bf30ff08c4989fcee6eff682c22ce3c3b418079df","observation_id":"bf0365b3-03c4-4603-84ae-bfa4a8c932e4","resolution":{"observed_at":"2026-05-25T06:06:43.057004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2605.27141","last_updated":"2026-05-26T15:07:38Z","snapshot_observed_at":"2026-07-06T23:36:53.330986Z","submitted_at":"2026-05-26T15:07:38Z","title":"VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T17:10:02.936605Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2605.27141"},"observation_digest":"sha256:6e61abca87052acaca3fa24fa394020935206806fabbfcc524b13e505580439c","observation_id":"77ad442d-6a89-4507-8670-4154703a5604","resolution":{"observed_at":"2026-06-29T17:13:44.721016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2606.02965","last_updated":"2026-08-03T20:59:18Z","snapshot_observed_at":"2026-08-07T23:09:28.856830Z","submitted_at":"2026-06-01T23:52:56Z","title":"Designing for Doubt: The Case for Informed Abstention in Autonomous Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T14:03:02.703499Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2606.02965"},"observation_digest":"sha256:be49adc6e7f9cb16f4cbe16ccebf0424cbe7621b26af3956be1d3aad0fe633d8","observation_id":"5df495e5-804e-45c2-8469-186133156986","resolution":{"observed_at":"2026-07-01T23:46:23.684356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2606.18051","last_updated":"2026-06-16T15:27:55Z","snapshot_observed_at":"2026-08-07T03:31:46.971110Z","submitted_at":"2026-06-16T15:27:55Z","title":"Compositional Skill Routing for LLM Agents: Decompose, Retrieve, and Compose","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T00:37:50.570757Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2606.18051"},"observation_digest":"sha256:ed38df3c630a45b6aaa8564a9b587298ee72d04d03b0676f1bf489ea6660ed46","observation_id":"5fa44723-d6a5-4bca-a7d3-fb6e66293b35","resolution":{"observed_at":"2026-07-03T21:18:59.725697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2607.01465","last_updated":"2026-07-01T20:55:07Z","snapshot_observed_at":"2026-08-06T02:22:22.155881Z","submitted_at":"2026-07-01T20:55:07Z","title":"Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-03T20:18:07.134598Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2607.01465"},"observation_digest":"sha256:819f8c10fc85c52a8a31e94ac8b426ea1e98136ee450cac4d3f0bb39acf7969a","observation_id":"91ffc82a-47cf-4552-9eec-f94d765e5ebb","resolution":{"observed_at":"2026-07-03T20:18:55.533094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-02T07:36:53.348031Z","title":"ToolSandbox : A stateful, conversational, interactive evaluation benchmark for LLM tool use capabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-07T20:30:07.057546Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:53.348031Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:75a612cee2a50216b81a081aca903ae7ca45de43909c7c7a49b575a306a82f5c","observation_id":"29be73f0-dce0-478d-bf47-45b0d02832d4","resolution":{"observed_at":"2026-08-02T07:36:53.348031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-07T00:14:06.175548Z","title":"ToolSandbox: A stateful, conversational, interactive evaluation benchmark for LLM tool use capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02713","last_updated":"2026-08-03T17:59:58Z","snapshot_observed_at":"2026-08-07T23:09:56.055766Z","submitted_at":"2026-08-03T17:59:58Z","title":"Quo Vadis, World Modeling?","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:06.175548Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2608.02713"},"observation_digest":"sha256:92cea9c14f6bb14b6ec943849d2621f223f2ad7a43b6cdf35bb0d41e12511871","observation_id":"63af01f3-1fd4-4326-a9cd-47ddd31efa8f","resolution":{"observed_at":"2026-08-07T00:14:06.175548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T18:11:39.396840Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04719","last_updated":"2026-08-05T11:38:33Z","snapshot_observed_at":"2026-08-08T01:12:03.580129Z","submitted_at":"2026-08-05T11:38:33Z","title":"Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:11:39.396840Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2608.04719"},"observation_digest":"sha256:a25e5736fad6d9c5147405fbfcadc43fc57feea2435a29f5a9e6ecc83aaaf023","observation_id":"5eea9802-d3ed-463f-8f49-be91be9f9510","resolution":{"observed_at":"2026-08-06T18:11:39.396840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.04682/citation-record","integrity":"/paper/2408.04682/integrity","json":"/paper/2408.04682/citation-record.json","paper":"/paper/2408.04682"},"outbound":[],"paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 36 inbound Pith citation observations for arXiv:2408.04682."}