{"as_of":"2026-08-07T06:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb9f6addddf2164fb9406a37b19874eaf6a803229ef7dde71679b231f4cfd501","coverage":[{"denominator":143,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:44:21.813422Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T01:59:52.218232Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:27:56.022361Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2507.21504","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21504","snapshot_observed_at":"2026-07-03T10:27:56.022361Z","title":"Evaluation and benchmarking of LLM agents: A survey","venue":null,"work_id":"af80895a-d45c-407b-a5d7-872b1b97f735","year":2025},"citing_paper":{"arxiv_id":"2603.20380","last_updated":"2026-05-15T21:59:54Z","snapshot_observed_at":"2026-08-02T14:54:38.320669Z","submitted_at":"2026-03-20T18:00:09Z","title":"Herding CATs: ALARA for Agent Harness Engineering in Portable Composable Multi-Agent Teams","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T11:12:46.626382Z"},"links":{"cited_paper":"/paper/2507.21504","citing_paper":"/paper/2603.20380"},"observation_digest":"sha256:999f50b2db78afdf7476c7ea9d7bb651c3f162c1bb44929cab5d0887f5e5666f","observation_id":"502c01ef-29cc-448f-98a6-0fec0e76d9b2","resolution":{"observed_at":"2026-05-21T11:14:08.422394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2507.21504","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21504","snapshot_observed_at":"2026-07-03T10:27:56.022361Z","title":"Evaluation and benchmarking of LLM agents: A survey","venue":null,"work_id":"af80895a-d45c-407b-a5d7-872b1b97f735","year":2025},"citing_paper":{"arxiv_id":"2605.16282","last_updated":"2026-04-11T04:25:19Z","snapshot_observed_at":"2026-07-06T23:27:29.931962Z","submitted_at":"2026-04-11T04:25:19Z","title":"Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-21T01:42:55.693115Z"},"links":{"cited_paper":"/paper/2507.21504","citing_paper":"/paper/2605.16282"},"observation_digest":"sha256:8c6dddff093ff2bfb2e9c08cfee18aaf7bebb6097ecf460cd492668b3590dfa0","observation_id":"b79c7602-7f7c-4d27-a357-45e108c435fa","resolution":{"observed_at":"2026-05-21T01:43:56.680558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2507.21504","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21504","snapshot_observed_at":"2026-07-03T10:27:56.022361Z","title":"Evaluation and benchmarking of LLM agents: A survey","venue":null,"work_id":"af80895a-d45c-407b-a5d7-872b1b97f735","year":2025},"citing_paper":{"arxiv_id":"2605.16508","last_updated":"2026-05-15T18:05:21Z","snapshot_observed_at":"2026-08-03T01:50:34.102829Z","submitted_at":"2026-05-15T18:05:21Z","title":"The Scaling Laws of Skills in LLM Agent Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T18:10:08.737710Z"},"links":{"cited_paper":"/paper/2507.21504","citing_paper":"/paper/2605.16508"},"observation_digest":"sha256:e542ec87db0985124e3955238e9d2eb65369c54eea3daa47ec6e0ae0411483e9","observation_id":"83459fa1-372a-4927-952a-000830629ab0","resolution":{"observed_at":"2026-05-20T18:13:37.607891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2507.21504","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21504","snapshot_observed_at":"2026-07-03T10:27:56.022361Z","title":"Evaluation and benchmarking of LLM agents: A survey","venue":null,"work_id":"af80895a-d45c-407b-a5d7-872b1b97f735","year":2025},"citing_paper":{"arxiv_id":"2606.07805","last_updated":"2026-06-05T19:33:58Z","snapshot_observed_at":"2026-08-03T01:44:22.181409Z","submitted_at":"2026-06-05T19:33:58Z","title":"Beyond Goodhart's Law: A Dynamic Benchmark for Evaluating Compliance in Multi-Agent Systems","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T21:53:37.616447Z"},"links":{"cited_paper":"/paper/2507.21504","citing_paper":"/paper/2606.07805"},"observation_digest":"sha256:c99c08ffa4edd8486b3878efc15d2fcde5191656481efce4a76ba9e5b138090a","observation_id":"9e9ad036-2431-4c7d-a36a-e36b80b5c2d7","resolution":{"observed_at":"2026-07-02T17:47:17.744554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2507.21504","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21504","snapshot_observed_at":"2026-07-03T10:27:56.022361Z","title":"Evaluation and benchmarking of LLM agents: A survey","venue":null,"work_id":"af80895a-d45c-407b-a5d7-872b1b97f735","year":2025},"citing_paper":{"arxiv_id":"2606.11686","last_updated":"2026-06-10T05:55:13Z","snapshot_observed_at":"2026-07-06T23:50:44.713490Z","submitted_at":"2026-06-10T05:55:13Z","title":"Layer-Isolated Evaluation: Gating the Deterministic Scaffold of a Production LLM Agent with a No-LLM, Regression-Locked Test Harness","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T10:04:29.791558Z"},"links":{"cited_paper":"/paper/2507.21504","citing_paper":"/paper/2606.11686"},"observation_digest":"sha256:143df73841fe11c870473dd95897dc9b89f54b05937df09fb6a221e1765af840","observation_id":"b0fd8271-1371-4f80-9afb-b8ec1bb1dc4e","resolution":{"observed_at":"2026-07-03T10:27:56.024402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21504","snapshot_observed_at":"2026-07-12T01:59:52.218232Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03510","last_updated":"2026-07-03T17:37:10Z","snapshot_observed_at":"2026-08-06T15:36:16.441466Z","submitted_at":"2026-07-03T17:37:10Z","title":"CAGE-1: Control, Assurance, and Governance Evaluation for Enterprise Agentic AI","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:52.218232Z"},"links":{"cited_paper":"/paper/2507.21504","citing_paper":"/paper/2607.03510"},"observation_digest":"sha256:074e3ccfd4e2fa7e1b0e344a8f275d4749b90667bc248451eddb6146625f1101","observation_id":"6e863949-2b1e-4d52-90bb-120f43c84ea3","resolution":{"observed_at":"2026-07-12T01:59:52.218232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21504/citation-record","integrity":"/paper/2507.21504/integrity","json":"/paper/2507.21504/citation-record.json","paper":"/paper/2507.21504"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.482897Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.482897Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:03ed53eb7c3fc0f045aff175edbe91a7ec129461ae5d14bc89ef99e0294cea02","observation_id":"01cdcaa9-3927-49bf-beb2-97395950eaba","resolution":{"observed_at":"2026-08-06T12:44:21.482897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.486623Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.486623Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:93799b6508954e8eb5ef3a4d52a7727dc75171d8dc6a1ce3096fe3cfc18ea561","observation_id":"99349306-a237-44b4-b97b-f48a3ee2428a","resolution":{"observed_at":"2026-08-06T12:44:21.486623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.489909Z","title":"2024.Inspect AI: Framework for Large Language Model Evaluations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.489909Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:e71ef68f16876445fec39291b517056d0976a3dd47ae074cf1d491d26b2a76b2","observation_id":"d6b75862-6f1c-4a82-b403-cf6c41ea3fb6","resolution":{"observed_at":"2026-08-06T12:44:21.489909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.493073Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.493073Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:907ff777efc63edbf0e23d47d32785f167f473bae9a32e6efc40845ac581189e","observation_id":"3acd0a5f-50e6-42ab-b9c6-5501b546d41d","resolution":{"observed_at":"2026-08-06T12:44:21.493073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.495973Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.495973Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:1b2489f88beab63f23b67bb562bf66e2b17855375e98e9abfe1332e50677f418","observation_id":"a0183b9e-8c90-4431-93d2-6f8bc626cc76","resolution":{"observed_at":"2026-08-06T12:44:21.495973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01943","last_updated":"2024-06-04T03:54:53Z","snapshot_observed_at":"2026-07-06T18:24:52.604412Z","submitted_at":"2024-06-04T03:54:53Z","title":"Enhancing Trust in LLMs: Algorithms for Comparing and Interpreting LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01943","snapshot_observed_at":"2026-08-06T12:44:21.502718Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.502718Z"},"links":{"cited_paper":"/paper/2406.01943","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:b0571ee46f1c10204c7c3ce7a36c63cbbbcedabdca25b02c23f8cc33683c4f73","observation_id":"3e084299-b3f2-4353-8702-1ac4c1ff8a31","resolution":{"observed_at":"2026-08-06T12:44:21.502718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07201","last_updated":"2023-08-14T15:13:04Z","snapshot_observed_at":"2026-08-02T01:34:38.978920Z","submitted_at":"2023-08-14T15:13:04Z","title":"ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07201","snapshot_observed_at":"2026-08-06T12:44:21.506012Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.506012Z"},"links":{"cited_paper":"/paper/2308.07201","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:9704c9484a097449f9260e79834b906558d15253b6107bfdd5a88b26fdc254a8","observation_id":"f046b40a-e071-4cab-b409-b5d75cd66385","resolution":{"observed_at":"2026-08-06T12:44:21.506012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.509324Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.509324Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:03d707387b47cb9f17c787c5beff09501340efc1e6b04566b0ebb53fd7827db3","observation_id":"6b32d450-e913-47cb-8d89-384fcf71762e","resolution":{"observed_at":"2026-08-06T12:44:21.509324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.512128Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.512128Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:d8aaf6ee78fec11fcd914f0acf96b8222c2ead7be40a3b037363b2b5f8c38e18","observation_id":"e0ce98c8-6a51-450f-a48f-dfd9539403e7","resolution":{"observed_at":"2026-08-06T12:44:21.512128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.517960Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.517960Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:edd7d379572069b07da57b2006dede6e3a85a0bc386aafed3de2d8a58ea06938","observation_id":"a5fc4b80-d188-49ad-920f-98e5b6681c0a","resolution":{"observed_at":"2026-08-06T12:44:21.517960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-07-06T19:29:05.492290Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-06T12:44:21.520560Z","title":"Baker, Benjamin Burns, Daniel Adu-Ampratwum, Xuhui Huang, Xia Ning, Song Gao, Yu Su, and Huan Sun","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.520560Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:a5a1366e08be6e705130c91e64b8fc86fe10f9e80448aca9692dab906a12c9b8","observation_id":"2094d729-a247-4398-969c-1bfd1da0a94a","resolution":{"observed_at":"2026-08-06T12:44:21.520560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.523530Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.523530Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:e1a1f5d5581e806431eead9471f94028e3aebfcf0e6e68b74fb09c3a0bbe4563","observation_id":"724229a0-0d2e-477b-bc0a-f9fcc9135313","resolution":{"observed_at":"2026-08-06T12:44:21.523530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12784","last_updated":"2024-07-17T17:59:47Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:59:47Z","title":"AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12784","snapshot_observed_at":"2026-08-06T12:44:21.530025Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.530025Z"},"links":{"cited_paper":"/paper/2407.12784","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:19cfc408dbd77538640c1fe97080d00446ef9f4ac5142dfa420853a359252e41","observation_id":"33451500-2922-4100-8d9f-25563c283b73","resolution":{"observed_at":"2026-08-06T12:44:21.530025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05467","last_updated":"2025-02-28T16:02:27Z","snapshot_observed_at":"2026-08-06T15:44:08.375632Z","submitted_at":"2024-12-06T23:43:59Z","title":"The BrowserGym Ecosystem for Web Agent Research","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05467","snapshot_observed_at":"2026-08-06T12:44:21.532807Z","title":"Xu, Siva Reddy, Quentin Cappart, Graham Neubig, Ruslan Salakhutdinov, Nico- las Chapados, and Alexandre Lacoste","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.532807Z"},"links":{"cited_paper":"/paper/2412.05467","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:4f52c3a7825e3507a26f15f166e219108e5098ae4c37d76b32f359f323caf0cd","observation_id":"ae999c9c-d449-48de-a343-0099d907a1c3","resolution":{"observed_at":"2026-08-06T12:44:21.532807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14033","last_updated":"2024-01-15T03:18:25Z","snapshot_observed_at":"2026-07-06T17:06:37.369542Z","submitted_at":"2023-12-21T17:02:06Z","title":"T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14033","snapshot_observed_at":"2026-08-06T12:44:21.526623Z","title":"doi:10.48550/arXiv.2312.14033","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.526623Z"},"links":{"cited_paper":"/paper/2312.14033","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:062dcc16a4aeed9c32fec4d8ffe69dfbb0f20d0c37abfa97e74dc6c496dc81ea","observation_id":"af3d1478-45bd-4d65-b7e9-7e7899f8da05","resolution":{"observed_at":"2026-08-06T12:44:21.526623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08881","last_updated":"2025-05-16T13:05:27Z","snapshot_observed_at":"2026-07-06T19:49:57.384725Z","submitted_at":"2024-10-25T20:17:59Z","title":"Can We Trust AI Agents? A Case Study of an LLM-Based Multi-Agent System for Ethical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08881","snapshot_observed_at":"2026-08-06T12:44:21.538622Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.538622Z"},"links":{"cited_paper":"/paper/2411.08881","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:0893ab5c21ebfd9b51028227e631821f66bf8e1c7d3b6a25f5e8e6c2b57ce726","observation_id":"e3010720-da73-41a1-9bf6-9021a3d30020","resolution":{"observed_at":"2026-08-06T12:44:21.538622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13352","last_updated":"2024-11-24T22:04:23Z","snapshot_observed_at":"2026-07-06T18:33:32.806635Z","submitted_at":"2024-06-19T08:55:56Z","title":"AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13352","snapshot_observed_at":"2026-08-06T12:44:21.541517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.541517Z"},"links":{"cited_paper":"/paper/2406.13352","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:05f165f1792e49b610fbb977edc32a622a8b596fd178501db4584ee040f2c0b7","observation_id":"25d1dbed-283a-4454-84b1-19d51b7eb010","resolution":{"observed_at":"2026-08-06T12:44:21.541517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06613","last_updated":"2024-07-22T14:32:33Z","snapshot_observed_at":"2026-07-06T18:28:24.821865Z","submitted_at":"2024-06-07T00:28:43Z","title":"GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06613","snapshot_observed_at":"2026-08-06T12:44:21.535787Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.535787Z"},"links":{"cited_paper":"/paper/2406.06613","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:50f084af9f4b1eecaeeddd19994b4b55d7a12f1668432646ee251d7a796d4b5e","observation_id":"fd5e71eb-3fd5-4fc8-bee5-f08a2d330abe","resolution":{"observed_at":"2026-08-06T12:44:21.535787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.547500Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.547500Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:b0c1d0d6f362488ba37f77b3291e77faa8e8f91fc2a1b8742d1ebee194503128","observation_id":"f830591c-6c6c-4755-b8b5-a1772cfe8ebc","resolution":{"observed_at":"2026-08-06T12:44:21.547500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03568","last_updated":"2024-01-25T21:20:27Z","snapshot_observed_at":"2026-07-30T06:39:40.880794Z","submitted_at":"2024-01-07T19:11:18Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03568","snapshot_observed_at":"2026-08-06T12:44:21.553434Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.553434Z"},"links":{"cited_paper":"/paper/2401.03568","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:e5dca8454deb6400c9e5f17089a42ba042379107b8a7189b5c868aec6acd0508","observation_id":"93374fe1-760a-482a-98e8-9082b5f5cfd0","resolution":{"observed_at":"2026-08-06T12:44:21.553434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00993","last_updated":"2024-07-01T06:10:01Z","snapshot_observed_at":"2026-07-06T18:39:20.664293Z","submitted_at":"2024-07-01T06:10:01Z","title":"Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00993","snapshot_observed_at":"2026-08-06T12:44:21.544451Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.544451Z"},"links":{"cited_paper":"/paper/2407.00993","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:0446aa61e867ac77ed754abfb98f8e13569761cff224224e9100b11dc1a574da","observation_id":"33514e0b-4b21-431b-b16a-68848f3dad5e","resolution":{"observed_at":"2026-08-06T12:44:21.544451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08144","last_updated":"2024-04-17T04:34:39Z","snapshot_observed_at":"2026-08-02T04:29:28.130280Z","submitted_at":"2024-04-11T22:07:19Z","title":"LLM Agents can Autonomously Exploit One-day Vulnerabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08144","snapshot_observed_at":"2026-08-06T12:44:21.562169Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.562169Z"},"links":{"cited_paper":"/paper/2404.08144","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:498cc970e6ca015788bbeb0488ef4395442325fd1bc79dceccf7954dc4bd9fe8","observation_id":"8c2992d1-6232-476b-b113-711a9cbf67ba","resolution":{"observed_at":"2026-08-06T12:44:21.562169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01495","last_updated":"2025-05-07T05:01:14Z","snapshot_observed_at":"2026-07-06T18:24:34.736988Z","submitted_at":"2024-06-03T16:21:38Z","title":"Re-ReST: Reflection-Reinforced Self-Training for Language Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01495","snapshot_observed_at":"2026-08-06T12:44:21.550610Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.550610Z"},"links":{"cited_paper":"/paper/2406.01495","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:5e48711470913bf3b87e30e0844d7cdc081aa1d9bd64e850550783fb520fbb80","observation_id":"dac87e5d-7d37-4502-a571-c8eec1d99f71","resolution":{"observed_at":"2026-08-06T12:44:21.550610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.568290Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.568290Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:4a18cbb9b16bdabb9b5fbdfdbe55957af0a76fe2026ac31930eaf7e81ef8ac8f","observation_id":"8f11e5aa-5671-45f3-8e40-c48c16c85aec","resolution":{"observed_at":"2026-08-06T12:44:21.568290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.556360Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.556360Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:2eac565f8710adf983c40faea32a01c2850497b7c9ef4f050de9cd73530e037f","observation_id":"5f71b096-20f3-4f48-95de-22c4c408171b","resolution":{"observed_at":"2026-08-06T12:44:21.556360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15217","last_updated":"2025-04-28T05:09:12Z","snapshot_observed_at":"2026-08-05T02:02:34.574070Z","submitted_at":"2023-09-26T19:23:54Z","title":"Ragas: Automated Evaluation of Retrieval Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15217","snapshot_observed_at":"2026-08-06T12:44:21.559149Z","title":"arXiv:2309.15217 [cs.CL] https://arxiv.org/abs/2309.15217","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.559149Z"},"links":{"cited_paper":"/paper/2309.15217","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:5fed02925900320b68a8e44059f6765d83ecea36b3a5f2e591504ddbd5171052","observation_id":"0dd12506-e3ec-4b8b-bf1a-21442e31dc7d","resolution":{"observed_at":"2026-08-06T12:44:21.559149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-07-06T09:58:19.547859Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-06T12:44:21.577059Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.577059Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:33dd08247efda600f635e518450fed5d8612983a981eed470f52a16d4d8decea","observation_id":"98fbabe5-a8ae-4a36-b3a1-d6b09064913c","resolution":{"observed_at":"2026-08-06T12:44:21.577059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04468","last_updated":"2024-11-07T06:36:19Z","snapshot_observed_at":"2026-08-04T17:52:28.620519Z","submitted_at":"2024-11-07T06:36:19Z","title":"Magentic-One: A Generalist Multi-Agent System for Solving Complex Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04468","snapshot_observed_at":"2026-08-06T12:44:21.565142Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.565142Z"},"links":{"cited_paper":"/paper/2411.04468","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:135f32f9a8ab6f279dace16653d1525d5181d8b2eb2994fb0e11a1d8068f436d","observation_id":"11fba66a-4d87-4501-bf86-cb4f7ade44bc","resolution":{"observed_at":"2026-08-06T12:44:21.565142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.583195Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.583195Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:f42b0d29f1b0aaa33d1103bc19405d08b7dbd7442b0f03606f869c802ccece38","observation_id":"f4164373-270c-472f-a5c0-c1411bfdc6db","resolution":{"observed_at":"2026-08-06T12:44:21.583195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.570992Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.570992Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:77c8ffdd7380580a1c22f0d4701e78c3680d10094d2768ef801682dee25f0e17","observation_id":"45062438-4da3-4cff-adb6-6ce4ec281027","resolution":{"observed_at":"2026-08-06T12:44:21.570992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09523","last_updated":"2024-11-14T15:40:04Z","snapshot_observed_at":"2026-08-05T11:33:06.319013Z","submitted_at":"2024-11-14T15:40:04Z","title":"Navigating the Risks: A Survey of Security, Privacy, and Ethics Threats in LLM-Based Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09523","snapshot_observed_at":"2026-08-06T12:44:21.574030Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.574030Z"},"links":{"cited_paper":"/paper/2411.09523","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:73bed710ec834a13beb5772a7593a9e15f4561638c5196e73349cff1569a5eea","observation_id":"03ed874f-470c-43f2-a573-5a733ab8619a","resolution":{"observed_at":"2026-08-06T12:44:21.574030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01680","last_updated":"2024-04-19T01:15:16Z","snapshot_observed_at":"2026-08-06T19:10:15.466826Z","submitted_at":"2024-01-21T23:36:14Z","title":"Large Language Model based Multi-Agents: A Survey of Progress and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01680","snapshot_observed_at":"2026-08-06T12:44:21.591815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.591815Z"},"links":{"cited_paper":"/paper/2402.01680","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:2ae6a68556c633c227deffa0d74e8a73f75d7b80225ebc36e6ded580b711edfc","observation_id":"3be0e896-3a10-443f-9f86-725f2db6b00d","resolution":{"observed_at":"2026-08-06T12:44:21.591815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06411","last_updated":"2024-04-09T16:01:24Z","snapshot_observed_at":"2026-07-06T17:57:52.364338Z","submitted_at":"2024-04-09T16:01:24Z","title":"AgentQuest: A Modular Benchmark Framework to Measure Progress and Improve LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06411","snapshot_observed_at":"2026-08-06T12:44:21.580085Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.580085Z"},"links":{"cited_paper":"/paper/2404.06411","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:ad15c54faa18c08750796a8dc0003f518e56dcb93a6047582cfa3f40bb1fbdac","observation_id":"c0640dad-e5f3-42c0-9f55-e0a2bed5c23e","resolution":{"observed_at":"2026-08-06T12:44:21.580085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.597845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.597845Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:263815223c6a045393fd509bad14b0bdb8c77c94b9390a8ee67eaa9e0a63d055","observation_id":"d720d498-29d4-46c4-8d38-e7aed3ab185d","resolution":{"observed_at":"2026-08-06T12:44:21.597845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-06T12:44:21.585641Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.585641Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:a5e7a2566896e06918360d1647663ae38aae2093daa1b2117a601ee39a3e7e9f","observation_id":"67888622-73c4-45c2-9b2e-e5bc28d3bc5c","resolution":{"observed_at":"2026-08-06T12:44:21.585641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.588784Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.588784Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:fb6d2674e4e3bf23e17f25fd0bd5f67f928ce725cfd974b085d6892dd8869c45","observation_id":"57d265d4-3b1b-4bb5-b9cd-4067450ccb32","resolution":{"observed_at":"2026-08-06T12:44:21.588784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02716","last_updated":"2024-02-05T04:25:24Z","snapshot_observed_at":"2026-07-06T17:25:14.115360Z","submitted_at":"2024-02-05T04:25:24Z","title":"Understanding the planning of LLM agents: A survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02716","snapshot_observed_at":"2026-08-06T12:44:21.606949Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.606949Z"},"links":{"cited_paper":"/paper/2402.02716","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:acbbad4167bc162a27d62352af230d1df473a4550b2a3058ef0aa6f54d7cd540","observation_id":"03971990-d79d-4f98-931d-b8d22cc98ff8","resolution":{"observed_at":"2026-08-06T12:44:21.606949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03578","last_updated":"2026-01-28T04:55:23Z","snapshot_observed_at":"2026-07-06T17:25:53.950578Z","submitted_at":"2024-02-05T23:06:42Z","title":"LLM Multi-Agent Systems: Challenges and Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03578","snapshot_observed_at":"2026-08-06T12:44:21.594720Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.594720Z"},"links":{"cited_paper":"/paper/2402.03578","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:16e3088b75854df88fe6441ceac582df42a9c3df99aea1faa92ae930954b5800","observation_id":"1cf4dcc5-30b3-49f2-955f-a82ac905765a","resolution":{"observed_at":"2026-08-06T12:44:21.594720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.612824Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.612824Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:007fd254a6b787550a5bf5b347756368ec741fd352218e99881fe8af630a47fc","observation_id":"a47616f2-fdfc-43ee-8e73-50016babc9c6","resolution":{"observed_at":"2026-08-06T12:44:21.612824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02959","last_updated":"2024-09-21T14:49:53Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T13:30:02Z","title":"AgentsCourt: Building Judicial Decision-Making Agents with Court Debate Simulation and Legal Knowledge Augmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02959","snapshot_observed_at":"2026-08-06T12:44:21.600583Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.600583Z"},"links":{"cited_paper":"/paper/2403.02959","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:961f6fa0ff76f79d5b144498f88c1476677f6a21928220b2fd8bb83996857510","observation_id":"7e4ffcf8-ac71-47ad-a8f1-b9f26e1d22c1","resolution":{"observed_at":"2026-08-06T12:44:21.600583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T12:44:21.603848Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.603848Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:70b52c8090f203c86c01b7a1605b17bbfdc5b66ff130dd75457397135de2e0c0","observation_id":"c0f909b1-34af-4a68-bfb1-59360d7225e9","resolution":{"observed_at":"2026-08-06T12:44:21.603848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.624201Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.624201Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:bcf88d71055a99076c6e0bbcfd56df1d817c9b7fd9146d5b48f0fb61d8f91e88","observation_id":"38e49dfc-b559-4e10-8a8e-db2336f3cace","resolution":{"observed_at":"2026-08-06T12:44:21.624201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-06T12:44:21.609937Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.609937Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:9d9ae8d170b184a71cf07e9170a53327981385d7331bf89c635097f5325f7d35","observation_id":"1576480d-e593-4139-8f1a-353f60d92f52","resolution":{"observed_at":"2026-08-06T12:44:21.609937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.633063Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.633063Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:b45df83be45e75ed597371a4bd5efc8431242a43edfd62a8e88d7cceb3c78691","observation_id":"f5195e60-8380-49c0-be77-aced989195e1","resolution":{"observed_at":"2026-08-06T12:44:21.633063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16294","last_updated":"2024-06-24T03:36:29Z","snapshot_observed_at":"2026-08-02T03:53:50.910056Z","submitted_at":"2024-06-24T03:36:29Z","title":"LangSuitE: Planning, Controlling and Interacting with Large Language Models in Embodied Text Environments","version":1},"cited_work":{"arxiv_id":"2406.16294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16294","snapshot_observed_at":"2026-08-06T12:44:22.814449Z","title":"LangSuitE: Planning, Controlling and Interacting with Large Language Models in Embodied Text Environments","venue":"cs.CL","work_id":"9088f36a-f945-4bf4-89af-6acf11aafe85","year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.615493Z"},"links":{"cited_paper":"/paper/2406.16294","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:f13cf75abef20fa2ecc775533dcadda0a84dedc542d7571721c9165100498375","observation_id":"17afe007-792d-4036-81d8-4f6e86d4e29c","resolution":{"observed_at":"2026-08-06T12:44:22.818063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-06T12:44:21.618485Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.618485Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:165ac8a620c62255217d7a8958dbac076964926c9890ba5b11d65d1ee8ddbb02","observation_id":"6fbcd1ef-99ba-44ae-9490-f3f8136fb2d4","resolution":{"observed_at":"2026-08-06T12:44:21.618485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.621618Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.621618Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:3bf4236de75408dfd665d5a8641d0b47b2bbc2af46eb02256608d78e855c6c43","observation_id":"b75ef5d4-56c0-4b5e-a026-a442f6ea8500","resolution":{"observed_at":"2026-08-06T12:44:21.621618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.645335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.645335Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:210a2eacd1f53a27a3e6c753041bd3baf8e71f4f8b425c03ea56ca36baecc19b","observation_id":"fae8e12c-84d0-4d3a-8cf8-5b793eede1c1","resolution":{"observed_at":"2026-08-06T12:44:21.645335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13649","last_updated":"2024-06-06T02:01:09Z","snapshot_observed_at":"2026-08-05T16:01:54.847394Z","submitted_at":"2024-01-24T18:35:21Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13649","snapshot_observed_at":"2026-08-06T12:44:21.627127Z","title":"doi:10.48550/arXiv.2401.13649","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.627127Z"},"links":{"cited_paper":"/paper/2401.13649","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:98cb20680fee7bd513bd323d33ac0b968878da417cad26d227803acd49c3614c","observation_id":"95dbed4c-c632-46b2-847c-0137bac07bca","resolution":{"observed_at":"2026-08-06T12:44:21.627127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13298","last_updated":"2023-01-30T21:31:48Z","snapshot_observed_at":"2026-07-06T14:46:19.313091Z","submitted_at":"2023-01-30T21:31:48Z","title":"LongEval: Guidelines for Human Evaluation of Faithfulness in Long-form Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13298","snapshot_observed_at":"2026-08-06T12:44:21.630164Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.630164Z"},"links":{"cited_paper":"/paper/2301.13298","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:f1e42fc82dab529858f75a978790ada12baf3a12664ca79788849bc44ccda345","observation_id":"08dd9ff0-baad-4333-b7dc-9e5ef96fc258","resolution":{"observed_at":"2026-08-06T12:44:21.630164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.653693Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.653693Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:549242f5968ecdb3d2c2d0d6a8f26f0f9121b6b73e7d7423384e880cc4118f0b","observation_id":"988d73f9-f5c6-475f-830e-f6a5bc06d29f","resolution":{"observed_at":"2026-08-06T12:44:21.653693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11067","last_updated":"2025-01-19T14:58:35Z","snapshot_observed_at":"2026-08-04T13:06:53.951455Z","submitted_at":"2025-01-19T14:58:35Z","title":"IntellAgent: A Multi-Agent Framework for Evaluating Conversational AI Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11067","snapshot_observed_at":"2026-08-06T12:44:21.636050Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.636050Z"},"links":{"cited_paper":"/paper/2501.11067","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:8802f681055fff3d8d415cc12f43fe09d9480d10f48da3fdf9ee729376efe07e","observation_id":"a7a1f55d-5608-463f-ba76-40eaeb9259b8","resolution":{"observed_at":"2026-08-06T12:44:21.636050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05579","snapshot_observed_at":"2026-08-06T12:44:21.639176Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.639176Z"},"links":{"cited_paper":"/paper/2412.05579","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:69644fd20bb241bd4438b392768d421b437f773344f592fb77a511d33cf20eb3","observation_id":"1ea9c14a-43b7-48a2-9a75-5b196197df94","resolution":{"observed_at":"2026-08-06T12:44:21.639176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08244","last_updated":"2023-10-25T06:54:12Z","snapshot_observed_at":"2026-08-02T00:07:12.855748Z","submitted_at":"2023-04-14T14:05:32Z","title":"API-Bank: A Comprehensive Benchmark for Tool-Augmented LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08244","snapshot_observed_at":"2026-08-06T12:44:21.642196Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.642196Z"},"links":{"cited_paper":"/paper/2304.08244","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:a893daf8fba4f26827e237660a6d614dd10b92664b6ed05f6b6258967ced9d8f","observation_id":"4f5134ab-59be-4e29-8c6c-d1a72f2f2df9","resolution":{"observed_at":"2026-08-06T12:44:21.642196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14928","last_updated":"2024-10-17T10:30:41Z","snapshot_observed_at":"2026-07-06T18:34:43.041841Z","submitted_at":"2024-06-21T07:37:19Z","title":"Autonomous Agents for Collaborative Task under Information Asymmetry","version":2},"cited_work":{"arxiv_id":"2406.14928","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14928","snapshot_observed_at":"2026-08-06T12:44:22.759548Z","title":"Autonomous Agents for Collaborative Task under Information Asymmetry","venue":"cs.AI","work_id":"9924da1a-718d-4851-ab5b-946182fe8d27","year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.671369Z"},"links":{"cited_paper":"/paper/2406.14928","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:08997f96b96c47fb4ad93c5e790f4b54f9fe9e60b0e6c8e75189ed99dbb0bce8","observation_id":"32246f49-b35c-4ff5-9d98-25867ca6336b","resolution":{"observed_at":"2026-08-06T12:44:22.763154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05459","last_updated":"2024-05-08T06:16:23Z","snapshot_observed_at":"2026-08-02T13:57:57.119489Z","submitted_at":"2024-01-10T09:25:45Z","title":"Personal LLM Agents: Insights and Survey about the Capability, Efficiency and Security","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05459","snapshot_observed_at":"2026-08-06T12:44:21.648044Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.648044Z"},"links":{"cited_paper":"/paper/2401.05459","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:7834fe44cfd7539431e1a3c2182f777114231b6c9ddd89c8663da8671d308a77","observation_id":"a16e74b8-bc20-4e6f-afc8-922a972f43e3","resolution":{"observed_at":"2026-08-06T12:44:21.648044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.651084Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.651084Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:d6e0cc45bae374246fbf045858d965135ddbf88637b068dc8d62a6eeec6ffb07","observation_id":"87cae1f6-0021-42e7-abc1-8c40a2a3919c","resolution":{"observed_at":"2026-08-06T12:44:21.651084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-06T20:36:41.418114Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-06T12:44:21.679806Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.679806Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:62357365586ea4b2e19081e992b84e65ec31d7760358355e3186b6a38ad0e3a3","observation_id":"5d0eda4b-5def-4aba-aad3-b03c122d49fe","resolution":{"observed_at":"2026-08-06T12:44:21.679806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.682381Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.682381Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:b888a75e740603a2132b13c82b83842191fb07b86c85e52b6efecc3da3523326","observation_id":"4d83681e-34b9-4e2d-a9f5-7ea8018dcf15","resolution":{"observed_at":"2026-08-06T12:44:21.682381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.659528Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.659528Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:65e733ea0a26e867fd561c211d50ff80e8b49e424bebdb64784371f42fa7979e","observation_id":"10e97fee-f5b5-4387-a5b8-1543f55ffa76","resolution":{"observed_at":"2026-08-06T12:44:21.659528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04026","last_updated":"2023-08-08T03:59:28Z","snapshot_observed_at":"2026-07-06T16:03:46.860343Z","submitted_at":"2023-08-08T03:59:28Z","title":"AgentSims: An Open-Source Sandbox for Large Language Model Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04026","snapshot_observed_at":"2026-08-06T12:44:21.662265Z","title":"arXiv preprint arXiv:2308.04026(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.662265Z"},"links":{"cited_paper":"/paper/2308.04026","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:3163ef2e86ec57e574d665908ba331c56a707a3731c573190568cc1264a15c14","observation_id":"acb862c6-b9b7-40ed-b0b5-1650e4f96031","resolution":{"observed_at":"2026-08-06T12:44:21.662265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.267","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:22.133210Z","title":null,"venue":null,"work_id":"55da9dd3-2a0a-44b3-80ff-d4d8012bf07c","year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.665219Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:9d0a499acc28a5ddfb239d33e447981bb53419a11810215add64a6fccd10fb09","observation_id":"a71eb74e-e7d4-4f48-a9fc-14f70eaf0f26","resolution":{"observed_at":"2026-08-06T12:44:22.136258Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01990","snapshot_observed_at":"2026-08-06T12:44:21.668218Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.668218Z"},"links":{"cited_paper":"/paper/2504.01990","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:d9f2ac510f8388f5cb5f501df6280f1551439389e52974e035cd6ccd40b43d7d","observation_id":"b4988fd1-00f9-411c-a20b-cd5f66f6298d","resolution":{"observed_at":"2026-08-06T12:44:21.668218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13178","last_updated":"2024-12-23T20:12:48Z","snapshot_observed_at":"2026-07-06T17:19:44.130417Z","submitted_at":"2024-01-24T01:51:00Z","title":"AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13178","snapshot_observed_at":"2026-08-06T12:44:21.699335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.699335Z"},"links":{"cited_paper":"/paper/2401.13178","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:9d50a652633fe83e6099c5de1629dfa9c39d88645790cccd3275a0bbdd89d943","observation_id":"ff4c10d5-7239-4858-9037-39477c88bd91","resolution":{"observed_at":"2026-08-06T12:44:21.699335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.674191Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.674191Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:fd5bbf8a7e6894aa422067e8e70f7cf57e29f24212c519c3890ddc038bd6981f","observation_id":"4f007bf9-f524-4fe6-bddb-4a592f38fa06","resolution":{"observed_at":"2026-08-06T12:44:21.674191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-06T20:36:41.418114Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-06T12:44:21.676884Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.676884Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:a73d6f1e727b65288cf07d5d2224fba5b31d44ba8235dbaaf4594628b72d6ec7","observation_id":"8693fcb6-3f7d-4d62-ba10-250858c969b7","resolution":{"observed_at":"2026-08-06T12:44:21.676884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.707889Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.707889Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:f0cd1aaf0bab6889de9cf9af18d336926f1de6e3c02a2f4fa4d60db713e8c6e0","observation_id":"5d6b6591-30e0-40d4-a330-824cbe460198","resolution":{"observed_at":"2026-08-06T12:44:21.707889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.710615Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.710615Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:3c228e5d6d38b980bdaff8a299ff7cef921e70adf26d00cd56a26fab11bf9a8b","observation_id":"a3bb5815-e184-4050-875e-aff77b02f5b8","resolution":{"observed_at":"2026-08-06T12:44:21.710615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09434","last_updated":"2023-05-16T13:46:52Z","snapshot_observed_at":"2026-07-06T15:28:09.241288Z","submitted_at":"2023-05-16T13:46:52Z","title":"Chatting with GPT-3 for Zero-Shot Human-Like Mobile Automated GUI Testing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09434","snapshot_observed_at":"2026-08-06T12:44:21.685043Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.685043Z"},"links":{"cited_paper":"/paper/2305.09434","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:4d731bbd7b822d9c2eca770b392f9636f364fdb09c67c9c2b254d4a9bc3e1eef","observation_id":"e4833b80-cd87-46f3-804a-6d73e1bbc477","resolution":{"observed_at":"2026-08-06T12:44:21.685043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22394","last_updated":"2025-05-25T06:54:06Z","snapshot_observed_at":"2026-07-06T19:41:46.397542Z","submitted_at":"2024-10-29T17:58:29Z","title":"AAAR-1.0: Assessing AI's Potential to Assist Research","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22394","snapshot_observed_at":"2026-08-06T12:44:21.687855Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.687855Z"},"links":{"cited_paper":"/paper/2410.22394","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:775b8e8d47f94b11b1248dc9b0c018d47310c6955f7fbe33544861c49aaf5d91","observation_id":"d7f7fd7c-d72d-4031-b562-f6a09f14307b","resolution":{"observed_at":"2026-08-06T12:44:21.687855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.691267Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.691267Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:e035428c065a97ca9a500b30e27d850b3b06bdd57fd9c498f7e38ceabc8db392","observation_id":"332611bb-3bbf-433e-ab58-d8aa519a7dda","resolution":{"observed_at":"2026-08-06T12:44:21.691267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06292","last_updated":"2024-09-01T00:41:18Z","snapshot_observed_at":"2026-07-06T18:59:43.564435Z","submitted_at":"2024-08-12T16:58:11Z","title":"The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06292","snapshot_observed_at":"2026-08-06T12:44:21.693952Z","title":"arXiv preprint arXiv:2408.06292(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.693952Z"},"links":{"cited_paper":"/paper/2408.06292","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:aa004520d73597f749259d4f968c8de304fef002fcb4279375da12927699a0b7","observation_id":"51527181-da25-4aff-a12a-678c0932dc05","resolution":{"observed_at":"2026-08-06T12:44:21.693952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.696779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.696779Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:6074aaba11ae5ef3bd40878bd14e8ff89415d4a14bd67e172f2d8bd540293ec2","observation_id":"2793d074-519f-4448-b9f2-cfc2d738c4fa","resolution":{"observed_at":"2026-08-06T12:44:21.696779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.730067Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.730067Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:10150686dbc12bd300c1f2e065d7ad1b2aed09f7fb71f0b1746efb19f4dc5eb1","observation_id":"d82f2c72-baa2-4505-9ab0-5d77ac44e58e","resolution":{"observed_at":"2026-08-06T12:44:21.730067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17753","last_updated":"2024-02-27T18:42:31Z","snapshot_observed_at":"2026-08-06T11:15:36.554174Z","submitted_at":"2024-02-27T18:42:31Z","title":"Evaluating Very Long-Term Conversational Memory of LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17753","snapshot_observed_at":"2026-08-06T12:44:21.702317Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.702317Z"},"links":{"cited_paper":"/paper/2402.17753","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:c74fc31b65d22e68aea316e80d244ae8ab661502bd6ff8689d77a44b22984d26","observation_id":"ea8717b2-0ba8-4a3b-8d82-ba41f72e027e","resolution":{"observed_at":"2026-08-06T12:44:21.702317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.705264Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.705264Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:ec83aaafbd19998a50e7157243db0bbee3d5023dceaa11f20c251cca4069766a","observation_id":"8d34f258-59af-46a8-8de8-a4132c3b0ccb","resolution":{"observed_at":"2026-08-06T12:44:21.705264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23252","last_updated":"2025-03-08T23:37:49Z","snapshot_observed_at":"2026-07-06T19:42:25.742756Z","submitted_at":"2024-10-30T17:35:44Z","title":"Evaluating Cultural and Social Awareness of LLM Web Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23252","snapshot_observed_at":"2026-08-06T12:44:21.741655Z","title":"Fabbri, Divyansh Agarwal, Kung-Hsiang Huang, Sarah Tan, Nanyun Peng, and Chien-Sheng Wu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.741655Z"},"links":{"cited_paper":"/paper/2410.23252","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:a6b8c254d1c1c0d4c422519e6b6e36af7cdec70987cc1091c8bfca94cc938dff","observation_id":"c47bb156-6098-4617-81f1-d02a36e835ab","resolution":{"observed_at":"2026-08-06T12:44:21.741655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03822","last_updated":"2018-06-11T06:10:11Z","snapshot_observed_at":"2026-08-02T00:06:16.208560Z","submitted_at":"2018-06-11T06:10:11Z","title":"Know What You Don't Know: Unanswerable Questions for SQuAD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03822","snapshot_observed_at":"2026-08-06T12:44:21.744477Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.744477Z"},"links":{"cited_paper":"/paper/1806.03822","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:4b7042827ced9eea440357008818d46fd0414159737396e670c6cee6fb3d6c8e","observation_id":"f34adac2-6809-4442-b63e-0ee4f1d601d0","resolution":{"observed_at":"2026-08-06T12:44:21.744477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.713486Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.713486Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:b1ef56ea996b14cce4423e3536b50b5ded657e8d3deca14f4a25bcfe0bda1b70","observation_id":"a63d1cf0-e7dd-4d36-8075-c300f73d5f27","resolution":{"observed_at":"2026-08-06T12:44:21.713486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.716073Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.716073Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:5c0a73be37dc4c9d7d6ad59baf5e37b57b3cddad5f00582772b01ee30e4bab28","observation_id":"f021281d-6cf7-46de-9b3c-47488b8685eb","resolution":{"observed_at":"2026-08-06T12:44:21.716073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.718892Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.718892Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:615b2c0d5599345639704b6f45de72b5ee693227735b807539251441d8a8e7cc","observation_id":"e4b2c4c2-a9cd-420d-b5c8-9c8bceee7f3f","resolution":{"observed_at":"2026-08-06T12:44:21.718892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.721508Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.721508Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:1c68bd7d9e8031cf97b31a8e39e6073db597f02b00cfee1c8ef0b2672101b539","observation_id":"a32272ee-a3ea-4d59-bd10-7c943f08e3e2","resolution":{"observed_at":"2026-08-06T12:44:21.721508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13543","last_updated":"2025-04-01T14:45:22Z","snapshot_observed_at":"2026-07-06T19:53:21.444233Z","submitted_at":"2024-11-20T18:54:32Z","title":"BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13543","snapshot_observed_at":"2026-08-06T12:44:21.724101Z","title":"arXiv:2411.13543 [cs.AI] https://arxiv.org/abs/2411.13543","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.724101Z"},"links":{"cited_paper":"/paper/2411.13543","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:f0b164bdfeab7dd6c07c362b7af852a939520d70f9db6f3b60bf8d020fcd0bb2","observation_id":"40861379-0377-47af-9bf4-7b6d5b2f7118","resolution":{"observed_at":"2026-08-06T12:44:21.724101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12373","last_updated":"2024-07-16T06:19:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T07:58:33Z","title":"WebCanvas: Benchmarking Web Agents in Online Environments","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12373","snapshot_observed_at":"2026-08-06T12:44:21.727061Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.727061Z"},"links":{"cited_paper":"/paper/2406.12373","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:b800c1bd1047f8fb388de66ddf82cb77bbea3d042a0fff87da42aa27ce30934f","observation_id":"56cfd1f3-cdee-4b97-9412-567365435198","resolution":{"observed_at":"2026-08-06T12:44:21.727061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.768017Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.768017Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:6a9361c1286bb6075efdfed153dbbb662ed65204d4a1126a9556123954b480e9","observation_id":"670d85e0-0722-4c56-8bcb-46e51cbff8b5","resolution":{"observed_at":"2026-08-06T12:44:21.768017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-06T12:44:21.732658Z","title":"Patil, Tianjun Zhang, Xin Wang, and Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.732658Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:1fc47bf6c63490522046d0b84d65c64b5ccdba7daec7ca769397a99baa8bac92","observation_id":"67ee1029-8780-44f8-8fee-756590eea613","resolution":{"observed_at":"2026-08-06T12:44:21.732658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.736007Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.736007Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:389ee806e6fd4dc4172d93c6b77da9c85da24f34f5f43307b833af4230412d27","observation_id":"d30536c9-4172-4044-8786-5528383e4f5b","resolution":{"observed_at":"2026-08-06T12:44:21.736007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-06T12:44:21.738675Z","title":"doi:10.48550/arXiv.2307.16789","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.738675Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:959dde8eb514a4aea3db4277ec9dbf172abae519e875443536877a3c08d5f715","observation_id":"b42bbf4c-8db5-45a2-910d-5e0cbcef3c63","resolution":{"observed_at":"2026-08-06T12:44:21.738675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03314","last_updated":"2023-06-05T23:55:37Z","snapshot_observed_at":"2026-08-05T20:35:55.884484Z","submitted_at":"2023-06-05T23:55:37Z","title":"Multi-Agent Collaboration: Harnessing the Power of Intelligent LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03314","snapshot_observed_at":"2026-08-06T12:44:21.782168Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.782168Z"},"links":{"cited_paper":"/paper/2306.03314","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:42ed58a3642557056e7341201f966f541d50d985d27e0894514bdf3143df5abb","observation_id":"3df9fabe-2935-42bb-bc9e-917387192ed9","resolution":{"observed_at":"2026-08-06T12:44:21.782168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.785167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.785167Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:e1fb7193f36e96b635b811b6c5c494835cca2af2a6ceebcf671916a6a41bd3d8","observation_id":"78653e92-0386-4bef-a808-53abdf6e81e3","resolution":{"observed_at":"2026-08-06T12:44:21.785167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.747431Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.747431Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:a17cc29991977f9775ea45260783741c251307c9664935082b4a7d942d9e0dc5","observation_id":"9e607f34-0109-49b2-9994-8cd5f0bcc300","resolution":{"observed_at":"2026-08-06T12:44:21.747431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08184","last_updated":"2024-06-12T13:14:50Z","snapshot_observed_at":"2026-07-06T18:29:34.538901Z","submitted_at":"2024-06-12T13:14:50Z","title":"MobileAgentBench: An Efficient and User-Friendly Benchmark for Mobile LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08184","snapshot_observed_at":"2026-08-06T12:44:21.793466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.793466Z"},"links":{"cited_paper":"/paper/2406.08184","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:d910d1cb68a42a4540c8699ccc363ebc6d765831f47699a5dfa7552c24228d33","observation_id":"e8dab5f9-2e2a-445e-8ec8-310bff789f07","resolution":{"observed_at":"2026-08-06T12:44:21.793466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3570945","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:22.056326Z","title":"Reimann, Catharine Oertel, Florian A","venue":null,"work_id":"b7adc62d-2fcb-4593-b6cc-e7f96a074613","year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.752880Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:e91edccc23f711313a640649768515e325e3fb8cba3eb618b69853ee524fcb41","observation_id":"a939c8f0-8b53-4922-aa76-00d617573ea3","resolution":{"observed_at":"2026-08-06T12:44:22.059811Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.755622Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.755622Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:aff5880a4dad242a823b611f0619a945176808d28dcdffe897b57828b05cac09","observation_id":"ff967955-d427-497b-a773-035c266ccb71","resolution":{"observed_at":"2026-08-06T12:44:21.755622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15817","last_updated":"2024-05-17T17:17:45Z","snapshot_observed_at":"2026-07-06T16:24:30.545494Z","submitted_at":"2023-09-25T17:08:02Z","title":"Identifying the Risks of LM Agents with an LM-Emulated Sandbox","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15817","snapshot_observed_at":"2026-08-06T12:44:21.759303Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.759303Z"},"links":{"cited_paper":"/paper/2309.15817","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:a893f796720968d6f436a6312c3e3e9c766e83d0cca396d9763798bfab01b6b0","observation_id":"78cc4a51-1f84-4584-8b9f-0ba4a884a3f5","resolution":{"observed_at":"2026-08-06T12:44:21.759303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-08-06T12:44:21.762114Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.762114Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:1c13f56f40d8ba498eccfa2b430e6eff54d2e75650e117b393f4c7134cd3e89e","observation_id":"8fd32775-a877-4f2f-8338-4d5d8e800dc2","resolution":{"observed_at":"2026-08-06T12:44:21.762114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05349","last_updated":"2024-11-08T06:12:56Z","snapshot_observed_at":"2026-08-04T02:30:17.409719Z","submitted_at":"2024-11-08T06:12:56Z","title":"Enhancing Cluster Resilience: LLM-agent Based Autonomous Intelligent Cluster Diagnosis System and Evaluation Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05349","snapshot_observed_at":"2026-08-06T12:44:21.765199Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.765199Z"},"links":{"cited_paper":"/paper/2411.05349","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:0b741a1369ea0d07eb31143f61f7c3ab971dbbe7de233169a7bd846314e6926f","observation_id":"ab70d92b-935f-40c1-8002-2c449028ec71","resolution":{"observed_at":"2026-08-06T12:44:21.765199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.findings-emnlp.359","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:44:21.996078Z","title":null,"venue":null,"work_id":"a0ebdd2b-6e58-46d2-af8f-86a75d6ea4c4","year":2022},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.810777Z"},"links":{"citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:9f06e61ebd45f41ad215434d889f6e8c95d07d6616b728bea47e938e44be80ca","observation_id":"85876bdb-f874-4a30-8cf2-1ece2333c195","resolution":{"observed_at":"2026-08-06T12:44:21.999884Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08562","last_updated":"2024-11-27T12:25:28Z","snapshot_observed_at":"2026-07-06T16:47:37.217467Z","submitted_at":"2023-11-14T21:46:27Z","title":"MAgIC: Investigation of Large Language Model Powered Multi-Agent in Cognition, Adaptability, Rationality and Collaboration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08562","snapshot_observed_at":"2026-08-06T12:44:21.813422Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.813422Z"},"links":{"cited_paper":"/paper/2311.08562","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:b1e449cc5ffd6d586227cef9af6b65a550cd80fb49f3e8e3e14e5f7e9810be87","observation_id":"474df2fa-d0e8-460b-b8bf-1b720f13b87d","resolution":{"observed_at":"2026-08-06T12:44:21.813422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11363","last_updated":"2026-06-22T22:36:12Z","snapshot_observed_at":"2026-08-02T08:03:11.044233Z","submitted_at":"2024-09-17T17:13:19Z","title":"CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11363","snapshot_observed_at":"2026-08-06T12:44:21.773326Z","title":"Siegel, Sayash Kapoor, Nitya Nagdir, Benedikt Stroebl, and Arvind Narayanan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.773326Z"},"links":{"cited_paper":"/paper/2409.11363","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:33d67c62f958ebe73df092258a463d5c07c770a129e1b00636bc43df3ef2f299","observation_id":"13f5ad70-d8d5-4c0b-9765-0743eb507494","resolution":{"observed_at":"2026-08-06T12:44:21.773326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":95,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":143},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 143 outbound references and 6 inbound Pith citation observations for arXiv:2507.21504."}