{"as_of":"2026-08-07T18:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da38d537e16644ff59e5abc60c5bfdae4a49d6bb6fabe5cf9290203efe015cbf","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:04:16.033411Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-04T00:54:15.317631Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T00:59:19.106605Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"cited_work":{"arxiv_id":"2602.03238","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.03238","snapshot_observed_at":"2026-07-04T00:59:19.106605Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","venue":"cs.AI","work_id":"7a67d60a-fd9b-4fcd-9337-556d4dee66c4","year":2026},"citing_paper":{"arxiv_id":"2605.27898","last_updated":"2026-07-02T09:08:28Z","snapshot_observed_at":"2026-07-06T23:37:31.844094Z","submitted_at":"2026-05-27T03:20:45Z","title":"A Unified Framework for the Evaluation of LLM Agentic Capabilities","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:21.085584Z"},"links":{"cited_paper":"/paper/2602.03238","citing_paper":"/paper/2605.27898"},"observation_digest":"sha256:ee0d6b8153db6e1790b212164508dc61c9e22f72b1e156aa9e17fd25455d8a37","observation_id":"7f1f5dd7-b149-4f7b-bd64-12608902d8d7","resolution":{"observed_at":"2026-06-29T13:23:28.331741Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"cited_work":{"arxiv_id":"2602.03238","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.03238","snapshot_observed_at":"2026-07-04T00:59:19.106605Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","venue":"cs.AI","work_id":"7a67d60a-fd9b-4fcd-9337-556d4dee66c4","year":2026},"citing_paper":{"arxiv_id":"2605.27898","last_updated":"2026-07-02T09:08:28Z","snapshot_observed_at":"2026-07-06T23:37:31.844094Z","submitted_at":"2026-05-27T03:20:45Z","title":"A Unified Framework for the Evaluation of LLM Agentic Capabilities","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-04T00:54:15.317631Z"},"links":{"cited_paper":"/paper/2602.03238","citing_paper":"/paper/2605.27898"},"observation_digest":"sha256:28aafb5f9af311a31d01784ff7ba9d8d744ed8be9f9cf5f7d0520c039d904f2e","observation_id":"1cbaf70d-ff79-4ad2-bf31-3afcb84d84e8","resolution":{"observed_at":"2026-07-04T00:59:19.110971Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.03238/citation-record","integrity":"/paper/2602.03238/integrity","json":"/paper/2602.03238/citation-record.json","paper":"/paper/2602.03238"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:11.553642Z","title":"System card: Claude opus 4 claude sonnet 4, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:11.553642Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:a300254c6071f99fb76c13bb73f2212828ea379e80e2e78fce614e335a7d742b","observation_id":"3922ce92-068b-4bcc-9018-0e722b0902d1","resolution":{"observed_at":"2026-08-03T05:04:11.553642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-03T05:04:11.649622Z","title":"^2 -bench: Evaluating conversational agents in a dual-control environment, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:11.649622Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:174ae69c0221c511324907e028571cbe77c1fe5305c5b346af6b3500363a19f1","observation_id":"34c8e4c8-a9f3-490f-8b39-9d8e7013a46d","resolution":{"observed_at":"2026-08-03T05:04:11.649622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-03T05:04:11.811130Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:11.811130Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:9aa94886eee3c32eb8768c43a75db073df2385bff53de03982b87717d237ea17","observation_id":"dc7ad3bf-a18f-44b2-b19e-7202f3182eed","resolution":{"observed_at":"2026-08-03T05:04:11.811130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:11.977240Z","title":"E motion Q ueen: A benchmark for evaluating empathy of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:11.977240Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:86709f98d270535304cfcf4caf9c6af9f96b46895ff76f8b66d4d54b1a388f1b","observation_id":"9ef6e35f-f6ae-4223-ae9e-1861cbcfc6bf","resolution":{"observed_at":"2026-08-03T05:04:11.977240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:12.200208Z","title":"Browsecomp-plus: A more fair and transparent evaluation benchmark of deep-research agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:12.200208Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:2fcdc05a93bbfd9bf24bf474bf30b4f04f3174a086b32bbd0206f237c2e877b6","observation_id":"19ef4d3c-983e-4bd8-ad02-8857d00e57fc","resolution":{"observed_at":"2026-08-03T05:04:12.200208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-07-06T22:03:15.296567Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-08-03T05:04:12.365872Z","title":"Agentic reinforced policy optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:12.365872Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:68fbdc4b60f4854d2b7fb32ea7de4fafd5d99ac5fa283d1b54eb8eb430c28de3","observation_id":"c106b8ef-3b7d-41af-8ec0-27d7743c4635","resolution":{"observed_at":"2026-08-03T05:04:12.365872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-03T05:04:12.559160Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:12.559160Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:9159137189694251adbcdb02a6b3c175c7856395ad2f940eed7d1364412d05da","observation_id":"5e8f0007-a966-404c-b0e1-9558a67444bb","resolution":{"observed_at":"2026-08-03T05:04:12.559160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:12.660787Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:12.660787Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:29a84344d58ec58c45bd8fd97661d138607ca1d5aed3a1a34b2f272ad72a5a00","observation_id":"86e854b7-97a1-405a-96e8-d42892274f3e","resolution":{"observed_at":"2026-08-03T05:04:12.660787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:12.770744Z","title":"Function calling | gemini api | google ai for developers","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:12.770744Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:00ffedc1b0af99b5dec913a0d8c3d8be2ee73245fa6b200c11bfa47b767766dd","observation_id":"98d2d223-b0c4-4aaa-a5fa-776d7f936a88","resolution":{"observed_at":"2026-08-03T05:04:12.770744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:12.849791Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:12.849791Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:82261cdf27ab2a02adf24635828988169b524fdb1df9459370b8f3c9b353bd0a","observation_id":"5dfab1a4-ba26-4c23-a8f8-073f10c0d9f2","resolution":{"observed_at":"2026-08-03T05:04:12.849791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:12.964046Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:12.964046Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:444401feca74366240fb56078543aedde425669718d0857d1100dbac762a3437","observation_id":"14a490a8-2ab8-4a36-8792-22154fff3d9b","resolution":{"observed_at":"2026-08-03T05:04:12.964046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23278","last_updated":"2025-10-07T07:13:32Z","snapshot_observed_at":"2026-07-06T21:00:55.979837Z","submitted_at":"2025-03-30T01:58:22Z","title":"Model Context Protocol (MCP): Landscape, Security Threats, and Future Research Directions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23278","snapshot_observed_at":"2026-08-03T05:04:13.042270Z","title":"Model context protocol (mcp): Landscape, security threats, and future research directions, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:13.042270Z"},"links":{"cited_paper":"/paper/2503.23278","citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:a4caf05aae073cd50e8d663ba72b0ac8045cec579c5aa7e630e18666df20f5bc","observation_id":"4043b787-97d1-4fd2-9374-b707d4edf547","resolution":{"observed_at":"2026-08-03T05:04:13.042270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02716","last_updated":"2024-02-05T04:25:24Z","snapshot_observed_at":"2026-07-06T17:25:14.115360Z","submitted_at":"2024-02-05T04:25:24Z","title":"Understanding the planning of LLM agents: A survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02716","snapshot_observed_at":"2026-08-03T05:04:13.121362Z","title":"Understanding the planning of llm agents: A survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:13.121362Z"},"links":{"cited_paper":"/paper/2402.02716","citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:2188fd7a1d02a0be1b70f338dd7447ef389761ec3a395bd143da4eeaf916e926","observation_id":"ba4de379-39ac-445a-8e94-ad915b42e0e0","resolution":{"observed_at":"2026-08-03T05:04:13.121362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:13.230224Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:13.230224Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:cbd6c19cf548c913b8e05bca495b99dc3087aa9a022ac12c4030bf0696cf3259","observation_id":"130178d3-ac4b-41b2-a8b6-fe50ccc4ebcb","resolution":{"observed_at":"2026-08-03T05:04:13.230224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:13.339020Z","title":"Langgraph: Build resilient language agents as graphs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:13.339020Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:4eea776f949d4364a4e8a7f82280a35072b28b59ec9e923b75418f7362ec3e9c","observation_id":"89038156-7eae-4733-b7db-fc14f309a366","resolution":{"observed_at":"2026-08-03T05:04:13.339020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:13.452404Z","title":"The tool decathlon: Benchmarking language agents for diverse, realistic, and long-horizon task execution, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:13.452404Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:8cb5c56ecdf24d410755e05ca62f5d64f04fed1ea0adabaf8475a280c4495150","observation_id":"03da8a3d-7471-44b3-ba44-65137b9e1f09","resolution":{"observed_at":"2026-08-03T05:04:13.452404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:13.492949Z","title":"Agentbench: Evaluating LLM s as agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:13.492949Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:8d8163aa3322a00cff3b27b262b1cac4b181c90e08e9281a594dc575cc13fc0f","observation_id":"66d9d27a-6277-442a-978f-13594772cd8e","resolution":{"observed_at":"2026-08-03T05:04:13.492949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:13.571550Z","title":"LangChain v0.3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:13.571550Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:bc0ae239da41741e500a9a4769e0119ce194d82a8951ea53f8928df994e62a23","observation_id":"f158cfed-04e4-4902-9f6e-83a441a3b82f","resolution":{"observed_at":"2026-08-03T05:04:13.571550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:13.728504Z","title":"GAIA : a benchmark for general AI assistants","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:13.728504Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:8ecec2267ef343d8bfac6ee1d58c333c808557887ca0cd0c14544ed4a32468c0","observation_id":"378cf889-ba57-475d-ac26-67db445109dd","resolution":{"observed_at":"2026-08-03T05:04:13.728504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:13.836265Z","title":"Azure OpenAI service content filtering","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:13.836265Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:f07405f6df8afd53cf31486a17c8037031da74acaf792c6ee69e5ef56bbaa15f","observation_id":"96f72ca1-9ef4-4b61-8561-f97bbc4c1db5","resolution":{"observed_at":"2026-08-03T05:04:13.836265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15361","last_updated":"2025-08-21T08:43:35Z","snapshot_observed_at":"2026-08-05T17:59:24.133258Z","submitted_at":"2025-08-21T08:43:35Z","title":"A Survey on Large Language Model Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15361","snapshot_observed_at":"2026-08-03T05:04:13.908579Z","title":"A survey on large language model benchmarks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:13.908579Z"},"links":{"cited_paper":"/paper/2508.15361","citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:ab886ebc1490e9e24b64292455542232f354d5e921d2d89a5a11979136038eff","observation_id":"db88210b-8749-4036-9c9c-4d316f149e1e","resolution":{"observed_at":"2026-08-03T05:04:13.908579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:13.974461Z","title":"Function calling - openai api documentation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:13.974461Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:98ff9caa3aebc9981b05af6004721c926d9649e0f1a84f6843a7ba181d189f53","observation_id":"4eef9df0-8edb-4402-9289-0b1344d2b6ad","resolution":{"observed_at":"2026-08-03T05:04:13.974461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T05:04:14.057324Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:14.057324Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:bdb201d16a1e2f3c60f295cbcd12e4cbd659902c17abfc158449da876aee2070","observation_id":"42f1b1de-4e34-4903-beee-b2106e918c3f","resolution":{"observed_at":"2026-08-03T05:04:14.057324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08560","last_updated":"2024-02-12T18:59:46Z","snapshot_observed_at":"2026-08-03T06:31:15.541423Z","submitted_at":"2023-10-12T17:51:32Z","title":"MemGPT: Towards LLMs as Operating Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08560","snapshot_observed_at":"2026-08-03T05:04:14.139977Z","title":"G., Stoica, I., and Gonzalez, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:14.139977Z"},"links":{"cited_paper":"/paper/2310.08560","citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:863d1dd53f8afcc279ac2bc42e47466d8a2361e72aefd0e2968f105a43c128fe","observation_id":"5d09e4dc-ee68-40a9-9ce6-ca110743ebb0","resolution":{"observed_at":"2026-08-03T05:04:14.139977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:14.230687Z","title":"S., O'Brien, J., Cai, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:14.230687Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:6ac32f6a04abf041e7a280e3d502ac3d305320d896e36bf971ec8c064d4494b8","observation_id":"d2981640-1520-450f-bd77-70b243ffccdd","resolution":{"observed_at":"2026-08-03T05:04:14.230687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:14.325530Z","title":"G., Mao, H., Yan, F., Ji, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:14.325530Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:4da294fad71d8027d54b47975c89e37771f471597ca070e393830fb763610e02","observation_id":"22a646c9-a7f2-4cc7-a22c-80c1c86d7ed6","resolution":{"observed_at":"2026-08-03T05:04:14.325530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:14.419946Z","title":"G., Mao, H., Yan, F., Ji, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:14.419946Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:198315329b091fbcb60045e8eb4afb0a7acb9aced90d43a7d9bcb239a9f07c71","observation_id":"6778dd92-366c-4159-9a06-ef617fd1bb84","resolution":{"observed_at":"2026-08-03T05:04:14.419946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:14.488605Z","title":"L., Stickland, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:14.488605Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:8bc28d2642b4d04eabc1ae6c35abdd1e6ebc8dc43427d4c52e7cdb015c86e914","observation_id":"252b5d42-54a0-47b2-b8e0-738ab7ad5b26","resolution":{"observed_at":"2026-08-03T05:04:14.488605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:14.588872Z","title":"V., Wolf, T., von Werra, L., and Kaunismäki, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:14.588872Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:cfcdea19eb00349904e72420a142692d00aa7b410da10a044942770ebca13683","observation_id":"01e41707-d24a-45cb-9cbc-4e003ec2cb9b","resolution":{"observed_at":"2026-08-03T05:04:14.588872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:14.693687Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:14.693687Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:a49bd8dcbcd18dedec9bfddcb17c153ba682cf175ee8b1a8f670ff204df4dd8c","observation_id":"520e85b2-a3a8-4ea0-bace-bef0a15e27d3","resolution":{"observed_at":"2026-08-03T05:04:14.693687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:14.791913Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:14.791913Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:6dc7fd5ace34a9cf0957461f4123ab634566c4e08fbb172202d19721e7c93cf2","observation_id":"bb249512-9a9f-4bec-bf69-09ee06011c01","resolution":{"observed_at":"2026-08-03T05:04:14.791913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-03T05:04:14.889884Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:14.889884Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:42633fc92061846ae9cea7f33911e1e0d4beacd6e108d0093f2f6f7761fd43f6","observation_id":"4ec55e08-3610-460a-8fa8-978bf76a9612","resolution":{"observed_at":"2026-08-03T05:04:14.889884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-03T05:04:14.958910Z","title":"Gemini: A family of highly capable multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:14.958910Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:43b78d19f215ac62569369d58c83bce7044cc6952a2b78f21c2ee8f437b97f4d","observation_id":"72944ad9-c834-43ba-80d4-89bbc66e5aae","resolution":{"observed_at":"2026-08-03T05:04:14.958910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:15.053674Z","title":"K.-W., and Lim, E.-P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:15.053674Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:addbbc2f38f093b081e226f60e8e90c46ecfa74ae697730ff5eaac31e421898d","observation_id":"35708533-ccd4-4fce-83af-99656ff3ee5b","resolution":{"observed_at":"2026-08-03T05:04:15.053674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:15.158259Z","title":"H., Le, Q","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:15.158259Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:3a0f7bfcb9e4125c8830fcec7e17842363726400630c29f79d601f276db516ae","observation_id":"ea711ec0-09bc-444b-8cfd-600a0b411635","resolution":{"observed_at":"2026-08-03T05:04:15.158259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-03T00:43:33.338074Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-03T05:04:15.262351Z","title":"W., Passos, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:15.262351Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:3d785a252570fa1ff4890e00c7b3f528b3dc3d03f6f860c6cc038e00621ded5f","observation_id":"7f7c4e4c-2dc0-4641-9dc0-38283dc68d21","resolution":{"observed_at":"2026-08-03T05:04:15.262351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:15.329849Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:15.329849Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:b0a10f8ef72567864883d6aadc01617ecf34230c7a07a1912e39483a9df59af8","observation_id":"30420ef0-b37c-4c03-a73f-fc65250f0d99","resolution":{"observed_at":"2026-08-03T05:04:15.329849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:15.398443Z","title":"The rise and potential of large language model based agents: a survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:15.398443Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:6804ff19e3af45e0843e98424677f6697dc3c062f87afdf2b8b7c5933ee2cb24","observation_id":"63de209f-4ae3-458f-8d20-3d976c57c1ae","resolution":{"observed_at":"2026-08-03T05:04:15.398443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:15.465089Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:15.465089Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:52218977aea2a49b6a5247617f0a362f441f52b9ff81e060a1791baef35585be","observation_id":"22e99c27-6cce-4499-8e9d-28ad12a93701","resolution":{"observed_at":"2026-08-03T05:04:15.465089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:15.561654Z","title":"R., and Cao, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:15.561654Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:8999d9dfe091e8bfd4fbadf48c51663149a04d5cf1c32af204a8fb53dd8e7226","observation_id":"379f00b6-1e69-4952-a58c-98a45d039688","resolution":{"observed_at":"2026-08-03T05:04:15.561654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:15.661274Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:15.661274Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:08aac1439dedf8e02fe8ac58bfa9c0391ff0c057012d1cd4b53d2a7e431a29c0","observation_id":"9762af1a-e321-4455-bd31-9ced99ef36fe","resolution":{"observed_at":"2026-08-03T05:04:15.661274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:15.737840Z","title":"A survey on trustworthy llm agents: Threats and countermeasures","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:15.737840Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:9e503c5510f25708b96f073e2e1b17d26ee7d077a41fe311bf7d1d2303d5438c","observation_id":"3a6e546f-8f8a-4a11-977c-190bc574099e","resolution":{"observed_at":"2026-08-03T05:04:15.737840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:15.825855Z","title":"H., Cao, S., Kozyrakis, C., Stoica, I., Gonzalez, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:15.825855Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:7be6654c0328dfcf7c89c8e52560b1c6cfecd1d787b2a8e2c3650a7b1786860b","observation_id":"e932584d-6be4-476e-bf41-8e77a32c0b86","resolution":{"observed_at":"2026-08-03T05:04:15.825855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:15.933687Z","title":"M ulti A gent B ench : Evaluating the collaboration and competition of LLM agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:15.933687Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:61f83ab16ea920e95c67b43ce2bb7357dcd72687684422fb464345e05de36524","observation_id":"cbf15d2c-7431-4e0b-ab3f-025811aa859b","resolution":{"observed_at":"2026-08-03T05:04:15.933687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:04:16.033411Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T05:04:16.033411Z"},"links":{"citing_paper":"/paper/2602.03238"},"observation_digest":"sha256:dac90a5155f41fe99005a0746fa2643a28f4716e9749f89b9fae6651fa352877","observation_id":"283c732b-7126-44d9-a4f2-1a8bc40c39f1","resolution":{"observed_at":"2026-08-03T05:04:16.033411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.03238","last_updated":"2026-05-26T10:32:10Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-03T05:04:10.359492Z","submitted_at":"2026-02-03T08:18:37Z","title":"The Necessity of a Unified Framework for LLM-Based Agent Evaluation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 2 inbound Pith citation observations for arXiv:2602.03238."}