{"as_of":"2026-08-02T13:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a9b0fe43bfd0eefceb7ed862d4cbb2a0ec6a6d5226cf0a30a8a4100957bf2cb8","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T08:00:45.789649Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:04:24.398577Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.16706","snapshot_observed_at":"2026-07-14T07:06:37.817238Z","title":"arXiv preprint arXiv:2604.16706 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11098","last_updated":"2026-07-15T06:22:24Z","snapshot_observed_at":"2026-08-02T13:01:45.159348Z","submitted_at":"2026-07-13T05:14:12Z","title":"AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-14T07:06:37.817238Z"},"links":{"cited_paper":"/paper/2604.16706","citing_paper":"/paper/2607.11098"},"observation_digest":"sha256:b36a15386ca04bfc4d9c0e457bcd61a46379f969ef585567d8661202b4f10f6b","observation_id":"33f66bf7-ec2b-46af-b59e-761d2af92727","resolution":{"observed_at":"2026-07-14T07:06:37.817238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.16706","snapshot_observed_at":"2026-08-02T07:04:24.398577Z","title":"arXiv preprint arXiv:2604.16706 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11098","last_updated":"2026-07-15T06:22:24Z","snapshot_observed_at":"2026-08-02T13:01:45.159348Z","submitted_at":"2026-07-13T05:14:12Z","title":"AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T07:04:24.398577Z"},"links":{"cited_paper":"/paper/2604.16706","citing_paper":"/paper/2607.11098"},"observation_digest":"sha256:29a87836cb39cabf8af7544b313c8c9433b2f1f8d243a273ca872dc106146a42","observation_id":"b504a754-8419-45f3-a8c2-f4915f885fee","resolution":{"observed_at":"2026-08-02T07:04:24.398577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.16706/citation-record","integrity":"/paper/2604.16706/integrity","json":"/paper/2604.16706/citation-record.json","paper":"/paper/2604.16706"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3791.369841","doi":"10.1145/3673791.3698410","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Krisztian Balog, Donald Metzler, and Zhen Qin","venue":null,"work_id":"963d5b72-bb86-4a9b-83c2-ef7524ee7954","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:e639ff3c7742b92eea24dd583cec7ba33468bc62449e87015dca076cb42e8ac0","observation_id":"b93512f3-f6a7-4429-96fc-8429d87f3c1f","resolution":{"observed_at":"2026-05-10T08:02:24.369234Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19092","last_updated":"2025-07-09T22:09:49Z","snapshot_observed_at":"2026-07-06T20:58:01.696522Z","submitted_at":"2025-03-24T19:24:40Z","title":"Rankers, Judges, and Assistants: Towards Understanding the Interplay of LLMs in Information Retrieval Evaluation","version":2},"cited_work":{"arxiv_id":"2503.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19092","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rankers, judges, and assis- tants: Towards understanding the interplay of llms in information retrieval evaluation","venue":null,"work_id":"8ec596f8-d04b-435f-ad7c-88158bc3fd05","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2503.19092","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:2a6b3daf61a5c4eb064f10d70b49cea3d63868cd4c530235f7201edc6d9e6962","observation_id":"a4f6cfe1-bb76-4158-a342-97083b4e70f5","resolution":{"observed_at":"2026-05-10T08:02:24.979582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":"2506.07982","doi":"10.48550/arxiv.2506.07982","metadata_source":"pith","pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","venue":"cs.AI","work_id":"3a498b1a-455f-4667-b572-c5216c99a89c","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:4229849a4153d866ad49f94515e40df935ba208068eba0861ab9e9b476dac495","observation_id":"c0443dad-030b-4911-9d9f-52715a0643d6","resolution":{"observed_at":"2026-05-12T07:52:17.902869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18403","last_updated":"2025-06-02T11:31:19Z","snapshot_observed_at":"2026-07-06T18:37:21.973331Z","submitted_at":"2024-06-26T14:56:13Z","title":"LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation Tasks","version":3},"cited_work":{"arxiv_id":"2406.18403","doi":"10.48550/arxiv.2406.18403","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18403","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint (2025), https://arxiv.org/abs/ 2406.18403","venue":null,"work_id":"5ea289bf-9578-446a-a0be-2f8aa10813e0","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2406.18403","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:6b31b28dfe103de76c9804311bc409dd6434f4254550dd205e105d02db4697c8","observation_id":"894f4d4a-d92d-4f67-8db3-f8d7c631899c","resolution":{"observed_at":"2026-05-10T08:02:24.964601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1177/001316446002000104","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:57:06.823828Z","title":"A coefficient of agreement for nominal scales.Educational and Psychological Measurement, 20(1):37–46","venue":"Educational and Psychological Measurement","work_id":"acc7eb00-fd37-4883-9f25-f4e7057b60f0","year":1960},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:6ba04dd126fcc6a045c6a4282a9a8107222776c3d81aa5cac955d4eacacd9adf","observation_id":"1982637d-2fad-4555-9868-189c85bf8fb4","resolution":{"observed_at":"2026-05-10T08:02:24.365360Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:14.800511+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:14.800511+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15217","last_updated":"2025-04-28T05:09:12Z","snapshot_observed_at":"2026-07-06T16:24:01.868957Z","submitted_at":"2023-09-26T19:23:54Z","title":"Ragas: Automated Evaluation of Retrieval Augmented Generation","version":2},"cited_work":{"arxiv_id":"2309.15217","doi":"10.48550/arxiv.2309.15217","metadata_source":"pith","pith_arxiv_id":"2309.15217","snapshot_observed_at":"2026-07-10T16:57:24.489217Z","title":"Ragas: Automated Evaluation of Retrieval Augmented Generation","venue":"cs.CL","work_id":"1820f37c-e2c1-4f5c-81b1-3b81aa324cab","year":2023},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2309.15217","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:de479e9d39784563c598f4c1f3a31a7f48b7a06616a991064d74a82c91955c27","observation_id":"347df548-b830-467d-aa4e-2a4d1785a44d","resolution":{"observed_at":"2026-05-16T21:37:40.926471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-024-07421-0","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:37:44.753801Z","title":"Farquhar, J","venue":"Nature","work_id":"01db46ad-1693-4ad4-96c9-8f4620693f17","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:5fbe5405e3765ea3ca1d6784f572b9742739e2cdd005acf6ee5bbbfa623affa5","observation_id":"722986dc-69df-4417-9c05-8f4d29ab3bb6","resolution":{"observed_at":"2026-05-10T08:02:24.374673Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-11T12:19:07.31045+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T12:19:07.31045+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.12434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.905697Z","title":"Videorft: Incentivizing video reasoning capability in mllms via reinforced fine-tuning","venue":null,"work_id":"89c249fe-60da-4724-bb0c-770442676a88","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:04170484cc447936eb4a8a6e011b7a411214ddb2a0c3b1e8f73966c103399679","observation_id":"e19a740d-89fd-4719-92c4-033f2953b5be","resolution":{"observed_at":"2026-05-10T08:02:24.969672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":"2411.15594","doi":"10.1016/j.xinn.2025.101253","metadata_source":"pith","pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"A Survey on LLM-as-a-Judge","venue":"cs.CL","work_id":"2676656a-67bd-4ad5-bad6-cb6f5fcdbfbe","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:394eb1ad7a5dbb42a0c156cf8293ef555cd89283ac984eb2ab9c5a7edf8882a3","observation_id":"96d1e742-97c9-4f62-8017-650134e2715c","resolution":{"observed_at":"2026-05-10T08:02:24.959501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":"2311.05232","doi":"10.48550/arxiv.2311.05232","metadata_source":"pith","pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-07-10T08:06:57.833199Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","venue":"cs.CL","work_id":"6389ea5a-8e37-498f-9bb2-a238ae4b3b9d","year":2023},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:059fd1ab161e166d9569623dabf64f7cfd368cdf71a00ce6292ca6629861c147","observation_id":"03c46076-2444-48de-b579-f21a78039509","resolution":{"observed_at":"2026-05-13T02:46:27.888032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2307/2529310","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T04:05:55.438451Z","title":"Richard Landis and Gary G","venue":null,"work_id":"30e005db-280a-4cd9-a480-53e42284c29e","year":1977},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:3f3f6cb594e80f06272c8f53397abb8ada99341bd2256c605948482fbf4f7efb","observation_id":"d5830afb-2fe5-4599-9684-bf9b972c93f5","resolution":{"observed_at":"2026-05-10T08:02:24.371924Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-09T07:49:08.045384+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T07:49:08.045384+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18970","doi":"10.48550/arxiv.2509.18970","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"LLM-based agents suffer from hallucinations: A survey of taxonomy, methods, and directions","venue":null,"work_id":"78f61cb8-1c72-482c-9dd4-661168d02652","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:5de2b55e8688cb9a0ea703d887bf506ad798ce61d234bcaa48ffbf357db53df0","observation_id":"4bb8cc40-d144-4315-b4cd-0bd193dcff07","resolution":{"observed_at":"2026-05-10T08:02:24.977159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-07-06T16:03:30.529010Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":"2308.03688","doi":"10.1109/fllm63129.2024.10852426","metadata_source":"pith","pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AgentBench: Evaluating LLMs as Agents","venue":"cs.AI","work_id":"a37549b4-4c94-412d-acc4-4efeb08509be","year":2023},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:f723b39791fe7e3c8425bc06d22693b55040fcfca8e0aa0e403d373c4811541c","observation_id":"747a18a9-7c70-4bdd-8932-3306f4902bb9","resolution":{"observed_at":"2026-05-11T11:40:05.312349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.06818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:59:37.220284Z","title":"AgentHallu: Benchmarking automated hallucination attribution of LLM-based agents","venue":null,"work_id":"75b5d129-5730-473e-a3b0-1f3b00f0eecb","year":2026},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:266fbb97c52772ce708a2da484487d535386b45f24d1c5bdf4b47d224a8408d0","observation_id":"e9f13570-68cd-49f0-851e-225019763238","resolution":{"observed_at":"2026-05-10T08:02:24.987100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08896","last_updated":"2023-10-11T17:43:28Z","snapshot_observed_at":"2026-07-06T15:03:55.982628Z","submitted_at":"2023-03-15T19:31:21Z","title":"SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models","version":3},"cited_work":{"arxiv_id":"2303.08896","doi":"10.48550/arxiv.2303.08896","metadata_source":"pith","pith_arxiv_id":"2303.08896","snapshot_observed_at":"2026-07-10T18:27:31.339843Z","title":"SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models","venue":"cs.CL","work_id":"90efebf6-4006-4176-9bf1-21a876571751","year":2023},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2303.08896","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:a7a10e8dcc17b316439316d0846428c82aacecf98c9bff437966e2de1edd3a13","observation_id":"ce27df5c-9ea0-4776-841a-729af5d0bf7a","resolution":{"observed_at":"2026-05-15T15:11:22.649439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.24565","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:38:43.976743Z","title":"Ziyang Luo, Zhiqi Shen, Wenzhuo Yang, Zirui Zhao, Prathyusha Jwalapuram, Amrita Saha, Doyen Sahoo, Silvio Savarese, Caiming Xiong, and Junnan Li","venue":null,"work_id":"5a6e4a9c-6bec-41d4-b62b-2ce3183a8579","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:98dd41c330c5da7c41b3af06f8ab6e3bf9e910df17de1bd02f3fa26d360233b2","observation_id":"7c9cb805-072f-4416-b1a3-8c3a330cc5b5","resolution":{"observed_at":"2026-05-10T08:02:24.972157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00396","last_updated":"2024-05-17T06:29:31Z","snapshot_observed_at":"2026-07-06T17:10:16.873073Z","submitted_at":"2023-12-31T04:43:45Z","title":"RAGTruth: A Hallucination Corpus for Developing Trustworthy Retrieval-Augmented Language Models","version":2},"cited_work":{"arxiv_id":"2401.00396","doi":"10.48550/arxiv.2401.00396","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.00396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Hadas Orgad, Michael Toker, Zorik Gekhman, Roi Re- ichart, Idan Szpektor, Hadas Kotek, and Yonatan Belinkov","venue":null,"work_id":"c6c38c54-f8d2-4e9e-b93c-c2d53621a6d7","year":2023},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2401.00396","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:fa0181bf7f974b2babde0ca773fdcced58339fedb90027402de9fbbb443bb7f1","observation_id":"01c3f8a3-5262-4b46-abde-c66aaaf1f6b1","resolution":{"observed_at":"2026-05-10T08:02:24.962158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6772.365794","doi":"10.1145/3626772.3657942","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"In: Yang, G.H., Wang, H., Han, S., Hauff, C., Zuccon, G., Zhang, Y","venue":null,"work_id":"ee659b54-d1fd-41ae-a932-c76f02f455b5","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:9e45686c7fe49ae61f81c0f133d69f351446d2ac3ed90a58abbd01b54a3dc433","observation_id":"f92234bf-83be-4c8a-a91d-296d73f7f277","resolution":{"observed_at":"2026-05-10T08:02:24.354859Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6772.365795","doi":"10.1145/3626772.3657951","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proceedings of the 47th International ACM SIGIR Conference on Research and Development in Information Retrieval , pages =","venue":null,"work_id":"bcb88936-c10a-4b7d-b1e3-d23204299406","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:787ca3cfa38e02078c681a54cda3117e732b2dbe12bc39d3932e2b3dc9fe6857","observation_id":"911c8154-7ed0-4cb5-ae30-e7a78005e804","resolution":{"observed_at":"2026-05-10T08:02:24.347506Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12509","last_updated":"2025-02-18T15:24:25Z","snapshot_observed_at":"2026-08-01T23:28:04.240794Z","submitted_at":"2024-12-17T03:37:31Z","title":"Can You Trust LLM Judgments? Reliability of LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":"2412.12509","doi":"10.48550/arxiv.2412.12509","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12509","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Can you trust llm judgments? reliability of llm-as- a-judge","venue":null,"work_id":"fbc020bc-197e-43ce-92fd-3dca29743d27","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2412.12509","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:e810865f35f9ce1ce3d2e4edd9b86fb80e12d3cb22cd559885601872aa487c40","observation_id":"a506623b-98f4-4159-9a21-1e3775c73ae6","resolution":{"observed_at":"2026-05-10T08:02:24.999729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15133","last_updated":"2025-03-26T13:08:41Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T15:38:12Z","title":"Don't Use LLMs to Make Relevance Judgments","version":2},"cited_work":{"arxiv_id":"2409.15133","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15133","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2409.15133","venue":null,"work_id":"548bccb0-f480-458b-af6b-cf1c78e54eed","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2409.15133","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:5bd08ce6321f995efa96c6efa3a1b2182f1cc73975cf66a5d6b5208a80a3de43","observation_id":"d962f3e3-e2d6-43fc-bc9d-f23beb0206c7","resolution":{"observed_at":"2026-05-10T08:02:24.994461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12624","last_updated":"2025-08-18T00:07:23Z","snapshot_observed_at":"2026-08-01T14:58:17.402553Z","submitted_at":"2024-06-18T13:49:54Z","title":"Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges","version":6},"cited_work":{"arxiv_id":"2406.12624","doi":"10.48550/arxiv.2406.12624","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12624","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Judging the judges: Evaluating alignment and vulner- abilities in llms-as-judges","venue":null,"work_id":"d0e0145b-d0f4-43ff-8b70-fee617aaf5c5","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2406.12624","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:a214bced51b314ea3ca515c6516ac520be7ed2331738cb62398cb80b95d95a96","observation_id":"98a09ffe-cc34-4299-8b87-cb3e37423673","resolution":{"observed_at":"2026-05-10T08:02:25.009796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6772.365770","doi":"10.1145/3626772.3657704","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"ISBN 9798400704314","venue":null,"work_id":"f5de09b2-7a52-4bc0-8246-44cab83b66eb","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:a0b0f5617eb70b15e09b458c7858e56651b392416583319954b48203822731fb","observation_id":"2cb13816-cab7-41f7-a857-1fdd14102449","resolution":{"observed_at":"2026-05-10T08:02:24.358733Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18666","last_updated":"2025-07-31T04:00:48Z","snapshot_observed_at":"2026-07-06T20:57:47.748881Z","submitted_at":"2025-03-24T13:31:48Z","title":"AgentSpec: Customizable Runtime Enforcement for Safe and Reliable LLM Agents","version":3},"cited_work":{"arxiv_id":"2503.18666","doi":"10.48550/arxiv.2503.18666","metadata_source":"pith","pith_arxiv_id":"2503.18666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"AgentSpec: Customizable Runtime Enforcement for Safe and Reliable LLM Agents","venue":"cs.AI","work_id":"2d265b31-7dcb-4ab3-8c83-e13bd5598435","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2503.18666","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:df26b83db1671add692d4926a8564809083b609314bf54d73e9f29d589c5a48b","observation_id":"7e54429f-3d8f-4a0b-8fe4-de845fd7585f","resolution":{"observed_at":"2026-05-14T21:24:32.777586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:f5e1e0a87aed63d53b798084642f3fd6a270e23d685e9553371ae84d5b8f5e7c","observation_id":"dd33ece9-5654-4f19-b8dd-fa39584858ba","resolution":{"observed_at":"2026-05-10T08:02:25.004745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05659","last_updated":"2025-04-11T16:51:59Z","snapshot_observed_at":"2026-07-06T20:48:41.069542Z","submitted_at":"2025-03-07T18:20:30Z","title":"A Survey of Large Language Model Empowered Agents for Recommendation and Search: Towards Next-Generation Information Retrieval","version":2},"cited_work":{"arxiv_id":"2503.05659","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.05659","snapshot_observed_at":"2026-07-02T15:27:04.848109Z","title":"On generative agents in recommendation","venue":null,"work_id":"5c3b08d2-4900-4524-a5fe-72a13c59b742","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2503.05659","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:7afd51f1639ba093279a2942d3c3f87f49685ae92d32f48109d8164dfec3b3ce","observation_id":"0692cdc7-69fd-4913-adea-25be4156338a","resolution":{"observed_at":"2026-05-10T08:02:24.997039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19557","last_updated":"2025-02-26T20:50:11Z","snapshot_observed_at":"2026-07-06T20:43:22.572496Z","submitted_at":"2025-02-26T20:50:11Z","title":"Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?","version":1},"cited_work":{"arxiv_id":"2502.19557","doi":"10.48550/arxiv.2502.19557","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.19557","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?","venue":null,"work_id":"47f144ed-a239-4c00-bd03-eae23ad603db","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2502.19557","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:4f77da47480e4ab5454a644873f52f29d9f69cdc1023446d606c3d40b4299915","observation_id":"e4370c7d-19fe-45f6-bbb4-5d9bb82833a9","resolution":{"observed_at":"2026-05-10T08:02:24.351219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":"2406.12045","doi":"10.48550/arxiv.2406.12045","metadata_source":"pith","pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-07-11T01:37:42.734447Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","venue":"cs.AI","work_id":"6a8d8dc4-0cc0-4052-8109-abbcdcd4a962","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:b3907390ef550fa679236331098d1a271450e395c3487c9dfd137b813ec29bb2","observation_id":"85ac5172-c564-4a96-a62e-0131fc66c5d6","resolution":{"observed_at":"2026-05-11T03:19:00.987380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16416","last_updated":"2026-04-23T17:36:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-20T17:59:23Z","title":"Survey on Evaluation of LLM-based Agents","version":2},"cited_work":{"arxiv_id":"2503.16416","doi":"10.48550/arxiv.2503.16416","metadata_source":"pith","pith_arxiv_id":"2503.16416","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Survey on Evaluation of LLM-based Agents","venue":"cs.AI","work_id":"d9ac1186-88b1-41bd-9bc7-8a0b87e6f305","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2503.16416","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:7e0e2a2c8da6b16cb4b59a8558b6267816257ce0b681368fd42ababbd6d5bca0","observation_id":"0f1a841e-dc10-40d0-b40d-52b4d4e22e49","resolution":{"observed_at":"2026-05-10T08:02:25.007134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-11T06:20:44.248546+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T06:20:44.248546+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2308.07107","doi":"10.48550/arxiv.2308.07107","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Large language models for information retrieval: A survey","venue":null,"work_id":"ff471f2d-dc3e-459c-81a9-9a40d29e96f8","year":2023},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:c4d0e96426785f19ed2df08a6a413587c272743d28ba52d1c311d7d7d13e667f","observation_id":"dada0be9-080c-4b50-bfc1-8021b455ae3a","resolution":{"observed_at":"2026-05-10T08:02:24.989481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-01T13:38:15.875295+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T13:38:15.875295+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3748302","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:05:44.159529Z","title":"A survey on the memory mechanism of large language model- based agents.ACM Transactions on Information Systems, 43(6):155:1–155:47","venue":null,"work_id":"523e1a9d-c782-4e01-9644-c33da60ddd2e","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:1b82df826cc1c97f93f8a758f915814475677c0867ed4b748f32d23ac8229964","observation_id":"24978f4b-1c75-49a6-9540-898137b7599e","resolution":{"observed_at":"2026-05-10T08:02:24.361394Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:38:14.23452+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:38:14.23452+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":"2306.05685","doi":"10.1109/4235.797969","metadata_source":"pith","pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":"cs.CL","work_id":"d0c30cd7-81e1-4159-a87f-f6adca77ff08","year":2023},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:793407f16333a541659dc46715ef9e2fa5f4e450074b80001c4a1de865ce3c90","observation_id":"5b395675-7da1-40a3-9490-314c7bb298d0","resolution":{"observed_at":"2026-05-10T18:52:59.240297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":0,"verified_exact":26,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 2 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 2 inbound Pith citation observations for arXiv:2604.16706."}