{"as_of":"2026-08-11T01:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3af22bc2448274cf6482b0d14de63f9eabcb96f18b4f5daf2a53ccd4df083216","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T05:52:48.176696Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07346/citation-record","integrity":"/paper/2608.07346/integrity","json":"/paper/2608.07346/citation-record.json","paper":"/paper/2608.07346"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T05:52:48.085855Z","title":"Mark Chen, Jerry Tworek, Heewoo Jun, Qiming Yuan, Henrique Ponde De Oliveira Pinto, Jared Kaplan, Harri Edwards, Yuri Burda, Nicholas Joseph, Greg Brockman, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.085855Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:4fd8a103a961b87611bcd25d5ca892ade48e721b5dc894df37c41a920fc1c826","observation_id":"5625cc56-5b20-443e-bde5-a3cc049f14d4","resolution":{"observed_at":"2026-08-10T05:52:48.085855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-08-10T05:52:48.098487Z","title":"Swe-bench pro: Can ai agents solve long-horizon software engineering tasks?arXiv preprint arXiv:2509.16941,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.098487Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:339be49f9f9f121e617282c3366c579241d996e7be2056687764a26f43bcf925","observation_id":"1a54921d-cc84-44e7-8ee1-3c99ee4bfb3d","resolution":{"observed_at":"2026-08-10T05:52:48.098487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18241","last_updated":"2024-11-27T11:29:17Z","snapshot_observed_at":"2026-07-06T19:57:51.125083Z","submitted_at":"2024-11-27T11:29:17Z","title":"Exploration of LLM Multi-Agent Application Implementation Based on LangGraph+CrewAI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18241","snapshot_observed_at":"2026-08-10T05:52:48.102698Z","title":"Exploration of llm multi-agent application implementation based on langgraph+ crewai.arXiv preprint arXiv:2411.18241,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.102698Z"},"links":{"cited_paper":"/paper/2411.18241","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:47097b80165b87204736897d4b34ca8332a7938672e4565588c645ffddb9cc8c","observation_id":"db198a5b-35bc-4d38-a853-3cf7de2b12b1","resolution":{"observed_at":"2026-08-10T05:52:48.102698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.535768Z","title":"AgentQuest: A modular benchmark framework to measure progress and improve LLM agents","venue":null,"work_id":"d8d08dd8-5c8f-4ea5-8242-d4068b0d28e2","year":2024},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.105912Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:916559adb9550a51596c3fc5c49f18ea1bcfd6fe52a27b5f64235560dc4f04e0","observation_id":"3eb138b2-b36f-4c69-8065-0659313dbba7","resolution":{"observed_at":"2026-08-10T05:52:48.539262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.108994Z","title":"doi: 10.18653/v1/ 2024.naacl-demo.19","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.108994Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:603a0b50e90f644fc45a705b2176030d73842d87b08cbb7d1becb8bc4566e2ee","observation_id":"65bdc42a-287d-4d87-bf08-93c141cd6b4b","resolution":{"observed_at":"2026-08-10T05:52:48.108994Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-10T05:52:48.112150Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.112150Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:f33d7a9f5a1874a1cab20745ff802a4c6b80049fa8252a0c99656210167b2de1","observation_id":"04d89948-296e-4634-a31b-577117c37761","resolution":{"observed_at":"2026-08-10T05:52:48.112150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.122129Z","title":"Percy Liang, Rishi Bommasani, Tony Lee, Dimitris Tsipras, Dilara Soylu, Michihiro Yasunaga, Yian Zhang, Deepak Narayanan, Yuhuai Wu, Ananya Kumar, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.122129Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:a233210706a247b24a58256504dc926cb9206719912ec27c16c2407a858b9d33","observation_id":"408085aa-2f01-4960-bb53-84efac2b1c56","resolution":{"observed_at":"2026-08-10T05:52:48.122129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.128965Z","title":"URL https://proceedings.neurips.cc/paper_files/paper/2024/hash/ 877b40688e330a0e2a3fc24084208dfa-Abstract-Datasets_and_Benchmarks_Track.html","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.128965Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:e950598307388870cc6abc614d75c4f7b87cfc891c8c2c20c40012461603c9a1","observation_id":"3817d661-2696-4aea-93b4-b902cef122b0","resolution":{"observed_at":"2026-08-10T05:52:48.128965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-10T05:52:48.136857Z","title":"Todor Mihaylov, Peter Clark, Tushar Khot, and Ashish Sabharwal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.136857Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:e1e0ad914d3d080c4128b93acc7e225b350b833f8e777fa29a3a4957caa276b5","observation_id":"d5c090e1-e6ea-44b7-b0d9-017520822c2a","resolution":{"observed_at":"2026-08-10T05:52:48.136857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04374","last_updated":"2025-10-05T21:36:43Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T21:36:43Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04374","snapshot_observed_at":"2026-08-10T05:52:48.144277Z","title":"Sidharth Pulipaka, Oliver Chen, Manas Sharma, Taaha S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.144277Z"},"links":{"cited_paper":"/paper/2510.04374","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:68c93d09c07253fa3b8912384d9df869faebb9176e196f98eefb3c7f5c241257","observation_id":"f3c75470-fc93-44e4-9e36-be13b64de80c","resolution":{"observed_at":"2026-08-10T05:52:48.144277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-10T05:52:48.147679Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.147679Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:2700fa3a523ef367264139e571718ca3e68420b49d3f13ea5b1dcffbc2955b96","observation_id":"139e6e5a-fff7-4f4d-87e6-4455a1230951","resolution":{"observed_at":"2026-08-10T05:52:48.147679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.525297Z","title":"Challenging big-bench tasks and whether chain-of- thought can solve them","venue":null,"work_id":"ed7e0b2b-94d6-4811-84f5-50518d8a35c3","year":2023},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.154853Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:3c3f50d29a17b0b86f3008feb5a2c345a9a28942e65505188927f5bda54f8e14","observation_id":"1b5f96d7-880a-4d91-b219-8ca16ce2a11f","resolution":{"observed_at":"2026-08-10T05:52:48.528742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.515171Z","title":"Commonsenseqa: A question answering challenge targeting commonsense knowledge","venue":null,"work_id":"98ab77fa-8d60-4e10-83df-54c9e9c455eb","year":2019},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.158585Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:87ca8dff5072960c2cce3387ff7e3948955f01adddee8bef1a760d7544104c2e","observation_id":"11cf1d65-33b9-46f8-8219-5cb159b44821","resolution":{"observed_at":"2026-08-10T05:52:48.518772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08155","last_updated":"2023-10-03T20:47:10Z","snapshot_observed_at":"2026-08-08T22:28:26.004138Z","submitted_at":"2023-08-16T05:57:52Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08155","snapshot_observed_at":"2026-08-10T05:52:48.161998Z","title":"Autogen: Enabling next-gen llm applications via multi-agent conversation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.161998Z"},"links":{"cited_paper":"/paper/2308.08155","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:ca5fed98cd1258b13d0181abb60168e48878cd64de888a54fdb3e111f87b3827","observation_id":"dc862431-79e6-4274-bd6b-2e62e90a1f64","resolution":{"observed_at":"2026-08-10T05:52:48.161998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.165568Z","title":"URL https: //aclanthology.org/2025.acl-long.1355/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.165568Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:09a3e0d74c5c630b695d39a5187da5289a74c94a8c00651de98ec969cb749a9c","observation_id":"29cd5a68-1edd-45f6-b352-5db9ba220843","resolution":{"observed_at":"2026-08-10T05:52:48.165568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-08T21:08:39.676079Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-10T05:52:48.169156Z","title":"Matei Zaharia, Andrew Chen, Aaron Davidson, Ali Ghodsi, Sue Ann Hong, Andy Konwinski, Siddharth Murching, Tomas Nykodym, Paul Ogilvie, Mani Parkhe, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.169156Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:89f19cb0b8e961e8ab912a9062305ea0fea5492113d291f9cbb6bbc8696cb022","observation_id":"4cd9036f-7a42-413c-be52-d7ab72ab06a0","resolution":{"observed_at":"2026-08-10T05:52:48.169156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.504110Z","title":"Agieval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":"0c79a092-7ba3-4bf5-9d2e-c1e7a22ed0f2","year":2024},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.173232Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:bf267061a01af4d7de30e98bf4e512753c2d1dbf060c79480820477766654303","observation_id":"967a22cf-b289-4992-9ea8-4cdfa8037e74","resolution":{"observed_at":"2026-08-10T05:52:48.507977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.493004Z","title":"Webarena: A realistic web environment for building autonomous agents","venue":null,"work_id":"efccaa4d-c01f-4707-a2bc-8fe9b4583c04","year":2024},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.176696Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:2cb92b72053b5efd72472418ee684754952890bd1f71611f583a44e80de238f1","observation_id":"1193309a-467b-4d65-9667-62c9f12175ac","resolution":{"observed_at":"2026-08-10T05:52:48.497017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T05:52:48.094149Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.094149Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:9d54a88287a342f0751da5e21fc266ed1219bdc6a7db51beb28e97951f43f2f3","observation_id":"539b6acb-6091-478a-b9be-ec9b3644bcb4","resolution":{"observed_at":"2026-08-10T05:52:48.094149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-10T05:52:48.115676Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.115676Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:d8aaf8f30caa5923c87ca6b9ec9e08a345bbc7706433f58bbb34ea6c4dc86aee","observation_id":"0348cd40-320d-423a-bdfc-bc61eea4c093","resolution":{"observed_at":"2026-08-10T05:52:48.115676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-10T05:52:48.089974Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.089974Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:53c4850e1eaa4b3eb604322dcc80639c4774232587a2b308a49002ce0828778b","observation_id":"fc4b48c1-a2ab-40ad-b5d2-933213c61d98","resolution":{"observed_at":"2026-08-10T05:52:48.089974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-10T05:52:48.125316Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.125316Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:8a47ae2dba6391a4f870351c810db1a78739a7c290101d4af33399bd00bfc417","observation_id":"ed8b3f05-daae-4ebf-92d7-bf465ad0e3ba","resolution":{"observed_at":"2026-08-10T05:52:48.125316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.04874","last_updated":"2026-06-05T05:23:52Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T13:37:47Z","title":"Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents","version":2},"cited_work":{"arxiv_id":"2606.04874","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.04874","snapshot_observed_at":"2026-08-10T05:52:48.238137Z","title":"Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents","venue":"cs.CL","work_id":"f1cc9e10-38db-4c2b-b353-36e15c589768","year":2026},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.151220Z"},"links":{"cited_paper":"/paper/2606.04874","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:d7bee2127ea0e1ce681a3383cb16786fc3e8ba81f33f005ae258dca4aa43e222","observation_id":"aaeede7f-642d-4d82-8cfc-e039574f507f","resolution":{"observed_at":"2026-08-10T05:52:48.244282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-10T05:52:48.081468Z","title":"Victor Barres, Ben Shi, Ola Zytek, Soham Ray, Keshav Dhandhania, and Pedram Razavi.τ 3-Bench: Advancing agent evaluation to knowledge and voice","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.081468Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:cdd16afec74ed94323e3190497cc71509f4ab00fe2cb79bed7c2f1f428bf81bc","observation_id":"a8fbcf01-2c69-4ddb-8a7a-dcadbdc527ce","resolution":{"observed_at":"2026-08-10T05:52:48.081468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22953","last_updated":"2026-05-11T10:27:38Z","snapshot_observed_at":"2026-08-10T09:42:09.423320Z","submitted_at":"2026-02-26T12:48:02Z","title":"General Agent Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.22953","snapshot_observed_at":"2026-08-10T05:52:48.077579Z","title":"Presented at the ICLR 2026 Workshop on Agents in the Wild","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.077579Z"},"links":{"cited_paper":"/paper/2602.22953","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:779bf93776073a6806f0a2be70fa7a267d62eb2e092d3970bd4fab5af261aef6","observation_id":"f020150e-188f-4d8b-bf9e-c106e2db9075","resolution":{"observed_at":"2026-08-10T05:52:48.077579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-11T01:15:40.030912Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2608.07346."}