{"as_of":"2026-08-11T12:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4909e18f8cb5f0fa8489e611cd9649865384b64602f6eae3e378e666bda37fb3","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T15:09:29.436835Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.00392/citation-record","integrity":"/paper/2604.00392/integrity","json":"/paper/2604.00392/citation-record.json","paper":"/paper/2604.00392"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:09:29.436835Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:29.436835Z"},"links":{"citing_paper":"/paper/2604.00392"},"observation_digest":"sha256:553ffc499022b5b43c8003dcf1bf5f90b768702a6787827bc9ec32f79503d578","observation_id":"a6078026-838b-4373-b915-69d2ca1cdec1","resolution":{"observed_at":"2026-07-13T15:09:29.436835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.02766","last_updated":"2026-03-03T09:07:22Z","snapshot_observed_at":"2026-08-04T19:32:12.955430Z","submitted_at":"2026-03-03T09:07:22Z","title":"EvoSkill: Automated Skill Discovery for Multi-Agent Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.02766","snapshot_observed_at":"2026-07-13T15:09:29.436835Z","title":"[Backlund and Petersson(2025)] Axel Backlund and Lukas Petersson","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:29.436835Z"},"links":{"cited_paper":"/paper/2603.02766","citing_paper":"/paper/2604.00392"},"observation_digest":"sha256:cfd7f2e9b9a99befd245649d38c92ee3dd790036c1a663574852f0b3ce4c6add","observation_id":"717c58cf-3d4d-469d-a5ec-b2f38e0b0634","resolution":{"observed_at":"2026-07-13T15:09:29.436835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15840","last_updated":"2025-02-20T15:52:29Z","snapshot_observed_at":"2026-08-10T13:31:57.703896Z","submitted_at":"2025-02-20T15:52:29Z","title":"Vending-Bench: A Benchmark for Long-Term Coherence of Autonomous Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15840","snapshot_observed_at":"2026-07-13T15:09:29.436835Z","title":"[Cai et al.(2023)] Tianle Cai, Xuezhi Wang, Tengyu Ma, Xinyun Chen, and Denny Zhou","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:29.436835Z"},"links":{"cited_paper":"/paper/2502.15840","citing_paper":"/paper/2604.00392"},"observation_digest":"sha256:6928be07588cffb39c51b48481d2c4f076efa45842b8b5ff90c135c72582db19","observation_id":"b5035e18-9b49-4d02-810c-bb368d148b38","resolution":{"observed_at":"2026-07-13T15:09:29.436835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17126","last_updated":"2024-03-11T01:15:09Z","snapshot_observed_at":"2026-08-08T08:24:10.267770Z","submitted_at":"2023-05-26T17:50:11Z","title":"Large Language Models as Tool Makers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17126","snapshot_observed_at":"2026-07-13T15:09:29.436835Z","title":"[Ellis et al.(2021)] Kevin Ellis, Catherine Wong, Maxwell Nye, Mathias Sablé-Meyer, Lucas Morales, Luke Hewitt, Luc Cary, Armando Solar-Lezama, and Joshua B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:29.436835Z"},"links":{"cited_paper":"/paper/2305.17126","citing_paper":"/paper/2604.00392"},"observation_digest":"sha256:aef588fc39625e31fc147c24815e5a045ad71bde99bc2df06c59e25227c508ba","observation_id":"1a2bfbf7-5000-436e-9208-eae4f7c2efa3","resolution":{"observed_at":"2026-07-13T15:09:29.436835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:09:29.436835Z","title":"InProceedings of the 42nd ACM SIGPLAN International Conference on Programming Language Design and Implementation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:29.436835Z"},"links":{"citing_paper":"/paper/2604.00392"},"observation_digest":"sha256:08e29f0a3677005d07f7197f9ac24b6647c4413f20ae5d87b16d609056a29b5b","observation_id":"9e66df81-e84e-4cfb-bda4-979a53473bad","resolution":{"observed_at":"2026-07-13T15:09:29.436835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12670","last_updated":"2026-03-13T07:33:01Z","snapshot_observed_at":"2026-07-06T22:45:44.135338Z","submitted_at":"2026-02-13T07:06:06Z","title":"SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12670","snapshot_observed_at":"2026-07-13T15:09:29.436835Z","title":"[Liu et al.(2024)] Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:29.436835Z"},"links":{"cited_paper":"/paper/2602.12670","citing_paper":"/paper/2604.00392"},"observation_digest":"sha256:0d4c044575cda85de761821793b651b16f6aa13d8219ae63627d96383a4ac56d","observation_id":"eac9c2a6-c016-438d-92dd-f75a42283245","resolution":{"observed_at":"2026-07-13T15:09:29.436835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:09:29.436835Z","title":"InInternational Conference on Learning Representa- tions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:29.436835Z"},"links":{"citing_paper":"/paper/2604.00392"},"observation_digest":"sha256:6f0806ec26693374eeba5a0b279362868784aff1e3fae66e8428c5b64fa6f28a","observation_id":"a575bd79-6f07-41cf-9872-8063b7f0d1ce","resolution":{"observed_at":"2026-07-13T15:09:29.436835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:09:29.436835Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:29.436835Z"},"links":{"citing_paper":"/paper/2604.00392"},"observation_digest":"sha256:7926a56220a5f2565557d924af080c51de4c041650e407982fee4a9aaed3f531","observation_id":"3ae56bea-a573-46a9-9c13-92f81067b87d","resolution":{"observed_at":"2026-07-13T15:09:29.436835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-07-13T15:09:29.436835Z","title":"[Singhal et al.(2024)] Manav Singhal, Tushar Aggarwal, Abhijeet Awasthi, Nagarajan Natarajan, and Aditya Kanade","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:29.436835Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2604.00392"},"observation_digest":"sha256:4da887194091d7dfb23f85f58b5f6b1fc7b4b433a115418691ffda5dc64bf5dc","observation_id":"7db23032-925f-46b5-a56d-64a27c31d433","resolution":{"observed_at":"2026-07-13T15:09:29.436835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15963","last_updated":"2024-09-29T05:03:25Z","snapshot_observed_at":"2026-08-07T14:21:57.719453Z","submitted_at":"2024-01-29T08:47:31Z","title":"NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15963","snapshot_observed_at":"2026-07-13T15:09:29.436835Z","title":"[Wang et al.(2023)] Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, and Anima Anandkumar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:29.436835Z"},"links":{"cited_paper":"/paper/2401.15963","citing_paper":"/paper/2604.00392"},"observation_digest":"sha256:b2ac8c10af6a0812d1783aeee334a524d183abbd426befe56a4bcd9884864cf6","observation_id":"dd02e5f8-bd74-4e57-9559-d58dd8b775a2","resolution":{"observed_at":"2026-07-13T15:09:29.436835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:09:29.436835Z","title":"[Wölflein et al.(2025)] Georg Wölflein, Dyke Ferber, Daniel Truhn, Ognjen Arand- jelović, and Jakob Nikolas Kather","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:29.436835Z"},"links":{"citing_paper":"/paper/2604.00392"},"observation_digest":"sha256:2f08e2ef0ae35ae1b6e6c87c8edbcb96f697a01327f39058bcef6387ac1fce34","observation_id":"bfdcd6d6-393f-4845-9905-407c948b9de6","resolution":{"observed_at":"2026-07-13T15:09:29.436835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11705","last_updated":"2025-05-29T18:47:41Z","snapshot_observed_at":"2026-08-09T18:41:38.807815Z","submitted_at":"2025-02-17T11:44:11Z","title":"LLM Agents Making Agent Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11705","snapshot_observed_at":"2026-07-13T15:09:29.436835Z","title":"[Xia et al.(2026)] Bowei Xia, Mengkang Hu, Shijian Wang, Jiarui Jin, Wenxiang Jiao, Yuan Lu, Kexin Li, and Ping Luo","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:29.436835Z"},"links":{"cited_paper":"/paper/2502.11705","citing_paper":"/paper/2604.00392"},"observation_digest":"sha256:6bdbb43611cb3fe4fa077ec5b1ab620923bf1c84cd55c58b38b497e2d7ae0ab3","observation_id":"4cbad2ab-16be-4577-87ce-49e1affdad76","resolution":{"observed_at":"2026-07-13T15:09:29.436835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:09:29.436835Z","title":"[Zhang et al.(2026)] Hanrong Zhang, Shicheng Fan, Henry Peng Zou, Yankai Chen, Zhenting Wang, Jiayu Zhou, et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:29.436835Z"},"links":{"citing_paper":"/paper/2604.00392"},"observation_digest":"sha256:57bb52cd00b18267ba88ea48b64698140cce553b46afda8c8635fdf014d1544c","observation_id":"046d60af-f6a7-4592-9ebc-9e5630146027","resolution":{"observed_at":"2026-07-13T15:09:29.436835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01687","last_updated":"2026-04-12T23:04:42Z","snapshot_observed_at":"2026-07-06T22:51:35.522923Z","submitted_at":"2026-04-02T06:43:20Z","title":"CoEvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.01687","snapshot_observed_at":"2026-07-13T15:09:29.436835Z","title":"Supplement §D","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:29.436835Z"},"links":{"cited_paper":"/paper/2604.01687","citing_paper":"/paper/2604.00392"},"observation_digest":"sha256:7a8bac3cdc37027bbf95a7cf80f1cb578a971956ef6c71b08776153d87c26acd","observation_id":"7cce30c4-e0d9-436a-a418-87a8733059f7","resolution":{"observed_at":"2026-07-13T15:09:29.436835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.00392","last_updated":"2026-07-04T19:33:13Z","latest_version":2,"primary_category":"cs.SE","snapshot_observed_at":"2026-07-30T09:24:22.617019Z","submitted_at":"2026-04-01T02:21:55Z","title":"Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2604.00392."}