{"as_of":"2026-08-05T05:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:331065fb906ddd817d03a653b1ebe78c7679bcc0dfcf3e9962a25a1beeeb8edf","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T23:01:55.096929Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.09564/citation-record","integrity":"/paper/2604.09564/integrity","json":"/paper/2604.09564/citation-record.json","paper":"/paper/2604.09564"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f30639b1-1f0f-49b9-b3cd-608b022fd22d","year":null},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:6f19cc20fce2f1f53ffcd6d1fcf3d3e98da7188eb235b638f9fee3534e0118da","observation_id":"5661c9f6-5b41-4bc8-a50d-faa7efb1c8a6","resolution":{"observed_at":"2026-05-15T23:06:51.304111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00083","last_updated":"2025-09-30T03:34:50Z","snapshot_observed_at":"2026-07-06T22:05:57.485783Z","submitted_at":"2025-07-31T18:17:36Z","title":"A Survey on Code Generation with LLM-based Agents","version":2},"cited_work":{"arxiv_id":"2508.00083","doi":"10.1007/s41233-023-00059-2","metadata_source":"pith","pith_arxiv_id":"2508.00083","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Code Generation with LLM-based Agents","venue":"cs.SE","work_id":"d958445f-408f-4ff3-bd9a-decd431c419a","year":2025},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"cited_paper":"/paper/2508.00083","citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:cb355a26f48bd2e660b2e9120c3fbc1309c8df99648ef0b65ce985bd0e304f33","observation_id":"5c2ff6e6-2358-44e5-9ca9-355a42a156af","resolution":{"observed_at":"2026-05-19T23:02:21.366092Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e5c08b05-a075-41e5-be4d-0077b7eafcd6","year":2021},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:e1130aa49dc7e95122150f022df24e759915ecb530895b6a36c6cfa27f0d5fa9","observation_id":"774770c3-1269-4ff3-8412-b8c11c9ae061","resolution":{"observed_at":"2026-05-15T23:06:51.291526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":"2411.15594","doi":"10.1016/j.xinn.2025.101253","metadata_source":"pith","pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on LLM-as-a-Judge","venue":"cs.CL","work_id":"2676656a-67bd-4ad5-bad6-cb6f5fcdbfbe","year":2024},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:43e107a2ca70d15499b55acf9d365fabf13274a91d7fb58c50d26eba3374b82c","observation_id":"6b8049a5-3c1d-4a66-8960-41fb4b839f1b","resolution":{"observed_at":"2026-05-15T23:06:50.930309Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00074","last_updated":"2024-12-17T21:56:45Z","snapshot_observed_at":"2026-07-06T16:25:42.545425Z","submitted_at":"2023-09-29T18:25:46Z","title":"SocREval: Large Language Models with the Socratic Method for Reference-Free Reasoning Evaluation","version":3},"cited_work":{"arxiv_id":"2310.00074","doi":"10.48550/arxiv.2310.00074","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In NeurIPS","venue":"arXiv (Cornell University)","work_id":"231fc911-e007-40c9-9ea7-e4af5e155c75","year":2024},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"cited_paper":"/paper/2310.00074","citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:549ac76cc6f2e9c11183bf204a58069fad0783aeb445fd8592d29e2c0e16531c","observation_id":"6677676a-13d8-4c2e-bde9-38e2c787193d","resolution":{"observed_at":"2026-05-15T23:06:50.939021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":"2406.00515","doi":"10.48550/arxiv.2406.00515","metadata_source":"pith","pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Large Language Models for Code Generation","venue":"cs.CL","work_id":"7d829146-3160-44c7-9ce4-4201ed9b654c","year":2024},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:c0dbdf358c02b8bfdb2456d154cd33ed8a982c72fa33cc1df6c929b4c37684d7","observation_id":"9ef12b3d-cf9c-4e36-988f-93e8aa83d798","resolution":{"observed_at":"2026-05-15T23:06:51.179233Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T06:49:11.204487+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T06:49:11.204487+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03245","last_updated":"2023-05-22T22:00:51Z","snapshot_observed_at":"2026-08-05T05:23:09.496985Z","submitted_at":"2023-04-06T17:27:45Z","title":"Large language models effectively leverage document-level context for literary translation, but critical errors persist","version":3},"cited_work":{"arxiv_id":"2304.03245","doi":"10.48550/arxiv.2304.03245","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.03245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"arXiv (Cornell University)","work_id":"bb7f42f4-0412-40ed-a375-3e754518ed80","year":2023},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"cited_paper":"/paper/2304.03245","citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:22c0234391dcdc0f0c22750409b45223925900ccde790c6cf4f854a34ca54b6b","observation_id":"6718c6bf-869c-4b07-a343-76d0d4db2d49","resolution":{"observed_at":"2026-05-15T23:06:50.977008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-04T13:06:14.768886Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":"2005.11401","doi":"10.1145/3626772.3657717","metadata_source":"pith","pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","venue":"cs.CL","work_id":"27eaec54-c105-4969-8188-da5f0fca3688","year":2020},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:226726eaf5c2bebc8f3d3af22ffcdc86a3737e1c70450aeacdb25676c482a614","observation_id":"459af4fe-e283-4b02-91e8-eca64ff582bb","resolution":{"observed_at":"2026-05-15T23:06:51.192504Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1126/science.abq1158","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mankowitz, Esme Sutherland Robson, Pushmeet Kohli, Nando De Freitas, Koray Kavukcuoglu, and Oriol Vinyals","venue":"Science","work_id":"cc452f34-3d34-41ff-9206-8edad6625ce6","year":2022},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:2d0ab3d702a5b13cac74d54f29bb18e32129001e6f70ab552b67ac6af81d2da5","observation_id":"a3e03cd9-7796-48c6-8607-3e5bd9aa29e4","resolution":{"observed_at":"2026-05-15T23:06:50.969415Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:23.512078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:23.512078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.101367","doi":"10.1016/j.cola.2025.101367","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Symeonidis","venue":"Journal of Computer Languages","work_id":"7d5e8e9a-a09c-437f-a844-220f44c5b3b6","year":2025},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:b01e365015a0940d3a750a941695247011964861810991e22efc2cce0108c0fb","observation_id":"a70708e0-41b8-4b7c-8ade-7638642c3cbb","resolution":{"observed_at":"2026-05-15T23:06:50.993796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.741","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.726417Z","title":"Proceedings of the 2023","venue":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing","work_id":"f952e39f-7d85-4a4f-9dd7-9da09cf2c1d8","year":2023},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:9382293f63e6afdebfb4d590fd48849745211909722f48429f44e47432a23b4f","observation_id":"ccbf649f-fca7-4cd9-84dd-478f70a8b900","resolution":{"observed_at":"2026-05-15T23:06:50.963107Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T21:20:13.984389+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T21:20:13.984389+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14987","last_updated":"2022-03-28T18:00:51Z","snapshot_observed_at":"2026-07-06T12:53:50.496350Z","submitted_at":"2022-03-28T18:00:51Z","title":"Multilingual Knowledge Graph Completion with Self-Supervised Adaptive Graph Alignment","version":1},"cited_work":{"arxiv_id":"2203.14987","doi":"10.48550/arxiv","metadata_source":"doi_reference","pith_arxiv_id":"2203.14987","snapshot_observed_at":"2026-07-09T21:46:34.506658Z","title":"Dickerson","venue":"cs.AI","work_id":"5c2060c6-427c-4321-be22-49ccae439d80","year":2025},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"cited_paper":"/paper/2203.14987","citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:445e38261a212614a58b803fb3579dfc34a0ba7acb4e6ec9abc9d78c9b8b025d","observation_id":"7f4a62c9-0fea-46ca-b75f-e87a190f902c","resolution":{"observed_at":"2026-05-15T23:06:51.000957Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18122","last_updated":"2023-11-11T20:52:04Z","snapshot_observed_at":"2026-07-06T16:39:28.669116Z","submitted_at":"2023-10-27T13:09:54Z","title":"OpinSummEval: Revisiting Automated Evaluation for Opinion Summarization","version":2},"cited_work":{"arxiv_id":"2310.18122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.18122","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2e3241b7-2c23-4b72-8b8c-09412b4ae804","year":2023},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"cited_paper":"/paper/2310.18122","citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:e4f3944dcb87ccb9a4e1feba965fbbbf8170d813e132785590cd3b855e576bba","observation_id":"e8caa12c-d629-416f-914f-e8d7668338a3","resolution":{"observed_at":"2026-05-15T23:06:51.185522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12924","last_updated":"2025-01-10T03:55:57Z","snapshot_observed_at":"2026-07-06T19:52:55.369337Z","submitted_at":"2024-11-19T23:22:33Z","title":"Human-In-the-Loop Software Development Agents","version":2},"cited_work":{"arxiv_id":"2411.12924","doi":"10.48550/arxiv.2411.12924","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.12924","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Human-in-the-loop software development agents,","venue":"arXiv (Cornell University)","work_id":"0c17563b-33dc-46e2-a61c-e8adff78da4e","year":2024},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"cited_paper":"/paper/2411.12924","citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:9d85641490de834a1ec8615e231784294846cfa019f8ced1f860289ac11035c1","observation_id":"98206fa7-5edc-4d7b-98ab-e93110cd61e7","resolution":{"observed_at":"2026-05-15T23:06:50.955770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fa938fe9-5e81-4d05-a3c0-bc35f570b01d","year":2025},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:f7582e922b08b30ba91422899bc34aa964115b0aad581604f3f7d7dd0e983faf","observation_id":"3c54921f-bb19-49f1-bfd8-3cfed707a095","resolution":{"observed_at":"2026-05-15T23:06:51.299797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.emnlp-main.685","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.18653/v1/2021.emnlp-main.685","venue":"Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing","work_id":"30b41c5a-1b57-43bc-9fff-c05fd61a6543","year":2021},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:be224f6860596ca262bc3669ad1ff61d4bf835cacba6cfdf0387e6f730ecb57c","observation_id":"376fdf86-bd84-44fe-b48f-fab0bd439017","resolution":{"observed_at":"2026-05-15T23:06:50.898160Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:18:56.774541+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:18:56.774541+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c97f0582-416a-4862-a64c-da0dcc26bc89","year":2025},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:d02727647182384341b5f7860057eb2bb94358a65d8a320b4ec0807d0a3d7eb3","observation_id":"28087e12-89ab-4fef-b6ba-21889fa226ea","resolution":{"observed_at":"2026-05-15T23:06:51.295681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":"2306.05685","doi":"10.1109/4235.797969","metadata_source":"pith","pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":"cs.CL","work_id":"d0c30cd7-81e1-4159-a87f-f6adca77ff08","year":2023},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:c5f31320d9da965505f9556ef83b553e5365cd94658fade59a1e413e44eae013","observation_id":"61061a34-b92a-49cb-85ae-b64b7e677833","resolution":{"observed_at":"2026-05-15T23:06:50.947153Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-07-06T16:39:08.850847Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":"2310.17631","doi":"10.48550/arxiv.2310.17631","metadata_source":"pith","pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2310.17631 , year=","venue":"cs.CL","work_id":"f86d2c83-ccb7-4eac-9bae-cc5f835621f1","year":2023},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:6f26b1a8e1d67b1ac2779e8a75a9d362423810d45760ca170dde4bfa4465c01e","observation_id":"7a607383-f8ca-40f9-9b7f-ea7399da330f","resolution":{"observed_at":"2026-05-15T23:06:50.914179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-07-31T19:00:59.311189Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":"2406.15877","doi":"10.48550/arxiv.2406.15877","metadata_source":"pith","pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","venue":"cs.SE","work_id":"14715c3c-002c-4bc4-8882-f7c586954d62","year":2024},"citing_paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T23:01:55.096929Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2604.09564"},"observation_digest":"sha256:2b176e6545927a8973c084eec39df5d70ce1f6469bb52caf1e7a8cb81421ac92","observation_id":"69abd6e7-b9ac-4746-9fe1-aac1e2116b8f","resolution":{"observed_at":"2026-05-15T23:06:51.010834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.09564","last_updated":"2026-02-14T01:33:08Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-06T22:58:25.877654Z","submitted_at":"2026-02-14T01:33:08Z","title":"ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":2,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":4,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2604.09564."}