{"as_of":"2026-08-08T18:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fab0554053a5e631b4bd2f443c5aeb6c0d5bff2b93e601f39c3359ff2463bd41","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:14:07.903751Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03535/citation-record","integrity":"/paper/2608.03535/integrity","json":"/paper/2608.03535/citation-record.json","paper":"/paper/2608.03535"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.516846Z","title":null,"venue":null,"work_id":"69eb258b-dc4b-4dc9-8124-63cb37355217","year":2026},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.764068Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:81077e088b985061375609b7c34c21c6aa43630efecb7d7797830b7a652f5f3d","observation_id":"e60e575f-6a50-4e9f-8633-511db4d4739a","resolution":{"observed_at":"2026-08-05T17:14:08.524030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-05T17:14:07.770257Z","title":"arXiv preprint arXiv:2108.07732 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.770257Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:17e2c08515436c21bcf983a20948aac20fc47cbd307ea2526834053a401f06a3","observation_id":"e8d4b94b-8de9-4d36-bd13-6be6ac86377b","resolution":{"observed_at":"2026-08-05T17:14:07.770257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.497943Z","title":"In: 2025 IEEE/ACM 2nd International Conference on AI Foundation Models and Software Engineering (FORGE)","venue":null,"work_id":"57420fc8-5418-40d2-9143-d9a645d0e99a","year":2025},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.777616Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:42174cf8906520fa418a45914a40d7db348ddc3c8a62eed04a2459ffa8d404be","observation_id":"bf20932a-f147-4de8-a8d3-df22327356f9","resolution":{"observed_at":"2026-08-05T17:14:08.503473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T17:14:07.784348Z","title":"arXiv preprint arXiv:2107.03374 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.784348Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:447b86d87cba42eec0b395330431f9c8d834669961596a378b159e8198e083d2","observation_id":"bdcdd895-b877-4576-9b94-841e85899d12","resolution":{"observed_at":"2026-08-05T17:14:07.784348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.477623Z","title":"Biometrika 37(3–4), 256–266 (1950) 16 S","venue":null,"work_id":"47f34a7b-7507-4bb2-9da9-a7167ca6238c","year":1950},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.789495Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:8203454d5708cd2104d4d44515a7b61cd06a186ef0f88355936eba3d38aa8630","observation_id":"b59d397d-8b35-4cae-a7f3-24a381b4da9c","resolution":{"observed_at":"2026-08-05T17:14:08.483421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.458336Z","title":"In: Proc","venue":null,"work_id":"ccfec3e8-cba9-44e9-8f01-2f36417a628a","year":2024},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.795382Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:f269898eb6e546502e19de114de8847cd5ae05efd1120688b31461339bda4fc2","observation_id":"eeeb9676-1bd7-4eb4-83d2-21f2941a02bd","resolution":{"observed_at":"2026-08-05T17:14:08.465692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.437829Z","title":"ACM Transactions on Software Engineering and Methodology33(8), 1–79 (2024)","venue":null,"work_id":"9cc420c2-624a-4bce-b8fb-7d670e6b44db","year":2024},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.802879Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:795ef14436f5e635ec1af858bf38ae1f3abcd83f64251dc53ac2f44a9a9f495a","observation_id":"5580e694-9e1e-4a92-a9db-9194b0dba413","resolution":{"observed_at":"2026-08-05T17:14:08.444260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.414739Z","title":null,"venue":null,"work_id":"e0d8c46b-1544-42f9-afdf-1624d814a631","year":2024},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.808051Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:25c3ee913c26a9d2dec5f22c07fc0c89d949e5626b0ba5bc5626879a81c52fde","observation_id":"412fb120-6a9e-4fa2-ae8a-096aee8d52d4","resolution":{"observed_at":"2026-08-05T17:14:08.420614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.387920Z","title":"In: Proc","venue":null,"work_id":"38db39e6-e8e7-42b4-9827-b07a3cc6985c","year":2014},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.814037Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:176c38cbdd23a10af47bd86acd372b70bcc197dfbcf4c3adf79050a741a1056e","observation_id":"92093728-3b9b-4590-b160-603be860f058","resolution":{"observed_at":"2026-08-05T17:14:08.394550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.367397Z","title":"In: International Conference on Learning Representations (2025)","venue":null,"work_id":"c209a9a4-65ac-408c-862a-f2b89f7ed5fb","year":2025},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.818825Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:c436d0672eaf8e44b7d34007a77fe7dd22dfef6222378c493a189b8b58f919c9","observation_id":"84fc1ddb-41c5-459c-8a75-f691c86db7ab","resolution":{"observed_at":"2026-08-05T17:14:08.373805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.348637Z","title":"22nd ACM SIG- SOFT International Symposium on Foundations of Software Engineering (FSE)","venue":null,"work_id":"95967876-e9b6-4211-a71a-e7e6b423ebd6","year":2014},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.824173Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:f7940d02fe8dbefa859c6f2af87f20b4a7a0ea0e69719163d7a6eaeb98e49866","observation_id":"df03c12b-456f-436c-b5f1-17cd4322e26c","resolution":{"observed_at":"2026-08-05T17:14:08.354892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.328801Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":"1f2b51f2-a980-4158-894a-370c9081bb64","year":2023},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.829552Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:cab8e192b01cb7a3d0d62ac801dd26963439f8ba0a2d1fee0bd631f9e2cc48ee","observation_id":"89838c90-80b1-44a6-af73-97c29c575060","resolution":{"observed_at":"2026-08-05T17:14:08.335032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.309791Z","title":"IEEE Transactions on Software Engineering SE-2(4), 308–320 (1976)","venue":null,"work_id":"bddd29e1-1b0f-4646-baa0-036faf161e17","year":1976},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.836359Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:5457365cd023303c01c5c0090535512d3b9b7d85fcc3c73cb9510ff780fea23e","observation_id":"eccda045-25e9-4bda-a555-bbfcee294331","resolution":{"observed_at":"2026-08-05T17:14:08.315390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.290147Z","title":"In: Proc","venue":null,"work_id":"c89bfc29-5965-4463-b185-575718c5ef3a","year":2022},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.842126Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:6a4e33c4c8fa56b6d564ef5d967faf338dc6aa1ecb7e8e2d171033aa822a69ac","observation_id":"bf1b5c0f-1889-41da-8eb2-a179aa20fb61","resolution":{"observed_at":"2026-08-05T17:14:08.295485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.269685Z","title":"2023 ACM SIGSAC Conference on Computer and Communications Security (CCS)","venue":null,"work_id":"aeffeb1b-e837-446b-bf97-5d964e472d7c","year":2023},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.848107Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:898337df2b39231c8b9f73e1b2c403e7d4d1828396ccf4cd5a5c5dea4283f18a","observation_id":"a0f0014f-a1ba-4413-9fe4-d5ca283cde09","resolution":{"observed_at":"2026-08-05T17:14:08.277024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.248909Z","title":"In: Proc","venue":null,"work_id":"7cbf04b8-4b97-4aa8-b4e4-8295a75d1cb9","year":2024},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.853458Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:5d69eba092f77cb53934d7d60f5359d2c6b16261515851b450429e8ddbce5d98","observation_id":"c0661c0d-2b1d-47a8-a76e-a17b8f4c1a13","resolution":{"observed_at":"2026-08-05T17:14:08.254740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.226646Z","title":"In: Proc","venue":null,"work_id":"d862e821-4db7-434a-86c0-71443b0e1511","year":2022},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.859967Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:d10a33ef2b6b4851d086552af8c0306fc47d87f1d675c25e3538460a25c94c1a","observation_id":"c80ca32c-6b47-4134-ba4d-6c8a9fe13f1b","resolution":{"observed_at":"2026-08-05T17:14:08.233705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.193860Z","title":"Journal of Systems and Software238, 112885 (2026)","venue":null,"work_id":"d5f27dc8-ce49-47e1-8551-db0f7f9a8163","year":2026},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.864842Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:e9ff7d77ccf062381ee9048fc3b677941b13dbb0b3a584012e33294100c35989","observation_id":"3e177fa8-0e34-4a29-8099-2cdcdd0221b4","resolution":{"observed_at":"2026-08-05T17:14:08.200963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.166685Z","title":"42nd International Conference on Machine Learning (ICML)","venue":null,"work_id":"f2dc1191-b138-4913-bfa1-4420e59581a6","year":2025},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.871665Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:a6874f36599a38990e994ad72a555f97aa494d1c9cded6150f9a3208f88fa43d","observation_id":"f87d8bf3-ab62-4d9c-9c2a-e34075057b11","resolution":{"observed_at":"2026-08-05T17:14:08.173527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.137604Z","title":"Biometrics Bulletin 1(6), 80–83 (1945) CodeAssay: A Multi-Metric, Audited Code-Generation Benchmark 17","venue":null,"work_id":"599c7351-3648-4a33-8709-2e62f1f9df14","year":1945},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.877864Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:ae8fc46649c1a31175e44ee2efbf363a97080d1d6473b5b9654c539d028aa0d2","observation_id":"875e65b5-4d53-40ea-8719-1ede67dc42bc","resolution":{"observed_at":"2026-08-05T17:14:08.147453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.114561Z","title":"In: Proc","venue":null,"work_id":"73f5e323-18ee-4864-b057-a63f82cb58e9","year":2026},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.885821Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:2bd6cb284482e138e251545f9c10f31185506790206d60cbc1059c891193cc82","observation_id":"1ed260ee-cfd6-45ff-8950-ddff883836e9","resolution":{"observed_at":"2026-08-05T17:14:08.120690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.080995Z","title":"In: Proc","venue":null,"work_id":"79b6fc48-6d63-4279-ab88-4b9cf40fa74e","year":2024},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.891766Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:ad49381f1a4cc6809b2aed57d42da0a5a4ed67e000874c4e94ac756fd9c6e7d0","observation_id":"71167ad2-66e9-4311-b64a-fc622995aa8e","resolution":{"observed_at":"2026-08-05T17:14:08.095562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11470","last_updated":"2024-10-09T05:59:07Z","snapshot_observed_at":"2026-07-06T18:47:00.524107Z","submitted_at":"2024-07-16T08:08:48Z","title":"Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11470","snapshot_observed_at":"2026-08-05T17:14:07.898036Z","title":"arXiv preprint arXiv:2407.11470 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.898036Z"},"links":{"cited_paper":"/paper/2407.11470","citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:2652b495dbb9417229377b66272df44aeffefa30e143e3e31497985e054574a2","observation_id":"de004fe9-a825-4661-90da-7af60fb827bf","resolution":{"observed_at":"2026-08-05T17:14:07.898036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.051265Z","title":"In: Proc","venue":null,"work_id":"2842d51c-00ce-4b5c-8187-c2a26761463e","year":2025},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.903751Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:cec611761fd36a32f6aa96f57dcb4f4567f28a953312f5503a84cb3444eda160","observation_id":"f622dab2-246a-4223-a682-952f770d8a7e","resolution":{"observed_at":"2026-08-05T17:14:08.060964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2608.03535."}