{"as_of":"2026-08-07T19:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cba64e22c808805eb0d3db6ac99cb5f9b3b07adff160a35952484db5fd30de48","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:18:49.895278Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:32:33.789468Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T17:32:34.591005Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"cited_work":{"arxiv_id":"2505.19502","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19502","snapshot_observed_at":"2026-08-06T17:32:34.591005Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","venue":"cs.SE","work_id":"761a9802-1014-408b-ae6d-a7bd93131e61","year":2025},"citing_paper":{"arxiv_id":"2507.10535","last_updated":"2025-08-14T17:58:50Z","snapshot_observed_at":"2026-08-06T17:26:10.296563Z","submitted_at":"2025-07-14T17:56:29Z","title":"CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:32:33.789468Z"},"links":{"cited_paper":"/paper/2505.19502","citing_paper":"/paper/2507.10535"},"observation_digest":"sha256:f4e9582f1a15049b5ebcfde4a85624a2015e1d02a107e15127f092732c8acad0","observation_id":"3578691e-6982-4de8-8a26-b88ee4ce7fbf","resolution":{"observed_at":"2026-08-06T17:32:34.645100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19502/citation-record","integrity":"/paper/2505.19502/integrity","json":"/paper/2505.19502/citation-record.json","paper":"/paper/2505.19502"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.793868Z","title":"Llm-based multi-agent systems for software engineering: Literature review, vision and the road ahead,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:43.793868Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:a5c8530504469c9139c64db4a1f64afe6478e7d52424b3ec48669f55de449b13","observation_id":"c8c3daba-9935-4ca6-9220-153383d74bfc","resolution":{"observed_at":"2026-08-07T14:18:43.793868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.852067Z","title":"Efficient and green large language models for software engineering: Vision and the road ahead,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:43.852067Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:22e4801d72554bb73a68c5fa9e46f472d5c8ec18075ca0507622942bb4d6c114","observation_id":"37ac8ab1-e125-492e-a656-74e769683d7f","resolution":{"observed_at":"2026-08-07T14:18:43.852067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.977776Z","title":"Large language models for software engi- neering: A systematic literature review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:43.977776Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:fa6f7f567fd4b3999ec841b4f9260fa21c60873b694b2eb1520d6eb218198b12","observation_id":"7059d352-e049-4c97-b5ff-c4b3d8c384a3","resolution":{"observed_at":"2026-08-07T14:18:43.977776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:55.977575Z","title":"Exploring the capabilities of llms for code change related tasks,","venue":null,"work_id":"bab668f1-78d3-47b3-9aaa-fa7f352cf76e","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.075982Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:8405a3650f7ca7ae6e10ed0d61e69be67e6e31e3b77a793e56ca798366cb8f8e","observation_id":"d5db457a-4915-4066-a1b2-91a769ee34f4","resolution":{"observed_at":"2026-08-07T14:18:56.142825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.190067Z","title":"Chain- of-thought in neural code generation: From and for lightweight language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.190067Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:e5a950b113d231daba24dcc7f425cda4ece510e66ab212d4c05d54e208484283","observation_id":"436ddac7-8fc6-453a-bd73-f5cb6ff0165b","resolution":{"observed_at":"2026-08-07T14:18:44.190067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.323662Z","title":"An empirical study of retrieval-augmented code generation: Challenges and opportunities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.323662Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:e2d13077eb8804580488e903621740a7113c7527e8ea98e7a5de631e180bb3bb","observation_id":"edc0ac39-d979-410b-899e-af50a5ee8016","resolution":{"observed_at":"2026-08-07T14:18:44.323662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.419952Z","title":"A review on code generation with llms: Application and evaluation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.419952Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:0b05879fd3afc2d578f1670a501628f9829bb5a244e129b648eaf80281b0fabc","observation_id":"b8e62aa2-67fc-4b4c-8ff7-ee8e4befcdde","resolution":{"observed_at":"2026-08-07T14:18:44.419952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06918","last_updated":"2025-03-18T04:58:23Z","snapshot_observed_at":"2026-07-06T18:28:38.016649Z","submitted_at":"2024-06-11T03:19:18Z","title":"HumanEvo: An Evolution-aware Benchmark for More Realistic Evaluation of Repository-level Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06918","snapshot_observed_at":"2026-08-07T14:18:44.535532Z","title":"Towards more realistic evaluation of llm-based code generation: an experimental study and beyond,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.535532Z"},"links":{"cited_paper":"/paper/2406.06918","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:a72c5cd31f7d4b7f16f9c5ec642c4b2894251f59b23636a8509afdc073c5289d","observation_id":"a016940c-4a33-4e26-af3d-37407ca86c7d","resolution":{"observed_at":"2026-08-07T14:18:44.535532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:55.595079Z","title":"Assessing and improving syntactic adversarial robustness of pre-trained models for code translation,","venue":null,"work_id":"2270d500-e1c5-404e-81b1-1d87de049a8e","year":2025},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.695755Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:c21807bb4fa118f9120e902f29b51c070aa4b1568aac1f922b41bb753efad40c","observation_id":"da753d1c-7523-4255-8b2f-db694ff4245c","resolution":{"observed_at":"2026-08-07T14:18:55.722335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.800778Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.800778Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:1f5458accd31cb8950af8be67fabf0d0cf7ee9beb44fa3d411470e1b99d349da","observation_id":"6f840e5e-74ea-4099-b2ff-15a0f23c8e5e","resolution":{"observed_at":"2026-08-07T14:18:44.800778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.882525Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.882525Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:3e7bfd55b4776a017185bd9dae389a363a4f434bc545e6eaad40e4953a101483","observation_id":"be427ef5-801d-43d2-b29f-3dd2615fcca8","resolution":{"observed_at":"2026-08-07T14:18:44.882525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:55.251407Z","title":"chrf: character n-gram f-score for automatic mt evalu- ation,","venue":null,"work_id":"4ba165c5-7daa-4753-aef3-b844061bb623","year":2015},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.020391Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:8ececcca08242707c5ffb90c8ed0c335f9cf1609c5dce0578f1e3ed8f4119ff0","observation_id":"61f6370f-1789-4085-b2ff-43d2915ce993","resolution":{"observed_at":"2026-08-07T14:18:55.399227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T14:18:45.176339Z","title":"Evaluating large language models trained on code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.176339Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:228519ffd3ef66f8dcab9419dbb291cf3ec5ee960b6cc72b04a3c511266261bb","observation_id":"788e8390-42a0-43fb-bbc9-d3f73c7c27f7","resolution":{"observed_at":"2026-08-07T14:18:45.176339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:54.970023Z","title":"Exploit- gen: Template-augmented exploit code generation based on codebert,","venue":null,"work_id":"1ff7227b-c39e-426e-9c8e-5fac076c48fd","year":2023},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.322765Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:31b44d7ae4ce329454279367a2456c3ce772ef51dac9322533f175fde266a928","observation_id":"7bd5d4a7-0764-482d-93dc-49dec8202507","resolution":{"observed_at":"2026-08-07T14:18:55.097618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:54.659488Z","title":"Are nlp metrics suitable for evaluating gen- erated code?","venue":null,"work_id":"bda10864-6094-4f6b-a120-9da9661e35af","year":2022},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.485559Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:8816fde21c35de3c051e4f3ecddd18a58976b9cdd270d5a9723f653e2a76af13","observation_id":"328742c4-9d6d-4754-9765-2a5d317b0ba1","resolution":{"observed_at":"2026-08-07T14:18:54.811838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01580","last_updated":"2024-04-26T15:54:39Z","snapshot_observed_at":"2026-07-06T18:09:00.688840Z","submitted_at":"2024-04-26T15:54:39Z","title":"On the Limitations of Embedding Based Methods for Measuring Functional Correctness for Code Generation","version":1},"cited_work":{"arxiv_id":"2405.01580","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01580","snapshot_observed_at":"2026-08-07T14:18:51.225001Z","title":"On the Limitations of Embedding Based Methods for Measuring Functional Correctness for Code Generation","venue":"cs.SE","work_id":"47592709-7e8a-491d-a2ad-8819e8c63645","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.617534Z"},"links":{"cited_paper":"/paper/2405.01580","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:28771a5209a7919140b3811e1191d4aea2ed765e5fdcfcb2b75ac78847ef3a57","observation_id":"af2248f9-f5c9-4c45-84c7-7ea2822b126d","resolution":{"observed_at":"2026-08-07T14:18:51.337928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05579","snapshot_observed_at":"2026-08-07T14:18:45.728953Z","title":"Llms- as-judges: a comprehensive survey on llm-based evaluation methods,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.728953Z"},"links":{"cited_paper":"/paper/2412.05579","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:a93185f87bfda403988daa3ae4c4116afaff2db31df1c26871ce4a52bdaa3ae0","observation_id":"7f780868-1084-45f3-a25b-b9518ed9b730","resolution":{"observed_at":"2026-08-07T14:18:45.728953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-07T14:18:45.866412Z","title":"A survey on llm-as-a-judge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.866412Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:dfab6467e014caf85cf854cb92cbd1ffb85d5f4689bf2a8b126a9443675e6054","observation_id":"606da85a-ab5e-4433-87a0-1a1720486b5f","resolution":{"observed_at":"2026-08-07T14:18:45.866412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:45.986897Z","title":"From generation to judg- ment: Opportunities and challenges of llm-as-a-judge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.986897Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:85302086ab2fe3bd1d61f434d739d59fb062d0b69af97502cb8e7373ed62ef5f","observation_id":"6591cce8-2b4c-45b4-92b5-db04020bcf7d","resolution":{"observed_at":"2026-08-07T14:18:45.986897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:46.158301Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:46.158301Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:33ba0e173e22157abb8d4696c93625bb9501d3fb335adbc84c26e3f8f3fc5ab9","observation_id":"954b232b-51e2-48e3-9a83-80db1bc437ab","resolution":{"observed_at":"2026-08-07T14:18:46.158301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:54.331708Z","title":"Fight fire with fire: How much can we trust chatgpt on source code-related tasks?","venue":null,"work_id":"3dd47c0f-49fd-4344-ba6e-ab230a021dad","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:46.267717Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:4869be49db8fdf7e455b8ef04e2c66325a52772c3b2be1b1f05cc4e16276f425","observation_id":"2dc63c72-91a8-42d9-ac61-f8f830f53b5b","resolution":{"observed_at":"2026-08-07T14:18:54.479297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:18:46.412755Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:46.412755Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:07c7e1eddec008b3eb6a3b68b4f1d49ff81eaebf57c4ccf447aa98f01c1be691","observation_id":"df1fc234-6b03-4450-a8f2-74ceb248c922","resolution":{"observed_at":"2026-08-07T14:18:46.412755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:53.976220Z","title":"Pissa: Principal singular values and singular vectors adaptation of large language models,","venue":null,"work_id":"96afd0f2-557b-474c-b819-373d087bbaee","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:46.534245Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:81a11a18750afefb9e08f41c05c8c3d2f6abbfe1a5fd554c4f622cc4cbed98e5","observation_id":"5eb22316-f96c-4534-9ccc-4ab52109222b","resolution":{"observed_at":"2026-08-07T14:18:54.106941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:18:46.672703Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:46.672703Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:edf2e39c71200bee2901345bd0b14081bc709b38f3caf935f20f51c0efc6381c","observation_id":"fb82432f-3dcd-4202-a6f1-cedd7489ad02","resolution":{"observed_at":"2026-08-07T14:18:46.672703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:46.831139Z","title":"Preference leakage: A contamination problem in llm-as-a-judge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:46.831139Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:4529e15bfe1bf6af3958fe87de0baa7de3c17e9589c710d19e5d50dbac87e374","observation_id":"19d5527f-75f7-4917-b9f3-278883ebead8","resolution":{"observed_at":"2026-08-07T14:18:46.831139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:53.670247Z","title":"Who evaluates the evaluators? on automatic metrics for assessing ai-based offensive code generators,","venue":null,"work_id":"70b0df2b-5bdb-4dcd-a2b5-923fbec7337d","year":2023},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:46.961223Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:d985f830a5bd83693308f3b2eb590959603a1a1ea712b430fb64aa420378660c","observation_id":"44ad428f-1c5c-4197-ba0d-3a659e98494a","resolution":{"observed_at":"2026-08-07T14:18:53.843328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:53.384237Z","title":"Crystalbleu: precisely and efficiently mea- suring the similarity of code,","venue":null,"work_id":"af290620-322e-41fb-802d-cb7e6ebdf3de","year":2022},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:47.156377Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:e023cf332060f59db034223f1980ee0e79409eae65ccdc1ee8d83edfe85e7aa8","observation_id":"97dc3270-991f-4aca-8444-5ffd1dab3267","resolution":{"observed_at":"2026-08-07T14:18:53.498388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.10297","last_updated":"2020-09-27T04:07:11Z","snapshot_observed_at":"2026-08-01T07:33:26.380394Z","submitted_at":"2020-09-22T03:10:49Z","title":"CodeBLEU: a Method for Automatic Evaluation of Code Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.10297","snapshot_observed_at":"2026-08-07T14:18:47.284456Z","title":"Codebleu: a method for automatic evaluation of code synthesis,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:47.284456Z"},"links":{"cited_paper":"/paper/2009.10297","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:9a6bf3be1c9230e7e54699c1c92f60404149933357e6bb525f1db90114472dec","observation_id":"a48577a0-d159-428b-897e-195126bdf97b","resolution":{"observed_at":"2026-08-07T14:18:47.284456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:53.093842Z","title":"Codebertscore: Eval- uating code generation with pretrained models of code,","venue":null,"work_id":"2906f2e2-6d6f-4e88-83a7-0c26dce3ffac","year":2023},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:47.431493Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:d04aeceb1f5e6c62b94fb03d6fc6930c2f8aa2aa1a26f928b2902183ba41d285","observation_id":"a87f8fb3-0a76-475d-95e9-3ec920ebc06c","resolution":{"observed_at":"2026-08-07T14:18:53.273794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:52.751704Z","title":"Codescore: Eval- uating code generation by learning code execution,","venue":null,"work_id":"d2a2f12e-4ec3-4ddf-9cfc-0b05d494f787","year":2025},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:47.555464Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:912b7e31658952d2243ccdc67a27d24abc5ee256cd5d53ed929e44b6f04c0093","observation_id":"a1f8e276-a258-4a87-8e3a-99cd99b7399d","resolution":{"observed_at":"2026-08-07T14:18:52.904879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06902","last_updated":"2024-06-11T02:51:17Z","snapshot_observed_at":"2026-07-06T18:28:38.016649Z","submitted_at":"2024-06-11T02:51:17Z","title":"CodeScore-R: An Automated Robustness Metric for Assessing the FunctionalCorrectness of Code Synthesis","version":1},"cited_work":{"arxiv_id":"2406.06902","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06902","snapshot_observed_at":"2026-08-07T14:18:50.337650Z","title":"CodeScore-R: An Automated Robustness Metric for Assessing the FunctionalCorrectness of Code Synthesis","venue":"cs.SE","work_id":"75033fc2-c507-4296-ad74-59da1d6aaa1f","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:47.689046Z"},"links":{"cited_paper":"/paper/2406.06902","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:0987799f994c0fb60caa1218022be85c97dd57e44ff3d097f7979509256703f3","observation_id":"b97d9c13-1d3a-4464-9b9d-2d0527eba567","resolution":{"observed_at":"2026-08-07T14:18:50.455945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:52.490052Z","title":"Ice-score: Instructing large language models to evaluate code,","venue":null,"work_id":"aea0bede-9623-471a-9b42-c59370f65c9f","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:47.812514Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:924a3257a28f4f9b687a0491375090bb9da04f33627a5452357b1aaec0255e50","observation_id":"2aaf3ad2-026c-4451-b6ed-2ba896733148","resolution":{"observed_at":"2026-08-07T14:18:52.590439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:52.237698Z","title":"Codejudge: Evaluating code generation with large language models,","venue":null,"work_id":"79c1d078-218c-4dc9-9f9b-34a13511ab28","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:47.980501Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:d528332fb92ce0c3b9294db32e8332b61012ddac07fd46fead9c18a9283f300b","observation_id":"831fc490-587b-43e4-9ad2-14fa7a542494","resolution":{"observed_at":"2026-08-07T14:18:52.336829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:51.890907Z","title":"Benchmarks and metrics for evalua- tions of code generation: A critical review,","venue":null,"work_id":"ab880dd8-a1d6-4cbe-9c60-cb602eb9c978","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.119267Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:deedfac479a8896b15d0dacb9b5f3ac34256bd952d0d66c2b5ce737098be9e4d","observation_id":"d1b05140-ba45-4990-8fa0-9b199a50692d","resolution":{"observed_at":"2026-08-07T14:18:52.066356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02246","last_updated":"2025-03-04T03:48:23Z","snapshot_observed_at":"2026-08-07T17:31:39.128866Z","submitted_at":"2025-03-04T03:48:23Z","title":"From Code to Courtroom: LLMs as the New Software Judges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02246","snapshot_observed_at":"2026-08-07T14:18:48.242132Z","title":"From code to courtroom: Llms as the new software judges,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.242132Z"},"links":{"cited_paper":"/paper/2503.02246","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:61c33c41198994c0b0649c265a46975c071b353ead76ccfba8ebccb315cbc41c","observation_id":"20add06a-1154-416b-8b05-f3a185bb4f3b","resolution":{"observed_at":"2026-08-07T14:18:48.242132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:51.614985Z","title":"Is your code generated by chatGPT really correct? rigorous evaluation of large language models for code generation,","venue":null,"work_id":"62cf0829-9bd1-448e-a806-3cb9060e0da3","year":2023},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.442996Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:727a4afde018cb6838ae74e69e28763105429571aa6efe6862610124226329ef","observation_id":"42377c96-b83f-44c4-8a1d-359778743253","resolution":{"observed_at":"2026-08-07T14:18:51.761783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-07-31T19:00:59.311189Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-07T14:18:48.551215Z","title":"Bigcodebench: Benchmarking code generation with diverse function calls and complex instructions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.551215Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:f6304f16bac44a50523f0e2dde970c62bd5425c232003bbece4be6b229fcd27e","observation_id":"c35ee74f-45a5-416f-9a9e-a9027fa1014a","resolution":{"observed_at":"2026-08-07T14:18:48.551215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T14:18:48.666706Z","title":"Qwen2. 5-coder technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.666706Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:79fc9738efa780bbb11bea1c0abc0bea4a6a3a54b6793b4b4bb2237f83843718","observation_id":"d5e8fd5b-c57c-445c-88d3-ed7d2cb88b75","resolution":{"observed_at":"2026-08-07T14:18:48.666706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-07T14:18:48.828289Z","title":"Deepseek-coder: When the large language model meets programming–the rise of code intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.828289Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:e1f84c7942060daeb9a7a2d1780529a7a56644fae036c2dbbb97596e5789cde1","observation_id":"5b65b982-8887-435a-ac28-b5f595e03134","resolution":{"observed_at":"2026-08-07T14:18:48.828289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:48.977432Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.977432Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:3f7e655adc950d8af348b80ea2e4a793ed5ad551e746bc3db58164d5dd9cb970","observation_id":"d316dd0b-02f7-4b68-99aa-12cdd7cda6d6","resolution":{"observed_at":"2026-08-07T14:18:48.977432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:49.169400Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.169400Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:4fd7285ca6cc164910535ba8b8153213bc7d5bb2505826e882c259273a33f099","observation_id":"8a620128-32a8-4efc-9f36-9fb7a9a7ba48","resolution":{"observed_at":"2026-08-07T14:18:49.169400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02951","last_updated":"2025-07-12T02:08:21Z","snapshot_observed_at":"2026-08-07T17:29:28.382943Z","submitted_at":"2025-03-04T19:17:36Z","title":"KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02951","snapshot_observed_at":"2026-08-07T14:18:49.297876Z","title":"Kodcode: A diverse, challenging, and verifiable synthetic dataset for coding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.297876Z"},"links":{"cited_paper":"/paper/2503.02951","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:3e2a08ac47d0ebe873f802bd48ef9f8b4e2b3286e51758bd2edb15ac5a538e52","observation_id":"3a2a8f9d-ef7c-44b5-8dbe-1e0898697da3","resolution":{"observed_at":"2026-08-07T14:18:49.297876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04905","last_updated":"2025-03-20T03:28:56Z","snapshot_observed_at":"2026-08-07T18:33:21.332793Z","submitted_at":"2024-11-07T17:47:25Z","title":"OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04905","snapshot_observed_at":"2026-08-07T14:18:49.422123Z","title":"Opencoder: The open cookbook for top-tier code large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.422123Z"},"links":{"cited_paper":"/paper/2411.04905","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:b181830788bf33d1ca3e05987efc260907b0835ce1b05989135a473b7b83c303","observation_id":"d4780c4b-4d30-4d97-8fbc-306e2706f1f9","resolution":{"observed_at":"2026-08-07T14:18:49.422123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15921","last_updated":"2025-04-23T23:24:01Z","snapshot_observed_at":"2026-08-04T07:02:39.018938Z","submitted_at":"2024-12-20T14:13:09Z","title":"Less is More: Towards Green Code Large Language Models via Unified Structural Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15921","snapshot_observed_at":"2026-08-07T14:18:49.570812Z","title":"Less is more: Towards green code large language models via unified structural pruning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.570812Z"},"links":{"cited_paper":"/paper/2412.15921","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:8fb37ea4ac716fb2050795e3f784e4ead6c9011532cffd537cc2f0d39e15b574","observation_id":"f38a23b2-d917-42f4-92ce-7d3fdfb8d31c","resolution":{"observed_at":"2026-08-07T14:18:49.570812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:49.765210Z","title":"Delving deep into rectifiers: Surpassing human-level performance on imagenet classification,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.765210Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:96e58a87ade5a9d1b7142dbd1d15b75cf3203ed7df42d5c65e8b4972c7a1ad17","observation_id":"4877cb16-649c-4715-ab71-f88e482f3690","resolution":{"observed_at":"2026-08-07T14:18:49.765210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:49.895278Z","title":"A coefficient of agreement for nominal scales,","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.895278Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:2f9917e0f8211b7d7c26d8302336b0fb794de290580bd7b89436d7facb9ca256","observation_id":"6d7b34fb-a8b3-4a53-b612-d2274275d5a2","resolution":{"observed_at":"2026-08-07T14:18:49.895278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-07T14:10:37.100549Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":15},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2505.19502."}