{"as_of":"2026-08-08T19:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:064539827e011e532b9ed3268c0d56e5ebd5f99c0a7229ef4821530e6c81cf08","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:31:54.358241Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:14:04.101113Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T17:26:04.783434Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02211","snapshot_observed_at":"2026-08-02T20:14:04.101113Z","title":"Improving llm-generated code quality with grpo.arXiv preprint arXiv:2506.02211, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-08T13:47:11.850462Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.101113Z"},"links":{"cited_paper":"/paper/2506.02211","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:1da1def9c3f1a6848cc90556f11c5966eeff6b370885adb65b9551dbd7d2b7d8","observation_id":"c4a76982-bab2-4716-b3a1-911f1a06ad74","resolution":{"observed_at":"2026-08-02T20:14:04.101113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"cited_work":{"arxiv_id":"2506.02211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02211","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"579f5d4c-5ed6-45b2-b72a-4861436b81d3","year":2025},"citing_paper":{"arxiv_id":"2605.05267","last_updated":"2026-05-06T09:38:31Z","snapshot_observed_at":"2026-08-04T17:41:12.164736Z","submitted_at":"2026-05-06T09:38:31Z","title":"Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-08T17:37:51.790000Z"},"links":{"cited_paper":"/paper/2506.02211","citing_paper":"/paper/2605.05267"},"observation_digest":"sha256:99c6bcf20f492fd533211b9e3291ddf5c8eedf164c87c5d6f9fb16848cf71e90","observation_id":"053b9dab-34da-4aa9-834e-b03b938dc901","resolution":{"observed_at":"2026-05-11T17:26:04.786091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02211/citation-record","integrity":"/paper/2506.02211/integrity","json":"/paper/2506.02211/citation-record.json","paper":"/paper/2506.02211"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T11:31:53.092772Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.092772Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:c585d07c53ada7c8aac6a4f5905c8b800825427a8a7495b62812b651ecdde149","observation_id":"e7d8571f-bed6-4320-94eb-c67e61bc8125","resolution":{"observed_at":"2026-08-07T11:31:53.092772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-07-06T17:24:16.787573Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-07T11:31:53.249493Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.249493Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:a7d4236056c428630dc5d210654b7dc92a5c253b42446451f7d91225b211e6cd","observation_id":"27ef6c89-a7dc-41ec-84a4-cefc545ee0fd","resolution":{"observed_at":"2026-08-07T11:31:53.249493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T11:31:53.421299Z","title":"arXiv preprint arXiv:2410.02089","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.421299Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:e0c06e3d1acbf86f589c0743715aba771af81e419370eec734fcf6e284ffa724","observation_id":"42e8fd50-6085-47b2-9879-b8b77ad352ed","resolution":{"observed_at":"2026-08-07T11:31:53.421299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-07T11:31:53.700853Z","title":"Python Code Quality Authority","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.700853Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:ffd06a6e300171b1511db6b64380e9531ce631676f0240d88f320aa17975605a","observation_id":"e9bfec68-2cfd-40d0-a16a-60fa32f7e1e5","resolution":{"observed_at":"2026-08-07T11:31:53.700853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:31:53.801015Z","title":"John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.801015Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:79927d751a013c0a4f5ed9f9502a19abe74dd2eba97db6a19f1066909724fca5","observation_id":"4e323f52-8cda-464e-850c-c18facdd882c","resolution":{"observed_at":"2026-08-07T11:31:53.801015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:31:53.979789Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Y Wu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.979789Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:d8493b075a7757d3e23fbacb516267e10104730db954b870a5fc32847f364fcd","observation_id":"db786141-1b76-41c9-9c68-35409a456dcc","resolution":{"observed_at":"2026-08-07T11:31:53.979789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-07-06T20:30:31.588538Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01715","snapshot_observed_at":"2026-08-07T11:31:54.286136Z","title":"PRLCoder: Leveraging Process-Supervised Reinforcement Learning to Enhance Code Generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:54.286136Z"},"links":{"cited_paper":"/paper/2502.01715","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:bfc04304ab30462118dd36ec38724d772bde3893fc1229826a54ad71d5e16d54","observation_id":"18e4674b-e365-46e7-8ec7-e59fadbb27af","resolution":{"observed_at":"2026-08-07T11:31:54.286136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:31:54.358241Z","title":"operation_audit.log","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:54.358241Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:4049b82524f49629dae316bb02a4982c499b9971f4d4a28c102983731658f108","observation_id":"378849d3-2eeb-4410-9d09-7f42e5337343","resolution":{"observed_at":"2026-08-07T11:31:54.358241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-04T23:13:25.514661Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-07T11:31:53.495008Z","title":"Measuring coding challenge competence with APPS","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":1977,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.495008Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:e1bf6af8d81beea79613123a5e444e07b3c7bf5fe9d8cf1c9773489b3a6c6072","observation_id":"16b8eb3b-5ed2-474b-9cc0-dc6b5efd9bd6","resolution":{"observed_at":"2026-08-07T11:31:53.495008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01780","last_updated":"2022-11-03T08:32:59Z","snapshot_observed_at":"2026-08-08T07:32:45.881885Z","submitted_at":"2022-07-05T02:42:15Z","title":"CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01780","snapshot_observed_at":"2026-08-07T11:31:53.592291Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.592291Z"},"links":{"cited_paper":"/paper/2207.01780","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:e88de6340541e3d898f81eea4e0875c4c97b53c3d88d00cc6a8a4828778c676e","observation_id":"f03c37c0-91bf-4042-876b-76f091be84d8","resolution":{"observed_at":"2026-08-07T11:31:53.592291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:31:53.908094Z","title":"Jendrik Seipp et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.908094Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:cba1263c034130efd806a931934dcafd2dfcbf8d74c686a5b3da9b10ae1b4f87","observation_id":"6ca98cb9-9959-472b-be3d-e676d2059e9d","resolution":{"observed_at":"2026-08-07T11:31:53.908094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09643","last_updated":"2025-04-13T16:34:17Z","snapshot_observed_at":"2026-08-07T16:06:07.784754Z","submitted_at":"2025-04-13T16:34:17Z","title":"Iterative Self-Training for Code Generation via Reinforced Re-Ranking","version":1},"cited_work":{"arxiv_id":"2504.09643","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.09643","snapshot_observed_at":"2026-08-07T11:31:54.540885Z","title":"Iterative Self-Training for Code Generation via Reinforced Re-Ranking","venue":"cs.CL","work_id":"cc1c5d56-b6bb-4a40-8ca5-8809616bcf66","year":2025},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:54.067709Z"},"links":{"cited_paper":"/paper/2504.09643","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:a8e2f8896294e926b1c048dadd0f905011b02d7599e21ba55aa23d469def1304","observation_id":"7aa5ae01-ac28-44cb-aa26-bbf9606695d6","resolution":{"observed_at":"2026-08-07T11:31:54.623757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:31:54.201555Z","title":"The Mypy Team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:54.201555Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:b14d446ad02c9a16a8665c5cd4bda641056815918e1070207181512ae52159e0","observation_id":"6bbf3403-b156-47ef-9a44-b9cca6cd9fd6","resolution":{"observed_at":"2026-08-07T11:31:54.201555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17621","last_updated":"2025-02-04T09:24:30Z","snapshot_observed_at":"2026-07-06T19:38:18.191612Z","submitted_at":"2024-10-23T07:22:33Z","title":"Process Supervision-Guided Policy Optimization for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17621","snapshot_observed_at":"2026-08-07T11:31:53.155905Z","title":"Ning Dai, Zheng Wu, Renjie Zheng, Ziyun Wei, Wenlei Shi, Xing Jin, Guanlin Liu, Chen Dun, Liang Huang, and Lin Yan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.155905Z"},"links":{"cited_paper":"/paper/2410.17621","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:f52d249d6d7c1fe268ed0241dd166864ac2d518c1b219eea1e72313145adf39a","observation_id":"70f3149e-36fb-4255-b48f-bdcf2e5f911e","resolution":{"observed_at":"2026-08-07T11:31:53.155905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 2 inbound Pith citation observations for arXiv:2506.02211."}