{"as_of":"2026-08-05T00:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:96a877d777bc2a35acf5ba934603e054fff5702ab46343a376b23995dd153c3a","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T05:42:15.582971Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.21180/citation-record","integrity":"/paper/2605.21180/integrity","json":"/paper/2605.21180/citation-record.json","paper":"/paper/2605.21180"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ruff : An extremely fast Python linter and code formatter, written in Rust","venue":null,"work_id":"09f3c12a-7ab2-4dd2-adec-a0a76358f714","year":2022},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:8b3212b598c3092a65e12b5b48656f936fdcb6a72f63de3fc9ae0d4219a23f7f","observation_id":"b9b86ec6-f301-4765-84e6-46a2427b5ad1","resolution":{"observed_at":"2026-05-21T05:43:59.552239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:0fd6941f68f6627abb111f36f3708bb45243ff489c319903c862fe519bacdd87","observation_id":"8133df44-3410-4c24-8cd5-20a42d67030f","resolution":{"observed_at":"2026-05-21T05:43:58.961120Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.15607/rss.2023.xix.025","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T23:07:40.456716Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":null,"work_id":"659dc47f-4ba2-43a2-9839-898f038dd21c","year":2023},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:4abedae9e1d2eabecdee1f654a4996347710ab12f007c0c652d8534662a0f8ac","observation_id":"c85392c3-e681-4761-aa0e-26133ce612f6","resolution":{"observed_at":"2026-05-21T05:43:58.604489Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:00.992019+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:00.992019+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14623","last_updated":"2024-02-22T15:12:00Z","snapshot_observed_at":"2026-07-06T17:34:03.539565Z","submitted_at":"2024-02-22T15:12:00Z","title":"RoboScript: Code Generation for Free-Form Manipulation Tasks across Real and Simulation","version":1},"cited_work":{"arxiv_id":"2402.14623","doi":"10.48550/arxiv.2402.14623","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14623","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Roboscript: Code generation for free-form manipulation tasks across real and simulation","venue":null,"work_id":"2eb0c146-a50d-4f3a-9856-b00adc068836","year":2024},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"cited_paper":"/paper/2402.14623","citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:da70f604ea032492bf4fdc9835b5bc72826c9dbe35ec4ad7da11d815350153b3","observation_id":"b0453ae8-0315-4425-b6dd-b4d646c1c963","resolution":{"observed_at":"2026-05-21T05:43:58.592880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:10.187892+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:10.187892+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4981.2025","doi":"10.1109/ijcnn64981.2025.11227248","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"An llm-powered natural-to-robotic language translation framework with correctness guarantees","venue":null,"work_id":"b3f23277-a896-4a4a-930e-33f350e423a5","year":2025},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:478d43c487644ecbb331af3fe77d4e7a747bf50d2e97d345b1725f3674a78bc0","observation_id":"90d25cf0-a675-45f8-b4b4-1aa453c9726b","resolution":{"observed_at":"2026-05-21T05:43:58.558988Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T09:23:21.218347+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T09:23:21.218347+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6fa349a6-1095-4353-a9a9-8e2d91eff0bf","year":2023},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:ba753dce8dd4b4518a0160dbd96a825760cfc83aad4116fc7e621e34e2dde7bb","observation_id":"48fead79-5725-40a4-b4b0-8393bc014b0f","resolution":{"observed_at":"2026-05-21T05:43:59.554039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":"2401.14196","doi":"10.48550/arxiv.2401.14196","metadata_source":"pith","pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-07-10T16:07:20.294742Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","venue":"cs.SE","work_id":"f22dae5a-27e2-41d0-a061-c4286418dee3","year":2024},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:91a3270ab0686763cab2e1398e637e0593d633199d2907bceef48cbf63348402","observation_id":"c911c28f-26cb-495c-9a47-87da6f5bb977","resolution":{"observed_at":"2026-05-21T05:43:58.577731Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T06:20:38.664414+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T06:20:38.664414+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3695988","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:17:49.878584Z","title":"Available: https://doi.org/10.1145/3695988","venue":"ACM Transactions on Software Engineering and Methodology","work_id":"0c8df361-56bd-4cfc-bd30-7f3f9c43a066","year":2024},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:5311aca6b9a414f99e459aa35645232e2b35c92769e988a9195c573f94c75c64","observation_id":"4180046e-0274-4442-a0a3-537f45b7e63c","resolution":{"observed_at":"2026-05-21T05:43:58.595877Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T15:38:21.536084+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T15:38:21.536084+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"J., Shen, Y., Wallis, P., Allen - Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":"f050bb44-c07a-4713-8687-07a91cfcf184","year":2022},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:eb6c43405134695edb649b7129a32a401a2b12f3215e6a98f89fc3759949cc3f","observation_id":"2561cf79-7fda-468f-97eb-2b81e3935ecc","resolution":{"observed_at":"2026-05-21T05:43:59.555728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"robo-instruct","venue":null,"work_id":"a14a8848-7409-4d99-97d3-a438d2ba7432","year":2024},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:88a6107fad88383808f1d7ad540718f1191aa8e886b088f5a04e42736edcfff1","observation_id":"90cfef53-dc5b-4a35-b95b-523bd3e78b56","resolution":{"observed_at":"2026-05-21T05:43:59.572126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2405.20179","doi":"10.48550/arxiv.2405.20179","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"J., Guha, A., and Biswas, J","venue":null,"work_id":"44c0ef0b-260b-4480-abcb-4d0270bd4f55","year":2024},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:2026ac2b311f06d5495b5e87b0c57935fffc0b4a29cf4a35a8b5f133d8807680","observation_id":"4a10d21f-e333-4984-b3b5-0852e90d21fa","resolution":{"observed_at":"2026-05-21T05:43:58.589351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:11.776507+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:11.776507+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.336002","doi":"10.1109/lra.2024.3360020","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Deploying and evaluating llms to program service mobile robots","venue":null,"work_id":"ecab064b-a699-4476-8c03-df47ce7a4a99","year":2024},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:0ea0e98e99d7ee91d1e25efe692af7938691c28c4f4ef944c05f81572ce756a6","observation_id":"c4ecf552-f470-48b2-ae30-9f877ef0fd36","resolution":{"observed_at":"2026-05-21T05:43:58.584888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.198115+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.198115+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inner monologue: Embodied reasoning through planning with language models","venue":null,"work_id":"2badfb0f-a3f4-40ce-a9ac-9e55aaf1ca03","year":2022},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:c73020d6e637485e65216ae8b91774bf4b5f1e99b609763e110b0663b17c694a","observation_id":"26418a78-aa14-4c70-8073-9deb430cc186","resolution":{"observed_at":"2026-05-21T05:43:59.569815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-07-10T16:57:24.584548Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:ba78b364879a372e305a54e4e090e31a30d7a030ac3510dbba73d02d30c40608","observation_id":"0c9f0919-8f01-4f5c-afc8-f013dc199857","resolution":{"observed_at":"2026-05-21T05:43:58.581066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TRL - transformers reinforcement learning","venue":null,"work_id":"d41e6341-7d73-4f29-8745-90ff8bbaeb4f","year":2023},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:dde835127f785b1e97f98009db170343077c804a097a5a5d75a39ee259944e09","observation_id":"b121e478-b222-412f-8c46-e9a34cdded99","resolution":{"observed_at":"2026-05-21T05:43:59.568175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":"2409.12186","doi":"10.48550/arxiv.2409.12186","metadata_source":"pith","pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-07-10T16:07:20.290468Z","title":"Qwen2.5-Coder Technical Report","venue":"cs.CL","work_id":"09ba463d-6377-4017-9801-444ffb94b056","year":2024},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:d15b8dc82a486af66b8708e0ab1ecdd8573b71db8e7900bbe09bfe200ca3a4f4","observation_id":"687b79d3-96df-4bce-b32c-34747e3168a7","resolution":{"observed_at":"2026-05-21T05:43:58.554962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:18:55.772185+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:18:55.772185+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3233/faia240968","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cotran: An llm-based code translator using reinforcement learning with feedback from compiler and symbolic execution","venue":null,"work_id":"0cad87c8-05b5-4217-ae11-b0249066d5dc","year":2024},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:7006e8fbd447a79d44e506f2185271860c39fc9c62938872c4ca3698bee229ee","observation_id":"49bde5ed-0633-4773-8440-183bda1de084","resolution":{"observed_at":"2026-05-21T05:43:58.573280Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:13.499544+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:13.499544+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"hash/8636419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Savarese, S., and Hoi, S","venue":null,"work_id":"5d548197-3354-4e8b-9120-7c5ff0a6a3d8","year":2022},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:405f999416665bca5f8944b040fabd36708ecb17f1e25544225115b0e93afc78","observation_id":"baf7c9a0-e0aa-49c7-847b-6af586c7f422","resolution":{"observed_at":"2026-05-21T05:43:58.966059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8891.2023","doi":"10.1109/icra48891.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"ImmFusion: Robust mmWave-RGB Fusion for 3D Human Body Reconstruction in All Weather Conditions","venue":null,"work_id":"fafcadb0-b1fa-4b90-99aa-b36501c38439","year":2023},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:9022ace1fd722380e512f2f2d7b88ccad0e9f342a36e348591496b2d99480579","observation_id":"88826f8c-b54f-44d7-b95d-5a97c2767e66","resolution":{"observed_at":"2026-05-21T05:43:58.564641Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:16.40985+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:16.40985+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S., Wang, Y., and Zhang, L","venue":null,"work_id":"b984053e-8241-4f7c-b313-d51ac3567099","year":2023},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:befee8cf272c697e26fc01a92a317c7fbbe52649f68c412ef2107b67b98fd76f","observation_id":"2789a8c6-be80-4ab5-96e8-0c0dd213f445","resolution":{"observed_at":"2026-05-21T05:43:59.564897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OpenCodeInstruct : A large-scale instruction tuning dataset for code LLMs","venue":null,"work_id":"587013b2-a9d2-4282-893d-c6133933406e","year":2025},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:7d9260853340c987019fa21e8ea7839d3028e6b57006594e286fdaa3da6562b1","observation_id":"ed8cc369-24dd-4e18-92f0-078452450abc","resolution":{"observed_at":"2026-05-21T05:43:59.566605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen2.5-Coder-1.5B-Instruct","venue":null,"work_id":"3295babd-2ead-4174-811f-c47211992775","year":2024},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:cf5ab2e951c6c24883186a73aa68f1bcfbf9435b1b1c6eb4a00ec30231b29c04","observation_id":"462069f8-15a1-4d51-8ead-e450391a2677","resolution":{"observed_at":"2026-05-21T05:43:59.561511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., and S \\\" u nderhauf, N","venue":null,"work_id":"78508a13-e669-401e-b400-8fc1a4506792","year":2023},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:8e133b90163c9de67de16d6e053a31eeb1250248d8180b78132b64ab719fa4a5","observation_id":"2dd069ff-415c-4118-a287-1324911b9522","resolution":{"observed_at":"2026-05-21T05:43:59.557910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:d700d60991723b2df422654b0f7c3a4ebbc37ba7dc8fdfe55dd5ecd7735f2f29","observation_id":"99a164ea-f509-4b89-a16e-14ca7db09dea","resolution":{"observed_at":"2026-05-21T05:43:58.963505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"283319f0-9803-4aeb-89a1-f08f130e08f6","year":2023},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:dd5d4f36ec487f169b82ca6897e18bf0742765720c95f78d47216d16d53c0ea5","observation_id":"9695d68d-569a-4743-a7af-3446727cce58","resolution":{"observed_at":"2026-05-21T05:43:59.559812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06116","last_updated":"2024-02-09T00:58:57Z","snapshot_observed_at":"2026-07-06T17:27:45.481850Z","submitted_at":"2024-02-09T00:58:57Z","title":"LLMs for Coding and Robotics Education","version":1},"cited_work":{"arxiv_id":"2402.06116","doi":"10.48550/arxiv.2402.06116","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.06116","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Llms for coding and robotics education","venue":null,"work_id":"5ef40928-7cb3-41a1-8734-26218347eaf8","year":2024},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"cited_paper":"/paper/2402.06116","citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:ba9ca849145ed5c786b88e2157de47caa603d82453c3af849943cc2e9f608053","observation_id":"ae303f31-147c-4409-ad13-0a701048101a","resolution":{"observed_at":"2026-05-21T05:43:58.570058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:14.368562+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:14.368562+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1070.2023","doi":"10.1109/iccv51070.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"In: 2023 IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":"b8a8bb9e-1d31-40e2-9cab-ae21e338dde6","year":2023},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:4731c81f6df2a14aa318544deff2052b68f5610849fadfbbd5dc822e5226a558","observation_id":"1202e8be-7bde-4ebf-bc11-1a811ea9bdd5","resolution":{"observed_at":"2026-05-21T05:43:58.600246Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:34.217176+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:34.217176+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Syncode: LLM generation with grammar augmentation","venue":null,"work_id":"989c2ac2-8790-4977-a139-afe92480a5e2","year":2025},"citing_paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-21T05:42:15.582971Z"},"links":{"citing_paper":"/paper/2605.21180"},"observation_digest":"sha256:2acc20747a6f8ffcb00509e80136278c437b3bd8fc214df87734dc3b6eb55c2e","observation_id":"1e044c54-3d31-4686-adee-f685e173ed99","resolution":{"observed_at":"2026-05-21T05:43:59.563174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.21180","last_updated":"2026-05-20T13:47:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:31:41.930458Z","submitted_at":"2026-05-20T13:47:52Z","title":"Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":2,"verified_exact":10,"verified_fuzzy":10},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2605.21180."}