{"as_of":"2026-08-05T00:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88235e75a9e3255a3b201972e96afdd3aa4d6b28a561bfd8d95737b4d70cc9ea","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T13:40:39.598985Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T08:49:37.615924Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.10968","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Beyond uniform token-level trust region in llm reinforcement learning.arXiv preprint arXiv:2606.10968,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-07-16T23:19:03.035042Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2606.10968","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:d87a35f215031d718e5db8ee7cad83e10f306eab4864581e0009064ce321500b","observation_id":"0eb8cef3-6fd1-42ae-b224-2feaf23564c4","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.10968/citation-record","integrity":"/paper/2606.10968/integrity","json":"/paper/2606.10968/citation-record.json","paper":"/paper/2606.10968"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:757efd5ab5564576365334f53d11ecf995f7b37632dc902f757c38d20b05c53c","observation_id":"da798e84-75d3-4c64-ab8b-74fa70eaf887","resolution":{"observed_at":"2026-07-03T04:47:37.876261Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:17c6b8d861c8715e66ded4a33e2399744ed9cdd0a8a8b2282b25d90934485ba2","observation_id":"749ea2ef-3962-42c1-a1be-13b71d402f2b","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"Proceedings of the nineteenth international conference on machine learning , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:992c425df4372b5752e1cb9ef528999219bb793b94aeaaba23da19346d0019bc","observation_id":"7641eaf3-7e1e-49e6-81d9-7b7b932eb043","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:b214ef49a9f097193e47c915640ceca539c63c3dda40418b9a26b3e095680fbf","observation_id":"b4e07276-ef90-4037-86e7-8af3931f4821","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:b410d9b04cbb6ba52629bab77d7d5e998b0f5efb0372a8a135e644332a6a7ff7","observation_id":"c9611386-c5dd-4155-af39-025814280182","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"Riedmiller , title=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:8a2c630c3d733915b3e649d28f45782ea76b5261d354a16689ba832584dc4c8f","observation_id":"1c75c9dc-d30b-48e6-bfa1-6ba694efd28b","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"Francis Song and Abbas Abdolmaleki and Jost Tobias Springenberg and Aidan Clark and Hubert Soyer and Jack W","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:c9abaf391d03dab05b7e9d143d41e1f0971f4a3157d509568f15afaa8dd7f19c","observation_id":"2b8f5a20-3205-4698-a8af-7db4de249624","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"CoRR , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:690cc8aaecc1c16b9c90614a5b13694a14cf4a58c9ba8d4430b145c381bc56d4","observation_id":"c612ccec-95a9-4578-8cc1-07d7baa69d94","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"2019 , cdate=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:572f39f2f43ad6d8e680111016866f432dfb7702f046ed00be85269ca58f977d","observation_id":"7b893bb6-924a-434c-80a2-6da0f348ec9d","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:93fa470a1d43da59c9a3707eebd8f1b04e8f1edb4dfe4c91bbe2b94e15f4aaf1","observation_id":"bceba189-06f8-41bf-890a-d888b595aa6e","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:d832ff8ff422406ddafb81e68d7a987a42ab88412fc4588118f1987458a34b5d","observation_id":"7e6b9655-0f05-42d3-a70e-9efa17eea6f1","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"The annals of mathematical statistics , volume=","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:4cadd9d1dd8192ad322c15c77ba4b88aa1de5fc3daaf27b73487d99ce5ca428a","observation_id":"0f58bc07-fe6a-4a4c-873b-61022426dbad","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:5971e44b996612f989105e313ab7199368fb9687678a319ec6d603f9db76325a","observation_id":"6dd911a5-1551-47b9-87ae-1e79f6199b1e","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:b2d4ab41a9d33cd1f7c3c12314c7cd55d310e1e879c850f2ddb8a32a51b4d1e8","observation_id":"1422971e-36f9-4ce6-9813-6b991d84c1d9","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:262c25df2381d5f7073ec18293ce911d7751748f6b851347bc0b37639e5a62f0","observation_id":"14e2c108-c115-4b57-abb2-1ce1f1a51311","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:6ed2b5de0d90bad8a23be2ade014938f103cc8bc678b40586ccc6de8af8ddf27","observation_id":"204eb0be-40c8-4979-8f94-28b87591052b","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:1226463a5e69b733a4b01f356acf86ebedecd0d660854682c0e868f4e2b97f57","observation_id":"721df89d-fe93-443b-aaf9-e63f58b5f088","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9031.369607","doi":"10.1145/3689031.3696072","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"4909736c-3fe1-4820-b489-cca51669c6d2","year":2025},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:a9eb1db81fa0d85a1e01519908a532276b65d0665bd95814a4495ebc5fd287c1","observation_id":"37ab2e50-8c7c-4c37-ad8c-ec3a83a62571","resolution":{"observed_at":"2026-06-27T13:40:56.637058Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"CoRR , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:742ca6838602f7dd41f6cbc55052072fd77cf29552110ef7586b9a8a7eefe181","observation_id":"1b5f9014-2376-492d-b3e7-ae5b5c56e784","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"CoRR , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:f4a3623b53d474dc68ed116c97b44082bd8d5c31fd45669ab4675ba8f7f29b5a","observation_id":"6702c7ff-0e30-4f28-8e6a-45d6766bf672","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20347","last_updated":"2025-12-01T12:02:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T14:25:19Z","title":"Soft Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":"2511.20347","doi":"10.48550/arxiv.2511.20347","metadata_source":"pith","pith_arxiv_id":"2511.20347","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Soft Adaptive Policy Optimization","venue":"cs.LG","work_id":"2d2c49f8-7feb-48c2-af7e-025b94c5d4f9","year":2025},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"cited_paper":"/paper/2511.20347","citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:9e171ab45c7754d795cc5a65e976e32304c691fd10b5ccae67610bfdf7f6bb69","observation_id":"6759555a-8bdd-4595-bba1-86fb34d9f78c","resolution":{"observed_at":"2026-07-03T04:47:37.871052Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.22718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T04:47:37.872104Z","title":"arXiv preprint arXiv:2601.22718 , year=","venue":null,"work_id":"c3544b5b-2386-42a5-ae9e-d86e155af07e","year":2026},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:919fa440658c2545f405bdd8d65a7b29417ac9fcea449a76700909ac6b787391","observation_id":"3e36b273-1c89-4306-8a8a-fcabc4df73ce","resolution":{"observed_at":"2026-07-03T04:47:37.873592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"CoRR , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:4035ae658f3fd8a0baf7a5e5efbc36dff12b320559b909aecc332a41a8b50ca5","observation_id":"22ee3450-61f3-4f6a-b286-a32905d15bfe","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"Second Conference on Language Modeling , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:3e1d87b22fc29468d88d86c0bfefa60c25951833fce2873ce0ea4592f13bb7b1","observation_id":"515e78cc-88b2-4214-ad1b-581355e8abc7","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:5228edbb3e7e682dd1fc19c369c401be482944a395f788f96024049409bbf039","observation_id":"ad0c724c-5297-4c94-99a9-550e54b433a9","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"CoRR , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:5a7fbe96717eaa987af77f8d79dd081596ee8cdb613b351c5cf6a851a482374a","observation_id":"fe439ed9-0450-4c35-bcf8-9aaa0cfb9b18","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":"2501.03262","doi":"10.48550/arxiv.2501.03262","metadata_source":"pith","pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","venue":"cs.CL","work_id":"557f9e99-cb00-4dd2-92fd-67ddcddbb35d","year":2025},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:71259aa49e17d5321c62511afecc1c2237ad7d2c63997b9bacb1132b4a5156b1","observation_id":"44674da9-7e50-4e80-9487-9e9220f8ee14","resolution":{"observed_at":"2026-07-03T04:47:37.870774Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:52:56.973979+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:52:56.973979+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"CoRR , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:d25897799930eb01dd2b8f0b921b0381c57e0577974fcfab860dc9ea376aa880","observation_id":"d6f86a76-b645-4da9-a1ec-829abc32a93d","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04879","last_updated":"2026-05-26T12:42:28Z","snapshot_observed_at":"2026-08-03T04:29:30.222718Z","submitted_at":"2026-02-04T18:59:04Z","title":"Rethinking the Trust Region in LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2602.04879","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04879","snapshot_observed_at":"2026-07-09T22:26:37.209549Z","title":"Rethinking the trust region in llm reinforcement learning","venue":"cs.LG","work_id":"d2127175-a1c0-405f-b108-d2f862a0d427","year":2026},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"cited_paper":"/paper/2602.04879","citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:9c44e2be75bcff59aa68b05ec43e175da24a261951f5a15b7e63e4a25890a8bf","observation_id":"a61ff2c1-7276-4f66-b0d7-96adf902a2fb","resolution":{"observed_at":"2026-07-03T04:47:37.873043Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20865","last_updated":"2026-05-20T08:01:01Z","snapshot_observed_at":"2026-08-03T17:48:27.538608Z","submitted_at":"2026-05-20T08:01:01Z","title":"Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards","version":1},"cited_work":{"arxiv_id":"2605.20865","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.20865","snapshot_observed_at":"2026-07-03T04:47:37.864736Z","title":"Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards","venue":"cs.LG","work_id":"ea798b98-1e8e-40c8-94d9-2bcfd303feca","year":2026},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"cited_paper":"/paper/2605.20865","citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:792c59920857a87aca24816710145cbc01bc8063778cbc644a3fb895ccf279eb","observation_id":"87dc1642-f0b4-4789-a449-6f0e14205f74","resolution":{"observed_at":"2026-07-03T04:47:37.866080Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.19835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:29:30.724740Z","title":"Fipo: Eliciting deep reasoning with future-kl influenced policy optimization","venue":null,"work_id":"5f612bbe-1204-4f05-b54d-9a02bc9d66ea","year":2026},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:a482014105bf7a3332a084ef200d99da791a259294fb8c6421e7d876a65676d5","observation_id":"2cdaeb9c-f790-426c-9086-d08b0766c84d","resolution":{"observed_at":"2026-07-03T04:47:37.865305Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.23075","last_updated":"2026-06-26T02:45:25Z","snapshot_observed_at":"2026-08-03T17:03:53.187665Z","submitted_at":"2025-12-28T20:41:59Z","title":"Trust Region Masking for Long-Horizon LLM Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2512.23075","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.23075","snapshot_observed_at":"2026-07-03T04:47:37.862373Z","title":"Trust region masking for long-horizon LLM reinforcement learning","venue":"cs.LG","work_id":"b78c929c-be57-4d7a-aa04-22a94f67a879","year":2025},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"cited_paper":"/paper/2512.23075","citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:748955ba45785823400f2c8414cffd6a6ee9bedf2173e6ee32b27b5425a2355e","observation_id":"0dbbe045-60e1-40ef-8f5e-d26700439a33","resolution":{"observed_at":"2026-07-03T04:47:37.863558Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:40:39.598985Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T13:40:39.598985Z"},"links":{"citing_paper":"/paper/2606.10968"},"observation_digest":"sha256:438f0c6a4b657414f5b19c5ca1a15412733c6625c23624bd26073d532c98c150","observation_id":"2587ab3f-3995-4846-914c-118d62cd7f08","resolution":{"observed_at":"2026-06-27T13:40:39.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2606.10968."}