{"as_of":"2026-08-21T18:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31d0f343b99c47ebfca111367236a0ebb10b0c874e2d7fb1b59439d358de7e9d","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T22:18:13.418579Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06987/citation-record","integrity":"/paper/2607.06987/integrity","json":"/paper/2607.06987/citation-record.json","paper":"/paper/2607.06987"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.544868Z","title":"Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms","venue":null,"work_id":"a52e17c6-6df2-403b-9642-b3f07cfbff24","year":2024},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:e63fbf81b85d70df554df2b8ee5afe595edcdd8e0bc31618e63315886974950c","observation_id":"6ecaa784-1b7b-45af-a597-0c1b5a8609a2","resolution":{"observed_at":"2026-07-09T22:26:37.546147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":"2212.08073","doi":"10.48550/arxiv.2212.08073","metadata_source":"pith","pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Constitutional AI: Harmlessness from AI Feedback","venue":"cs.CL","work_id":"faaaa4e0-2676-4fac-a0b4-99aef10d2095","year":2022},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:82d4e4869530aff831e11533bc52e7be9e97bab30a86e8012ee7327db55d75f8","observation_id":"2d1d6d8d-9ef5-4661-8a4b-9327ceb38a45","resolution":{"observed_at":"2026-07-09T22:26:37.194238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:13.900899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:13.900899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.143377Z","title":"Efficient reinforcement learning with semantic and token entropy for llm reasoning.arXiv preprint arXiv:2512.04359, 2025","venue":null,"work_id":"e6aecd47-d92d-45a9-8c1a-ab8de38d6c4a","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:44fb5e94106ab0088c708ac2dabf6f65621357816759a2f4087c68f7962286fe","observation_id":"97768206-e2e7-458a-9f90-51011be5ec09","resolution":{"observed_at":"2026-07-09T22:26:37.144898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-13T22:06:45.477681Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2506.13585","doi":"10.1109/tkde.2022.3168611","metadata_source":"pith","pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":"cs.CL","work_id":"c59fbe20-f41e-4140-a81c-40a12e7e8364","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:6478f6c856dc873172debdb690e4c0d94d7c0c4c476ae54ab46060e86dae13c4","observation_id":"43d3cb3c-2cbf-48be-a23e-6e0625c73da5","resolution":{"observed_at":"2026-07-09T22:26:37.205825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.546679Z","title":"American invitational mathematics examination-aime 2024","venue":null,"work_id":"4442c031-3003-4490-80ad-aebe62b930c7","year":2024},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:7e1b05f2edb59654b5aba92a26da82dbfa4e70dcfb73908005829d652c93febd","observation_id":"6b1f59e4-5202-4fe7-986e-3fd57d6a8090","resolution":{"observed_at":"2026-07-09T22:26:37.547848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19282","last_updated":"2026-05-19T03:00:26Z","snapshot_observed_at":"2026-08-15T18:15:28.071598Z","submitted_at":"2026-05-19T03:00:26Z","title":"Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR","version":1},"cited_work":{"arxiv_id":"2605.19282","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.19282","snapshot_observed_at":"2026-07-09T22:26:37.170955Z","title":"Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR","venue":"cs.LG","work_id":"3e487208-5945-47db-a00d-d064d0a4169d","year":2026},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2605.19282","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:ea9302d541b71f143b546ac82c08a4d647eae7cc1b75b9e5ae217e9accfcb6d8","observation_id":"84f76c6a-8d46-4b69-a342-163eef14c5b3","resolution":{"observed_at":"2026-07-09T22:26:37.172379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.557433Z","title":"Hero, and Sijia Liu","venue":null,"work_id":"8baa1f95-dc6d-415c-a624-e74ae6070c4b","year":null},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:03e5968b14f593373f8b4db5a9a304e929d4d6eddccf7cfeab7637e5b61ed386","observation_id":"9c6e3eb3-76f2-41ff-92a6-64d5813f8103","resolution":{"observed_at":"2026-07-09T22:26:37.558585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.568938Z","title":null,"venue":null,"work_id":"d212f401-fa64-4dea-b677-273c4e3bdd18","year":null},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:81469b45c6d87c11b3bb5dabb290f63684c33b15bf47d3833c7a491785cf7de2","observation_id":"8cd12236-c4cb-407c-8299-b389a8f2607f","resolution":{"observed_at":"2026-07-09T22:26:37.570176Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20347","last_updated":"2025-12-01T12:02:46Z","snapshot_observed_at":"2026-08-12T16:05:03.602321Z","submitted_at":"2025-11-25T14:25:19Z","title":"Soft Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":"2511.20347","doi":"10.48550/arxiv.2511.20347","metadata_source":"pith","pith_arxiv_id":"2511.20347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Adaptive Policy Optimization","venue":"cs.LG","work_id":"2d2c49f8-7feb-48c2-af7e-025b94c5d4f9","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2511.20347","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:2dbef7eba6426303f51b923263c1ebdddc66301e39f568cc409c2c68320b1c5f","observation_id":"05abc2b9-07d0-4070-a40b-24c2660f3ef5","resolution":{"observed_at":"2026-07-09T22:26:37.220833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:9488b757c6537029ec0ffbdf11f51e980475974b2e57f6221ae319b767250d41","observation_id":"e2e5cef2-b1a7-4c72-b972-d78c584c3e88","resolution":{"observed_at":"2026-07-09T22:26:37.178406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.555770Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":"3a70086d-582d-488d-823a-fd2b4a673b29","year":2024},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:3bfab32cbb0a7fed87b45db07d3d4eb2e981879a0bf2d2a5323961e14c423561","observation_id":"188c66a1-c992-44cb-ba81-5a4763573b8b","resolution":{"observed_at":"2026-07-09T22:26:37.556925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":"2501.03262","doi":"10.48550/arxiv.2501.03262","metadata_source":"pith","pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","venue":"cs.CL","work_id":"557f9e99-cb00-4dd2-92fd-67ddcddbb35d","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:b610891e6f45f4e42e4aa106c03653af984610e36caea6e98d2eb9c625d72e01","observation_id":"a638b56e-b728-4e8a-beb6-e719adf54287","resolution":{"observed_at":"2026-07-09T22:26:37.184446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:16.02596+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:16.02596+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.559100Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"f1c67e7b-467e-4e0d-a0c7-c8c828f12738","year":2023},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:d35063d325274f23f796fdcb5fc2c3dd1a81e6a9b52781a02eb925209eda822d","observation_id":"ed73da8b-ba1d-4468-bba3-9be437561718","resolution":{"observed_at":"2026-07-09T22:26:37.560237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.549976Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":"a69a8350-e5b3-47c6-b541-2a79e78f9333","year":2022},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:330e2b43882f12726d16d98fd31a650d49a688ae69b39206d1baf2590b5c7b3d","observation_id":"46b2b7b2-b5f5-41c7-96ad-62e48316a218","resolution":{"observed_at":"2026-07-09T22:26:37.551171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.05281","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.155980Z","title":"Back to basics: Revisiting exploration in reinforcement learning for llm reasoning via generative probabilities.arXiv preprint arXiv:2602.05281","venue":null,"work_id":"5f593e86-22a7-47d2-91cb-77c6a40c8ea9","year":2026},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:705cb806c849b21ce6331bcd64027ee4213f206f74a8ae11fcc626980c5ebaad","observation_id":"8210591f-20ee-4bc1-b912-975aaa72e5e7","resolution":{"observed_at":"2026-07-09T22:26:37.157612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.04918","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.158808Z","title":"Bandpo: Bridging trust regions and ratio clipping via probability-aware bounds for llm reinforcement learning.arXiv preprint arXiv:2603.04918, 2026","venue":null,"work_id":"4705869d-86c7-45e0-a6c2-27668f3a5085","year":2026},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:1e9a5943749df2c77e87b0fc5e37c59cb95b867ebbb053a73cc9f1966a5a4440","observation_id":"1af9b955-f292-4b10-9334-8e17eeb058ec","resolution":{"observed_at":"2026-07-09T22:26:37.163679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.560761Z","title":"Let’s verify step by step","venue":null,"work_id":"1e1d0751-e17d-4e3e-aa61-95245c4f49c8","year":2023},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:cb75a59f62fd0a8b86b27c88df5d95b354ece3c267d86bed36e9907551385f31","observation_id":"c424ffdf-b5d7-4941-8fbf-d34faa72f81e","resolution":{"observed_at":"2026-07-09T22:26:37.561765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.206934Z","title":"Length-unbiased sequence policy optimization: Revealing and controlling response length variation in rlvr.arXiv preprint arXiv:2602.05261","venue":null,"work_id":"f6f02ecf-aabd-4b03-a178-c1f92786f2d4","year":2026},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:55c636f230e685180ad95e6dc052f3c0654a7266bfaa5f8c1550e3891c836224","observation_id":"a73a5e02-b75f-4aa2-9b0f-97f26eabc1bc","resolution":{"observed_at":"2026-07-09T22:26:37.208422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:62bd1b421c819290441e32fa0b0dad0eadfe99ca8da9788127e003bc97bfc12b","observation_id":"1e606b2d-4d75-4a88-9c61-66afb52ae5f8","resolution":{"observed_at":"2026-07-09T22:26:37.169302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.548339Z","title":"Inter-GPS: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":"e3c1ca11-1199-4b30-b8a1-4021f1b6df64","year":2021},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:59c161e61b5b17895aa61964a29994c3e478ab1c1c96dcc0927e64bfd4286ca1","observation_id":"dad217d4-b78d-4c7e-9ad1-4b06b0080d45","resolution":{"observed_at":"2026-07-09T22:26:37.549493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.153429Z","title":"Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers","venue":null,"work_id":"4df9a4a1-3908-4d16-9c0b-253bb245a0c4","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:4af3d3d9596efa4ac6d06f39ee9058542b53ef29430e84bc724d4501659eb4e8","observation_id":"307656d7-c748-419f-9431-0a0caaa19fe3","resolution":{"observed_at":"2026-07-09T22:26:37.154897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.09177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.150847Z","title":"Clip your sequences fairly: Enforcing length fairness for sequence-level rl.arXiv preprint arXiv:2509.09177","venue":null,"work_id":"64b83182-f7cb-4aae-b3e1-c1ab2236f541","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:5df04823e4dae04a5d1d241c7d7e303419485b1b1771ef28c38d48d2a6b4ff1c","observation_id":"5752603f-8b67-48e7-b95e-6c9657a8108a","resolution":{"observed_at":"2026-07-09T22:26:37.152364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.543241Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"0da889ef-5bc8-4b11-bf2b-1be51ea93274","year":2022},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:a6acae4ac902237b6208b5d71d76b73cd5fbd72b6adac46f8b8483280af8d619","observation_id":"85a27c07-f2b0-4cb9-adb9-bb2e7b5b1be5","resolution":{"observed_at":"2026-07-09T22:26:37.544379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04879","last_updated":"2026-05-26T12:42:28Z","snapshot_observed_at":"2026-08-17T20:22:28.455264Z","submitted_at":"2026-02-04T18:59:04Z","title":"Rethinking the Trust Region in LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2602.04879","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04879","snapshot_observed_at":"2026-07-09T22:26:37.209549Z","title":"Rethinking the trust region in llm reinforcement learning","venue":"cs.LG","work_id":"d2127175-a1c0-405f-b108-d2f862a0d427","year":2026},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2602.04879","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:23dd2b0006e6839da05e2dda552c2f7826f4f3c83b30d53a2802b61c2cd2b791","observation_id":"6c9d7f76-ac73-4975-b320-deeb51bd696d","resolution":{"observed_at":"2026-07-09T22:26:37.210776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14286","last_updated":"2025-03-19T14:25:30Z","snapshot_observed_at":"2026-08-19T23:17:42.036662Z","submitted_at":"2025-03-18T14:23:37Z","title":"Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs","version":2},"cited_work":{"arxiv_id":"2503.14286","doi":"10.48550/arxiv.2503.14286","metadata_source":"pith","pith_arxiv_id":"2503.14286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tapered off-policy REINFORCE: Stable and efficient reinforcement learning for LLMs","venue":"cs.LG","work_id":"885b5bf5-7859-4e5a-af07-52a7da4f25c1","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2503.14286","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:0ac2e99de929c1144a9fb34438437f58518c62ab57897cfd5c338e31b2a00b61","observation_id":"f9bf1274-34d2-4bcd-b657-6a9ea585f631","resolution":{"observed_at":"2026-07-09T22:26:37.213079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.565572Z","title":"Trustregionpolicyoptimization","venue":null,"work_id":"62a16e82-6f49-4709-8eb1-365a83272496","year":2015},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:bb67fdb855cce324391b4204cc8f61b9767ef35ff30d6da8c8fc2510a684be54","observation_id":"6d30ce88-df57-4bcd-b92d-b05c0d44fdb4","resolution":{"observed_at":"2026-07-09T22:26:37.566613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:b3ddeddae6a73862ca20d3395005f0377fdb3a06f245477ac0ecd63acbbcf195","observation_id":"81b169db-2a72-4d47-9a77-fcf3382ee7a8","resolution":{"observed_at":"2026-07-09T22:26:37.147239Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.00248","last_updated":"2026-06-30T22:57:43Z","snapshot_observed_at":"2026-08-12T14:16:56.866074Z","submitted_at":"2026-06-30T22:57:43Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","version":1},"cited_work":{"arxiv_id":"2607.00248","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.00248","snapshot_observed_at":"2026-07-09T22:26:37.202357Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","venue":"cs.AI","work_id":"995a7b7f-e3ee-4b90-9bdd-83986b013b54","year":2026},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2607.00248","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:0a8438961c32412121eddca51555837bb102a4dca9ce324acad2f2e4635f4a63","observation_id":"4e27c231-70d3-4c1d-94d4-086dce0ae3ab","resolution":{"observed_at":"2026-07-09T22:26:37.203495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:ffac0b337b99ce15ab7e0d018768e4cd6dced80a2e7d864ece0aa79a62e2e504","observation_id":"b0ca443f-67e5-4285-b13c-b834c9c04eb1","resolution":{"observed_at":"2026-07-09T22:26:37.149556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.562250Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"3d007d3f-47ba-46c2-b8a4-c74b038def4c","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:8c1025a670aebdc0d5918888fac0f580108765598290822feb528954723156de","observation_id":"f24699ae-8f49-4063-a8fd-548d4f44039d","resolution":{"observed_at":"2026-07-09T22:26:37.563365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:1168fd8e2c55acea362290ff46f402bde06f04b7909e66edb7536380232dcc12","observation_id":"df14d639-5808-4c95-ab37-e8443cd1c7ff","resolution":{"observed_at":"2026-07-09T22:26:37.181003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.07629","doi":"10.48550/arxiv.2508.07629","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Klear-reasoner: Advancing reasoning capability via gradient-preserving clipping policy optimization.arXiv preprint arXiv:2508.07629","venue":"ArXiv.org","work_id":"2d3fe64a-7a53-4e46-b832-c2a7bb443af1","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:c800aa3141552ad8ce6f164881ca79f18661aad3504c5571f382a4d2d95fa2cb","observation_id":"3c35c6cd-3213-478b-acbb-033b90cb0194","resolution":{"observed_at":"2026-07-09T22:26:37.166428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.06062","last_updated":"2026-05-15T05:25:06Z","snapshot_observed_at":"2026-08-15T14:36:41.242147Z","submitted_at":"2025-10-07T15:54:24Z","title":"When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL","version":2},"cited_work":{"arxiv_id":"2510.06062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.06062","snapshot_observed_at":"2026-07-09T22:26:37.216917Z","title":"When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL","venue":"cs.CL","work_id":"9d58b069-561d-440c-9c42-aba858a81448","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2510.06062","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:24d4884055c8f63172d4ca81d824947a2624130e9f513d8f17aa8f85675f2b37","observation_id":"f62037ce-208b-412f-8689-8761caf75da3","resolution":{"observed_at":"2026-07-09T22:26:37.218159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.567167Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","venue":null,"work_id":"1505b55b-04d6-462d-9b0e-9e068fcbace0","year":1992},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:8b1ca618a61f4462b08e8eaae3895e38f595e1151b30dc076e30cec1f9debf04","observation_id":"30250df8-2189-400b-b35a-791e85d7d501","resolution":{"observed_at":"2026-07-09T22:26:37.568414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-20T14:18:10.920944Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:e7988dcabf322a6b49945ecb60d6aa12be717941e0b387a1b50784647d3a6f72","observation_id":"11e7ffd4-62da-4fb0-ad77-3e0b2b1ce165","resolution":{"observed_at":"2026-07-09T22:26:37.189407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:f40fb929d22ef65064bef8741b2f8d53dfdd03ce0c6e4d0e3522d0b30b855d5f","observation_id":"5c3659a4-0f46-48e2-8f28-4d8e9753cdd4","resolution":{"observed_at":"2026-07-09T22:26:37.196554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:40c0f649a3dc1aaaf216be081a6e6c8d92cfcc5ad4939b9126b76a6e30a65b03","observation_id":"7baf2c4e-27fe-4c60-bb29-22add431be8f","resolution":{"observed_at":"2026-07-09T22:26:37.198934Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:54ae613906d7daf1392eb02de22d1ff513df81f4d529e7296cf766b7b33baaa3","observation_id":"118ea934-f2e3-4e36-90a5-a9c9bb703074","resolution":{"observed_at":"2026-07-09T22:26:37.223302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.563927Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":"5fc554f4-c67e-472b-86c9-2aeae47f5b18","year":2022},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:fff71d75c505ab82f4715667292beed921104125f16bd8db4cc082b2e9ec9422","observation_id":"802ea673-266f-46f2-80bd-7c5365a9ea4d","resolution":{"observed_at":"2026-07-09T22:26:37.565043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.185576Z","title":"George E Uhlenbeck and Leonard S Ornstein","venue":null,"work_id":"130437ca-6f04-44ab-a56a-63a275296540","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:4342ebd904c96ee7f47cc9a558d5cc9981578bace57d7fc8002506dfd1066e40","observation_id":"b6faac81-0a95-46fa-b6b0-1ed56c35f881","resolution":{"observed_at":"2026-07-09T22:26:37.187015Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.20673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.190550Z","title":"Geometric-mean policy optimization","venue":null,"work_id":"a9c27ea5-14a8-4719-a98d-c59a3a8c142a","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:241b9e029b89202dd375d877fe75d562a5ece88ceb93a89cbd89fb654d0fd793","observation_id":"73096a43-0a93-48c7-b6ab-9b570dd25d25","resolution":{"observed_at":"2026-07-09T22:26:37.192014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-21T02:04:30.074424Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:13de98a7173ae9c2bdec87e46af20c9b05d65e9dde7d526884217277f9e374af","observation_id":"31dc8757-8ed5-4869-9478-1e6dd1adb69c","resolution":{"observed_at":"2026-07-09T22:26:37.201213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01161","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.214162Z","title":"Prosperity before collapse: How far can off-policy rl reach with stale data on llms?","venue":null,"work_id":"99a02056-55bc-45e6-8d10-7f31cf541473","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:c6642f5d21fd2f4d10dd741d557c8ca36b2c15d031968fdd05b463e79e976cce","observation_id":"70b4d23e-3657-4bc5-bef7-a357d4b22626","resolution":{"observed_at":"2026-07-09T22:26:37.215591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.01347","doi":"10.48550/arxiv.2506.01347","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The surprising effectiveness of negative reinforcement in llm reasoning.arXiv preprint arXiv:2506.01347","venue":"ArXiv.org","work_id":"90fa4c77-dcfb-4253-827e-9bde0d342fcb","year":2025},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:46bac8834dc69cc701ba7758ba86f836ce69729ff442c8a8e2d006a1040b3390","observation_id":"22670313-d73a-4f44-9de9-f7a4f3f27c49","resolution":{"observed_at":"2026-07-09T22:26:37.175791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.553814Z","title":"If πθ < π lower, the gradient is nullified to prevent the probability from dropping too low (over-penalization)","venue":null,"work_id":"970fd505-e408-4bbe-9d74-b3c40bef0edc","year":null},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:26b5f43979b2012058f35069616256166d784d3db615c8d498d86f66b7a0a8f5","observation_id":"ea02100c-396a-458b-8896-cb07df26438e","resolution":{"observed_at":"2026-07-09T22:26:37.555237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.551722Z","title":"1 G GX i=1 ˆAi 1 sg(πθ(oi|q)) 1 |oi | ∇θ πθ(oi|q) 1 |oi | # =E q,{oi}","venue":null,"work_id":"535b04ad-89b3-44e0-bb90-5e63be349d4f","year":null},"citing_paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-09T22:18:13.418579Z"},"links":{"citing_paper":"/paper/2607.06987"},"observation_digest":"sha256:4b2649a57e74885ebe3210ef43af14a416d90688d0d554479c59a1142b3023bf","observation_id":"c478bb1e-f250-47ed-a885-f0c332ddbdec","resolution":{"observed_at":"2026-07-09T22:26:37.553040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06987","last_updated":"2026-07-08T04:21:42Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T15:28:39.569645Z","submitted_at":"2026-07-08T04:21:42Z","title":"UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":29,"verified_fuzzy":15},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2607.06987."}