{"as_of":"2026-08-19T04:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bdef8dea365246d5d0002e0fe23c45b02fc39cc0c6793af8c3e668bd471f2252","coverage":[{"denominator":295,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:48:31.213384Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21793/citation-record","integrity":"/paper/2607.21793/integrity","json":"/paper/2607.21793/citation-record.json","paper":"/paper/2607.21793"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30859","snapshot_observed_at":"2026-08-01T06:48:16.678850Z","title":"arXiv preprint arXiv:2605.30859 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:16.678850Z"},"links":{"cited_paper":"/paper/2605.30859","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:9093a7e122582e4572d699f463e890e5008e8a14481f36ed43d57266a1ae5f67","observation_id":"730dca30-1ac0-4e30-ae2b-17eb3ba55269","resolution":{"observed_at":"2026-08-01T06:48:16.678850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:16.733341Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:16.733341Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:545d19103baf93a8d77fa61f96b82593e51c6393ecdbf5c544a17fc8be1ab4a6","observation_id":"2dae9d61-fa00-4fa7-ad58-5d5af9c2354e","resolution":{"observed_at":"2026-08-01T06:48:16.733341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:16.826143Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:16.826143Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:2c5617fbcf2efed721dae01ccdedef052cbc8ce37b5f65a2427c340e5c4a26ff","observation_id":"3071401e-40f4-45d2-a28d-7531fd8fb165","resolution":{"observed_at":"2026-08-01T06:48:16.826143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:16.952557Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:16.952557Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:8cb0dc9b109ca804c2357f2c494c45de2068e26829571a8e25b6b5aa9a674f05","observation_id":"c98d662d-f60e-4985-81e5-0a7a94553563","resolution":{"observed_at":"2026-08-01T06:48:16.952557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:17.095474Z","title":"arXiv preprint arXiv:2509.18521 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:17.095474Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:d1aa6e8bf59253915d26f80925834157f989d071de1b4753514d3634848a382d","observation_id":"a006505f-6d53-4019-8b16-a95198a2106d","resolution":{"observed_at":"2026-08-01T06:48:17.095474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:17.150050Z","title":"Proceedings of the Twentieth European Conference on Computer Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:17.150050Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:a9bad1a4c936cd137642eac3cbcb4c55ac45390a1589e11291bb89671226797f","observation_id":"5df58ff4-7bb4-48ce-af43-85fb27c606db","resolution":{"observed_at":"2026-08-01T06:48:17.150050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-13T17:30:05.303052Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-08-01T06:48:17.223313Z","title":"arXiv preprint arXiv:2506.06122 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:17.223313Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:24e36616207c2e05e220b9688743532f7f42c7ec96067614e8f3fd66258a8b92","observation_id":"8dcd30dd-5f01-4957-979c-a3a7d152910c","resolution":{"observed_at":"2026-08-01T06:48:17.223313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-01T06:48:17.311342Z","title":"arXiv preprint arXiv:2505.24298 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:17.311342Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:e3c167fd3dfed5a39d865cdb5c24bd477f1889626672ff53ea78ee3771bc4258","observation_id":"4cd5dede-04e4-47e8-a00a-115009c85765","resolution":{"observed_at":"2026-08-01T06:48:17.311342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:17.455645Z","title":"arXiv preprint arXiv:2509.21009 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:17.455645Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:ffee547b43ce55c2cd9dc2ee9acd661bff9804972f4d9305a1a3660ac912dc70","observation_id":"ad6a37c0-ab62-44c1-9b77-863eed331d99","resolution":{"observed_at":"2026-08-01T06:48:17.455645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:17.573665Z","title":"arXiv preprint arXiv:2510.11345 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:17.573665Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:0dc9f27787f0e886fc301e0a2a9a1e1d61ebc19ca7e97d01141904b35ee83c19","observation_id":"60ec856e-94c0-4350-bf9f-4bfffd6cd99e","resolution":{"observed_at":"2026-08-01T06:48:17.573665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15930","last_updated":"2025-04-22T14:19:06Z","snapshot_observed_at":"2026-08-16T11:12:24.160783Z","submitted_at":"2025-04-22T14:19:06Z","title":"StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15930","snapshot_observed_at":"2026-08-01T06:48:17.765327Z","title":"arXiv preprint arXiv:2504.15930 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:17.765327Z"},"links":{"cited_paper":"/paper/2504.15930","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:a9104225537918e4f8e725f58ac78e2c67a438b0e2d6e29256af4c6e528f7be2","observation_id":"bc987d12-9c0f-4ba4-b4f1-b067647d1df2","resolution":{"observed_at":"2026-08-01T06:48:17.765327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-13T08:22:12.599337Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-01T06:48:17.927596Z","title":"arXiv preprint arXiv:2507.01663 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:17.927596Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:ebf689560208254e6949861aee7e33cf0e89d4edefaee37a6a460211a650d835","observation_id":"ecca540d-4d77-4e58-825e-2fe83203497b","resolution":{"observed_at":"2026-08-01T06:48:17.927596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18588","last_updated":"2025-08-26T01:42:46Z","snapshot_observed_at":"2026-08-15T22:53:41.767148Z","submitted_at":"2025-08-26T01:42:46Z","title":"History Rhymes: Accelerating LLM Reinforcement Learning with RhymeRL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18588","snapshot_observed_at":"2026-08-01T06:48:18.067189Z","title":"arXiv preprint arXiv:2508.18588 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:18.067189Z"},"links":{"cited_paper":"/paper/2508.18588","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:8b44bdbf6435f5aa3707236b642a98019769f4e5916a489ade9567c712ee5c88","observation_id":"3f176268-ebbb-498f-a953-8ba9718194a7","resolution":{"observed_at":"2026-08-01T06:48:18.067189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:18.186367Z","title":"arXiv preprint arXiv:2510.12633 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:18.186367Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:612d2976d27f1174574107e89ae8d813a208bee395633e0a41f9bc5af01cfbca","observation_id":"2ecf6c05-00e6-4f71-925e-c9666b6c47ba","resolution":{"observed_at":"2026-08-01T06:48:18.186367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T06:48:18.278039Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:18.278039Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:6ab37ac7cd58d4389e4638e90e5d6be9253682e1ed34f5c64c13559f7869c4b9","observation_id":"e2bdb299-5d36-422f-9ada-e8d8f3cbf42f","resolution":{"observed_at":"2026-08-01T06:48:18.278039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-08-16T14:37:33.548231Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-01T06:48:18.387148Z","title":"arXiv preprint arXiv:2507.20534 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:18.387148Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:2a7a61a4eeff81936e60b3c0f973543fe08c996ae4390d387e788903280263da","observation_id":"cc8c3976-a21a-4dce-b251-ff605ce939a4","resolution":{"observed_at":"2026-08-01T06:48:18.387148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-01T06:48:18.460683Z","title":"5: Scaling reinforcement learning with llms , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:18.460683Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:46b7dd9d13323b80cbf7740067d3abaaccfb50b21991924506ac155cb020b926","observation_id":"3069c028-7ba3-41a3-82d7-662d311e9b8f","resolution":{"observed_at":"2026-08-01T06:48:18.460683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:18.589656Z","title":"2025 , author =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:18.589656Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:e2500ba8ce1336f01e2f4ea8f3bd27855fc95206cb7a4a0281fdba92216e69a8","observation_id":"9a823554-4551-44fb-b8b6-a66682107a08","resolution":{"observed_at":"2026-08-01T06:48:18.589656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:18.682757Z","title":"5-thinking: Advancing superb reasoning models with reinforcement learning , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:18.682757Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:e6c9268b026a389d51080ddaf29c80a1835fb4e51520f060bce81336868d28cc","observation_id":"97326a05-8a72-4959-9f8b-b91a05796733","resolution":{"observed_at":"2026-08-01T06:48:18.682757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-01T06:48:18.811803Z","title":"arXiv preprint arXiv:2412.16720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:18.811803Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:d9411f310241b1ed447d20180d02e62358525064dee346aa627df44f9f0667b8","observation_id":"89f6d3aa-e164-49d6-bc60-72ee3c4b8db4","resolution":{"observed_at":"2026-08-01T06:48:18.811803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:18.894432Z","title":"2025 , author =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:18.894432Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:ee2ffd7a83ba6e1092107b0327294cf39a31b74f016d0d785e6faee2f464b975","observation_id":"ebca9c4d-3346-425c-977b-5075038ec0c4","resolution":{"observed_at":"2026-08-01T06:48:18.894432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:19.060983Z","title":"2025 , author =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:19.060983Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:011a1c1780b682e7faff335398a9c004c3aa0007cb40cfc19f6228de233c5d26","observation_id":"6893356d-40d9-4c82-b43b-a8e7514d04a3","resolution":{"observed_at":"2026-08-01T06:48:19.060983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:19.192118Z","title":"2025 , author =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:19.192118Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:33e9a0cecdfcc3c4d7245419f8758f8f4599797fac3563f9b84041d7a06a412b","observation_id":"6468e8b6-a33d-496d-b2cf-5a9cd94cb397","resolution":{"observed_at":"2026-08-01T06:48:19.192118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:19.346898Z","title":"2025 , author =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:19.346898Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:e682adbecb4fd7d166a1d873730543d257c67b22f6b162226ca24feb522820fc","observation_id":"fef6798f-043f-46dd-a766-2c883a648f71","resolution":{"observed_at":"2026-08-01T06:48:19.346898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:19.520246Z","title":"2025 , author =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:19.520246Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:b1398f34c8ed6c0fd411a4955cf673d2494a7465e142fc2d04500fb706c37021","observation_id":"9d10e571-88bf-46ba-8bc6-9843a60311c8","resolution":{"observed_at":"2026-08-01T06:48:19.520246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T06:48:19.652409Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:19.652409Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:684341b03f763d3cf364f0b96427841c4a0636040694070a411f07ffdf1e8aad","observation_id":"f009fecf-ce6b-44c1-8297-2464b743c73e","resolution":{"observed_at":"2026-08-01T06:48:19.652409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-17T18:51:13.219936Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-01T06:48:19.850653Z","title":"5-math technical report: Toward mathematical expert model via self-improvement , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:19.850653Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:d07bf7766ef9c9617ea6458fc8cd9c3a1b948c96a15b689f341f77ad1bf4daa2","observation_id":"05c132e5-9a79-4f71-9ae7-ffe57a3f4bf5","resolution":{"observed_at":"2026-08-01T06:48:19.850653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:19.986483Z","title":", howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:19.986483Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:b8a276bdb76a008f7dc501096f0253c15118a80e45b7b1bc89e31c0f5cd3deff","observation_id":"a84f644d-1d01-4c94-b618-fc75e3aaa21d","resolution":{"observed_at":"2026-08-01T06:48:19.986483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T06:48:20.108214Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:20.108214Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:448a569351192d3482c8f6be005d624a14372ba330a1f33ffe04f01348d92ac7","observation_id":"39cea982-f41a-4213-bd56-5292db9e36b6","resolution":{"observed_at":"2026-08-01T06:48:20.108214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T06:48:20.278182Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:20.278182Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:c8abad267e7f03ad5da418b5c6ca76f76cc89687c6c891554779a95f803fac35","observation_id":"d14ca402-6671-4899-9e44-88c6f5bb392e","resolution":{"observed_at":"2026-08-01T06:48:20.278182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-01T06:48:20.440300Z","title":"arXiv preprint arXiv:2503.14476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:20.440300Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:9b2f21cdb0ee222487f3090130c4c8aaee7d3cfc72f9a185397ebf7e3585fe9a","observation_id":"3c9f35f7-8376-4959-b82a-baba6ba5c515","resolution":{"observed_at":"2026-08-01T06:48:20.440300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:20.565573Z","title":"Notion Blog , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:20.565573Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:cc1f281feb5cdef1b8f41fb3fde77c4720f18b18526881d62e8e7c060d17a23c","observation_id":"53419a6a-e742-48f6-add0-5e7a470e019c","resolution":{"observed_at":"2026-08-01T06:48:20.565573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-01T06:48:20.696913Z","title":"arXiv preprint arXiv:2504.11536 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:20.696913Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:e70a036e605cb72d0621b50d28bee8a86973ad835880853089ff5317a4674009","observation_id":"bdfbd23b-38b7-44c2-bf9c-99ff829ae9c6","resolution":{"observed_at":"2026-08-01T06:48:20.696913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11432-021-3536-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Science China Information Sciences","work_id":"53caae54-cdb9-4de2-8fa1-2fcb460bd1bd","year":2024},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:20.793420Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:ccae71221ce8bfc205b3da343767494a8bf94b07ad22be6a4c1bdecf5c712c10","observation_id":"946b68e5-08df-4dbd-a21b-737f24eceb68","resolution":{"observed_at":"2026-08-01T06:53:45.059650Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:20.928710Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:20.928710Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:3f421713d94ee7a139bffd0272cfd251700cd50136a2253045e6920293ed8a65","observation_id":"8aebadd1-4328-4c92-8dc7-dcb14391ffa6","resolution":{"observed_at":"2026-08-01T06:48:20.928710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:21.055312Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:21.055312Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:b096d2ad6498e02d18d9220765378d6be8364adb4aa05e4ed438bc5d1c6ec062","observation_id":"5213734d-b2cb-4a2a-ae08-32685fefd028","resolution":{"observed_at":"2026-08-01T06:48:21.055312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:21.189664Z","title":"Data Sci","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:21.189664Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:4f5cc0301c8fd2e40213e41253ce21dba8d063a8a8c2399c1ec7a675724c6153","observation_id":"8d0665fe-1f71-42fc-ae9a-91433af58654","resolution":{"observed_at":"2026-08-01T06:48:21.189664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11390-024-4178-1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024 , issn =","venue":"Journal of Computer Science and Technology","work_id":"8c10c7de-8998-4a4b-9bd8-fb01e6d1cf78","year":2024},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:21.374831Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:0dea8b792bd63378679d0edec0dd9139ef6f009f6439204e652b2f1025d2dcd3","observation_id":"2aa8d52d-edf6-46de-b007-6086a482d32d","resolution":{"observed_at":"2026-08-01T06:53:45.039697Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11390-024-3872-3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advances of Pipeline Model Parallelism for Deep Learning Training: An Overview , journal =","venue":"Journal of Computer Science and Technology","work_id":"51ece937-0bdb-4c4c-9e0d-43462224c055","year":2024},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:21.525119Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:0af13009d04fe95dde136c0b0124fedfbe768d9c02b5996c2866b2fa988cccdb","observation_id":"8428b6db-1160-4059-9dc2-2e239a58650f","resolution":{"observed_at":"2026-08-01T06:53:45.027440Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:21.639547Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:21.639547Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:77afed3efdb7dea0d99f4ff00faeb5f428600e50e9d5442db11f00423ba53d07","observation_id":"cf32b25b-7e98-4067-9363-541be3aa67fe","resolution":{"observed_at":"2026-08-01T06:48:21.639547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:21.807410Z","title":"Big Bird: Transformers for Longer Sequences , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:21.807410Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:842b4a9d35d5d90f1cf28e24945d0deba70ae472d0448a86672892a77fd91b66","observation_id":"972c8d87-f9e4-4004-b7c2-d27ddf053f33","resolution":{"observed_at":"2026-08-01T06:48:21.807410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-14T19:59:05.307983Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-01T06:48:22.009226Z","title":"arXiv preprint arXiv:2309.10305 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:22.009226Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:c7c800f855f9c407ca7b8661f0e8ea5a3df68acbe8e1b04e9f18b198275f9e70","observation_id":"73ae6671-9688-4ef3-8473-eb002fdbbf01","resolution":{"observed_at":"2026-08-01T06:48:22.009226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-01T06:48:22.134379Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:22.134379Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:dc072d407ff2f534346dd221e3e02329d076aa88eaedb7f2f8de0cab21736ae4","observation_id":"fa685c76-f8fb-4ad9-ace7-2c8fcb2be258","resolution":{"observed_at":"2026-08-01T06:48:22.134379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:22.456520Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:22.456520Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:ce112441bf0b5de9f4ecbddd5def9a1f07ff55d4e8680d5beedb5f2cabc63d73","observation_id":"aa52407b-62a8-4b85-8a4f-74b747b76e3a","resolution":{"observed_at":"2026-08-01T06:48:22.456520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:22.817150Z","title":"Proceedings of the 2022 International Conference on Management of Data , pages =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:22.817150Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:16323d0f3446b614d1ee25ac8641d39d0815e3f595326972aa88c6abeb768b34","observation_id":"8cc9a333-5718-4ff1-aef4-591522e358cc","resolution":{"observed_at":"2026-08-01T06:48:22.817150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:22.999024Z","title":"Proceedings of the 2021 International Conference on Management of Data , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:22.999024Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:7250b954a8d467c0116e51531a1b5607c2c481b420cefb24b39fb28bd71722ac","observation_id":"af8e665c-bd7c-45ec-a012-2d9155bcac3d","resolution":{"observed_at":"2026-08-01T06:48:22.999024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:23.172019Z","title":"Forty-first International Conference on Machine Learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:23.172019Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:bb95a14ff96ca9fc77c0c91d409220c38eb139253bb3989f88cabdf03afb6f07","observation_id":"ebadc26b-5beb-444c-8020-42e37a0bad1d","resolution":{"observed_at":"2026-08-01T06:48:23.172019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3589310","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the ACM on Management of Data","work_id":"90022ad6-2c53-4e9c-a77a-8dc053c7ff0f","year":2023},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:23.292403Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:9969a2737b40f2d76cac7c5bec51963bb8355ca4c4df568c00437ec3b03b6c4a","observation_id":"34e710bc-2a0a-42b0-8975-2b94628390dc","resolution":{"observed_at":"2026-08-01T06:53:45.015569Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3639323","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the ACM on Management of Data","work_id":"3154152b-68f2-4a58-9801-9be1eddba3d4","year":2024},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:23.476245Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:34f3fd5c3ce191aa992c7d9d6560f8fa4703ca377e066255b29893b7e26f93ad","observation_id":"b3c89438-2031-4ec8-9aed-fbc0aa5e7c0e","resolution":{"observed_at":"2026-08-01T06:53:45.006116Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:23.652852Z","title":"Proceedings of the 2022 International Conference on Management of Data , pages =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:23.652852Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:d2967dcf6d1db4ad6381a84fd9783c3316216c4fab5e5708ec89ad20c85d73c6","observation_id":"46195bd6-c61b-4c76-af21-dc2fffbe4ae5","resolution":{"observed_at":"2026-08-01T06:48:23.652852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3626733","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the ACM on Management of Data","work_id":"eacdfdd4-5254-482e-bd62-4a32ce27e69c","year":2023},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:23.792234Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:50a163d45a45debe86c8089fb8cb389a26326fe7ce91ef52722b62296dd4a8a1","observation_id":"604b023d-6c69-4e93-b42e-06ca0e1ecc98","resolution":{"observed_at":"2026-08-01T06:53:44.995372Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:23.933805Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:23.933805Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:a1e86e6cc268bfa4e3e2e2c0e1774e7832ac6ada7db2272feded9f994e262ae9","observation_id":"e4071d2c-5035-47d2-a93c-92e803e18c4a","resolution":{"observed_at":"2026-08-01T06:48:23.933805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:24.103766Z","title":"2009 , isbn =","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:24.103766Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:ae578d4382364f1c764592727d4d3dacb02e4c62eb3a14c00f1e9ec32c2a71c5","observation_id":"2ce3e0db-ec3d-4dd4-a5c9-bcf591e8e843","resolution":{"observed_at":"2026-08-01T06:48:24.103766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:24.241588Z","title":"Proceedings of the 29th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Volume 2 , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:24.241588Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:70fa7d227ac219b373768c8ee9e820486116be005b706e265fde0b22cd0acbb8","observation_id":"ff7e6146-e46f-4aaf-bd98-d12152445f7f","resolution":{"observed_at":"2026-08-01T06:48:24.241588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:24.387022Z","title":"Proceedings of the Eighteenth European Conference on Computer Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:24.387022Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:ec4c8a1a5ed7fba1d5f24bc2312e1994b401d73771647ab9ba748beac173b492","observation_id":"c3cdc54f-0b07-4a50-8da2-15c8ee6a0860","resolution":{"observed_at":"2026-08-01T06:48:24.387022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:24.510917Z","title":"21st USENIX Symposium on Networked Systems Design and Implementation (NSDI 24) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:24.510917Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:3558cb6b508f95a20d600c7e322f2052c4379a718c4cb32de0e7fa080d83cfe4","observation_id":"3cfa6997-b49a-44ea-9811-125e03e2f02c","resolution":{"observed_at":"2026-08-01T06:48:24.510917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-01T06:48:24.689017Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:24.689017Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:f88b175ec1c0fe6910561abc5ead2d3208ac2f49b6e54d28c8423061d8ff4bf6","observation_id":"44b7b8e9-2396-4869-a7c0-fe7ab5475b37","resolution":{"observed_at":"2026-08-01T06:48:24.689017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:24.788593Z","title":"Gehringer and Daniel P","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:24.788593Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:ea77a06c59ee63fd77c9ae22df70735913e4624942d04473a0caee5af6e89c32","observation_id":"194838b9-db7b-47ec-876a-d76b29b232f5","resolution":{"observed_at":"2026-08-01T06:48:24.788593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:24.974725Z","title":"1992 , isbn =","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:24.974725Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:2671c137ab244815a4794a1b4bacc312d75097196f409027368652fb06cee6a9","observation_id":"adabdd42-3354-486e-82f6-b152a7422f7f","resolution":{"observed_at":"2026-08-01T06:48:24.974725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:25.125782Z","title":"Kovalyov and Maciej Machowiak","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:25.125782Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:6635dbbe55760318721b7a43bcf52a227f63099a9aaaa7a21911f1a0046fd115","observation_id":"8991d225-1c38-4467-9a54-b0e78760e51b","resolution":{"observed_at":"2026-08-01T06:48:25.125782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:25.199734Z","title":"Annals of Operations Research , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:25.199734Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:920f0dcc932ac4ce5a33ed2ab720d50aaf462ec503f4152e18c5692c5105ef5f","observation_id":"71d54759-8ecb-4665-afbb-348a07a13158","resolution":{"observed_at":"2026-08-01T06:48:25.199734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:25.316083Z","title":"Optimization and Control of Dynamic Operational Research Models , pages=","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:25.316083Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:f80e7e10350e9425dae248617cd7a0b86a805b2e9f097c5915cfe669d182b454","observation_id":"4f9dfeb7-667e-4abe-971a-06dd5ceb9796","resolution":{"observed_at":"2026-08-01T06:48:25.316083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1287/mnsc.27.9.1040","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Management Science","work_id":"ea93eacd-6574-4e4e-8f7f-a4b0be019b8c","year":1981},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:25.491619Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:4e139f91b67c574d9d5508c1aa244a248157de60933e5542b481930b6085a37e","observation_id":"55a0ae03-3a2c-46fd-b44b-47b912bc3550","resolution":{"observed_at":"2026-08-01T06:53:44.967511Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:25.671198Z","title":"Gomez and Lukasz Kaiser and Illia Polosukhin , title =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:25.671198Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:03c60af90968392ca1dd4f2d18e350a909dc945b9f1102e656d9eec93a839b2e","observation_id":"7494cd29-ff52-4641-8c41-62244ea16002","resolution":{"observed_at":"2026-08-01T06:48:25.671198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:25.827498Z","title":"wav2vec 2.0:","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:25.827498Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:37746e26722ba4ba4e569c965d17c60ca2cad68134441343b1ab714aaf545ced","observation_id":"9767258a-d542-46f2-9d4b-644b7a7f1537","resolution":{"observed_at":"2026-08-01T06:48:25.827498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:25.998800Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:25.998800Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:92ee5ed7744115cff6dce32e5ed936cd9013235a2733aa4092d3c9c48f31b9eb","observation_id":"db24f521-4b52-4d44-af97-c1c7f884a9ff","resolution":{"observed_at":"2026-08-01T06:48:25.998800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:26.122269Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training , booktitle =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:26.122269Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:417829f30fa7040b04f5899d162c76fb4b66a5154522c3231082f2869bdbf6c8","observation_id":"b0d89cf1-f9e4-4e5b-829b-a7310da19006","resolution":{"observed_at":"2026-08-01T06:48:26.122269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2021-1912","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large-Scale Self- and Semi-Supervised Learning for Speech Translation , booktitle =","venue":null,"work_id":"d0c816d7-20c6-484c-bff1-b2eaa05c9b7f","year":2021},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:26.252524Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:b18b3d5acb6e8b034899f29752a7ec869a72f37fc221e3decbc1197c3c45750d","observation_id":"2b21a471-863f-4e51-8355-b25d958f7726","resolution":{"observed_at":"2026-08-01T06:53:44.957144Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:26.382795Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision , booktitle =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:26.382795Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:d7e8d3bc8a99f5a1468e8acf07bad1d96b7190c5ef2955d6c1c86983c0afd22e","observation_id":"0933a20c-d9d2-4fdd-9edb-2780946baa5c","resolution":{"observed_at":"2026-08-01T06:48:26.382795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:26.511229Z","title":"The Tenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:26.511229Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:144b75378dd12117a55441358abd130d52c7875c5532ec548912d33610adb718","observation_id":"889c2fc9-ad58-4cdd-9b47-9dff8769d8e4","resolution":{"observed_at":"2026-08-01T06:48:26.511229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:26.652841Z","title":"Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:26.652841Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:5086b9f9c603dd9f04eb04e5fd1a5cd9dce2f173b7389ff78398b1ef3a160a54","observation_id":"9e5b5479-cfe7-415d-ae15-0f4966110247","resolution":{"observed_at":"2026-08-01T06:48:26.652841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:26.840288Z","title":"Optimization Methods for Large-Scale Machine Learning , journal =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:26.840288Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:93c76ab273365556226ef08de66bc871c3a24c5d9f6f3605ae8102b29bb33a93","observation_id":"809e6696-f35a-4bce-93e2-8b5b67599f79","resolution":{"observed_at":"2026-08-01T06:48:26.840288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:27.028317Z","title":"ICML , volume =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:27.028317Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:e225d9d8e478aec34648293d5f549bdf45d2cdb70d92bf451ca979241e8f8d2a","observation_id":"1a117779-5100-430d-91eb-497fc1f32260","resolution":{"observed_at":"2026-08-01T06:48:27.028317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:27.178611Z","title":"ICCC , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:27.178611Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:2ffd4aa12acdd88ef7314c84e08fee5f0eb9d595d24aeee1bc71d610aab92fc4","observation_id":"37983ffb-a50b-4e68-8af5-df44feea2556","resolution":{"observed_at":"2026-08-01T06:48:27.178611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:27.375003Z","title":"Mechanical Systems and Signal Processing , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:27.375003Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:cd9272e069e50d7bf5ec9ec77936108047c2d9d344dbf6262da8488174bf635e","observation_id":"855859ae-48c3-4212-a9c9-0a6bc493c26b","resolution":{"observed_at":"2026-08-01T06:48:27.375003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:27.513786Z","title":"NeurIPS , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:27.513786Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:bf6da808738afccc3f489011e11dfe97be6f14680cd9e5049dff8932ff0958bb","observation_id":"d188cc07-0f75-40c3-8092-cf9a02deb696","resolution":{"observed_at":"2026-08-01T06:48:27.513786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:27.714608Z","title":"ICML , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:27.714608Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:40d7103a8e72e98bfb2eeaaad52b3f39a5f43f2abcd14512b81023d8eeae6dad","observation_id":"59e81f45-3b42-43ef-8aca-a71f5b1adc9e","resolution":{"observed_at":"2026-08-01T06:48:27.714608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:27.862289Z","title":"Andersen and Jun Woo Park and Alexander J","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:27.862289Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:1bb4124cc439b92098d6a138e828f4b276b94bcf21aba462df34ffd589a8e7ed","observation_id":"243179c4-64ce-4de4-b319-fcd70e86b21e","resolution":{"observed_at":"2026-08-01T06:48:27.862289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:28.061742Z","title":"Taming unbalanced training workloads in deep learning with partial collective operations , booktitle =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:28.061742Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:893bfdd2e297ff44df01fe6da5d9b57457dc31ea4a7c2430305428d97c9c2530","observation_id":"0753f9a1-5fe5-4b31-b815-4dedc3770ff1","resolution":{"observed_at":"2026-08-01T06:48:28.061742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:28.212237Z","title":"ICLR , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:28.212237Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:118306474bf1fd384b594c847ace793be1ae67bb2d1fa4d9e2f7e271f6110685","observation_id":"9fb47e1d-6851-49b9-9550-9efe17c0c1d8","resolution":{"observed_at":"2026-08-01T06:48:28.212237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:28.382045Z","title":"ImageNet:","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:28.382045Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:cc673f0393cbda84f79ec04733c8d87d04f5d58b405f79843ef9639ed3e8ebab","observation_id":"d657bb5d-061f-4630-884d-48e881f4c224","resolution":{"observed_at":"2026-08-01T06:48:28.382045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:28.464126Z","title":"Demystifying Parallel and Distributed Deep Learning: An In-depth Concurrency Analysis , journal =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:28.464126Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:81e931e863b8317e1fadad3abdf1a3fe6c2b41d2b16b394d5af1339b8086557b","observation_id":"482c5b41-2c73-485f-a4e4-370b1e3b4761","resolution":{"observed_at":"2026-08-01T06:48:28.464126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:28.655173Z","title":"NAACL-HLT , pages =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:28.655173Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:5dc5cbd91959b8388137628e694d7befee234f1d268dc779efb1028c05cd4032","observation_id":"de7604b1-df12-47d0-9061-586cac9673cd","resolution":{"observed_at":"2026-08-01T06:48:28.655173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:28.811138Z","title":"SIGMOD , pages =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:28.811138Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:53a06d3eab970cbe2fa30744b5220ddb3fe7fb16b45d3b91858148d219fc92d9","observation_id":"9f6246a3-f105-4ea9-aa20-18531db9e8b3","resolution":{"observed_at":"2026-08-01T06:48:28.811138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:28.999778Z","title":"SIGMOD , pages =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:28.999778Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:83845f6295190599c524d5154c4242aefe49dba74486db11c505a0a78402410e","observation_id":"9501a609-af27-431c-9d9c-bdd019d77f22","resolution":{"observed_at":"2026-08-01T06:48:28.999778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:29.135349Z","title":"DimmWitted:","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:29.135349Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:18226adb68c286cef381c769d79daba545c9e575933cb811b3061593fcb985fa","observation_id":"f86578c3-52a9-4c71-a1ec-c90f34d6a292","resolution":{"observed_at":"2026-08-01T06:48:29.135349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:29.280545Z","title":"SIGMOD , pages =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:29.280545Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:2d30c84aff258af995c32a16343de148646c1cc10e58f559a46557107c6a833f","observation_id":"075f639d-7e21-42b1-9309-331f440e8f30","resolution":{"observed_at":"2026-08-01T06:48:29.280545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:29.417956Z","title":"TensorFlow:","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:29.417956Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:e64c671c466d3fe3d51daabc991fa06a3e7276784e05d9d209089c1d4689be51","observation_id":"cf75ecd1-e47a-47db-ae12-c9562b25199b","resolution":{"observed_at":"2026-08-01T06:48:29.417956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:29.586098Z","title":"SIGMOD , pages =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:29.586098Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:a7ce7332c468fb019968f7c2b6cbcd2e1dd858408730a34e8fc56359369da4d0","observation_id":"f117424c-8f3d-4fed-a377-9e0dc843f0b7","resolution":{"observed_at":"2026-08-01T06:48:29.586098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:29.750868Z","title":"Gibbons and Garth A","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:29.750868Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:97559e4b305398ad63654860e8bcb3e97663060b857bdcda58261c1f35c8b212","observation_id":"f5f24593-9dc5-426f-bdfc-206e7906f3d5","resolution":{"observed_at":"2026-08-01T06:48:29.750868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:29.881896Z","title":"Ganger and Phillip B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:29.881896Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:3b82255c286bb4c160019920d9aeb700da749c866ada000e0f661938639b9356","observation_id":"22ec1fe5-53a2-457b-8ec1-bc234f38b606","resolution":{"observed_at":"2026-08-01T06:48:29.881896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:30.052849Z","title":"Brewer and John Wilkes , title =","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:30.052849Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:231f5186aa0324597e374d8a9333e2b305bfa98ea0899ad5409890dafc7548c1","observation_id":"c5595b54-dc8c-4e34-a563-ea432d492613","resolution":{"observed_at":"2026-08-01T06:48:30.052849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:30.154090Z","title":"OSDI , pages =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:30.154090Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:2e29c1aaf7bedd3fdbb25e65b53c544c3483b6b8c5882e65cd25a7a7017d622b","observation_id":"7dc3e747-8c97-4ac5-bb07-e03a6e26d475","resolution":{"observed_at":"2026-08-01T06:48:30.154090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:30.211586Z","title":"NeurIPS , pages =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:30.211586Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:3f5f967729438fefcb099c72ca13a940c4f28552b2b6c803732997dd7f7d43ce","observation_id":"83824867-0535-4fd7-9770-41b2e3dbf70e","resolution":{"observed_at":"2026-08-01T06:48:30.211586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:30.349214Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:30.349214Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:5c242a6e212b19977d782bef172a32221cae73b8409776153c4defab65632811","observation_id":"51fe7cbf-fef2-42cc-a0df-09c260ce33d4","resolution":{"observed_at":"2026-08-01T06:48:30.349214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:30.508705Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:30.508705Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:eaa9ea393dd727838e1fa6633e015536966e0e19842c4250354c923e954b53c9","observation_id":"c11d2c1b-1629-4eb8-a08d-5808c242e80c","resolution":{"observed_at":"2026-08-01T06:48:30.508705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:30.672121Z","title":"Parallax: Sparsity-aware Data Parallel Training of Deep Neural Networks , booktitle =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:30.672121Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:52f405025330c76898c1c4a59553811aae3480327cbcf8840f75cca0bc4eb0d0","observation_id":"2853d193-fbd4-42d6-b1b6-340539ec93e8","resolution":{"observed_at":"2026-08-01T06:48:30.672121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:30.847372Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:30.847372Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:08b9445d02883df2bb45612b4a3225d914520ac888a9c8ee4abb806792242cb8","observation_id":"787d79dc-7118-4c7d-bae6-a986d90e989c","resolution":{"observed_at":"2026-08-01T06:48:30.847372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:30.967573Z","title":"CVPR , pages =","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:30.967573Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:ec9e06f9d2156babdfe0d46594f31932bd94a751f748259ff4b283bfa5b62f73","observation_id":"6354e144-ba4f-445e-a293-f76a8b106cda","resolution":{"observed_at":"2026-08-01T06:48:30.967573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:48:31.213384Z","title":"Weinberger , title =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:31.213384Z"},"links":{"citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:490b84c8ce21e36e6e87d89b109f37da9110d12b1af4288e40092a371ea20c8c","observation_id":"dbfdc495-44cc-4719-8533-fd1acd75edb5","resolution":{"observed_at":"2026-08-01T06:48:31.213384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":92,"verified_exact":8,"verified_fuzzy":0},"total_outbound_references":295},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 295 outbound references and 0 inbound Pith citation observations for arXiv:2607.21793."}