{"as_of":"2026-08-09T18:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9abacad04643f32010b330ab35d6ca28566591a27fa510fb044587b801e94083","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:39:11.464437Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14614/citation-record","integrity":"/paper/2607.14614/integrity","json":"/paper/2607.14614/citation-record.json","paper":"/paper/2607.14614"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:03.111981Z","title":"R., Geist, M., and Bachem, O","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:03.111981Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:85b4c94d8e6a8f44e1dfe9bb47b17ae1c932eec8b8c114049f3b6a494d7ae764","observation_id":"0689e7eb-20f2-4117-8bdf-3be15eeebe3d","resolution":{"observed_at":"2026-08-02T01:39:03.111981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-08-08T21:58:35.154185Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15134","snapshot_observed_at":"2026-08-02T01:39:03.261379Z","title":"The unreasonable effectiveness of entropy minimization in llm reasoning.arXiv preprint arXiv:2505.15134, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:03.261379Z"},"links":{"cited_paper":"/paper/2505.15134","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:84793768cf364fa66368ebc599eb2d9cb571753a4e635b3d4a226cae81f57831","observation_id":"c3e5efa7-533b-43f0-b14f-cbe4f735064e","resolution":{"observed_at":"2026-08-02T01:39:03.261379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:03.367580Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:03.367580Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:95c920d79bf4e9e3d52b5e0c071a0e799149ff182f8c0886d7e58d0d39590e8f","observation_id":"703dcbbb-8474-4336-9b52-e30328945863","resolution":{"observed_at":"2026-08-02T01:39:03.367580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-02T01:39:03.528882Z","title":"X., Zhang, Z., and Wei, F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:03.528882Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:8e1e85ab940d20dae941cc0465ff2409c3b1d939a1e1e2a114df9255e4d8c9ed","observation_id":"61b93e40-3d7f-4cdf-9e2a-120b63a30cdc","resolution":{"observed_at":"2026-08-02T01:39:03.528882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:03.651251Z","title":"K., Chen, G., Xu, W., Luu, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:03.651251Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:03cc7508d2bca2cef2906e60daf68dfdbaeeca4d4da2a74e971be71759011e1e","observation_id":"e9dea355-746b-4272-b43b-a642bb4cdfdb","resolution":{"observed_at":"2026-08-02T01:39:03.651251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02260","last_updated":"2025-08-04T10:08:10Z","snapshot_observed_at":"2026-08-06T05:04:32.009541Z","submitted_at":"2025-08-04T10:08:10Z","title":"Decomposing the Entropy-Performance Exchange: The Missing Keys to Unlocking Effective Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02260","snapshot_observed_at":"2026-08-02T01:39:04.050935Z","title":"X., and Wen, J.-R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:04.050935Z"},"links":{"cited_paper":"/paper/2508.02260","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:322961c2d24634e1b2342bcf0c6b4fae284646ecab6770a546ce95c8d9161ece","observation_id":"b230e182-72c6-4661-8c47-925519a34555","resolution":{"observed_at":"2026-08-02T01:39:04.050935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:04.256223Z","title":"Deepseek-r1: incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081): 633–638, September 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:04.256223Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:96fd0d21e354f8159194044b7334bf0bee9d2aed2af629e67d0fc93cc80780cd","observation_id":"20fe05de-a943-431b-a89d-ac5d7396223a","resolution":{"observed_at":"2026-08-02T01:39:04.256223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:04.800750Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:04.800750Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:e2bc82a3804ae7e57b258c7f5836dc880d8503d7f902f71d4b718278e03805a6","observation_id":"f0e898bf-91bf-4164-b613-9c1939a72c09","resolution":{"observed_at":"2026-08-02T01:39:04.800750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-02T01:39:04.961710Z","title":"K., Guestrin, C., et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:04.961710Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:0c86781aa80fd7ce252a98735f4d6400bc09c9abc28313397a4c44c4c3255a40","observation_id":"65be8710-17e3-4c27-89cc-916385f00bef","resolution":{"observed_at":"2026-08-02T01:39:04.961710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:05.080907Z","title":"F., and Joty, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:05.080907Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:34214b8842964d77bee585e22674a09741fc869810df28ca6ca49b609f13e734","observation_id":"fed4f4cb-834b-4735-97b1-c9820b7609d1","resolution":{"observed_at":"2026-08-02T01:39:05.080907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:05.211229Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:05.211229Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:de410ccad4a29d7db4ce892d68e1549cfe409559637c655fd6e6721ae46b41b4","observation_id":"fdd53a9a-c87d-4837-9844-6cd8ab6e4b68","resolution":{"observed_at":"2026-08-02T01:39:05.211229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:05.336708Z","title":"V ., Jeon, M., Vu, K., Lai, V ., and Yang, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:05.336708Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:ccd2e2eb1fe91408646bc4433a35a110baa25e8d4c0094cabc70654821c8db5a","observation_id":"fceea892-3f7f-4d84-bd97-d024ff84b8f4","resolution":{"observed_at":"2026-08-02T01:39:05.336708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18391","last_updated":"2025-07-24T13:14:25Z","snapshot_observed_at":"2026-08-06T14:31:30.450672Z","submitted_at":"2025-07-24T13:14:25Z","title":"Revisiting LLM Reasoning via Information Bottleneck","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18391","snapshot_observed_at":"2026-08-02T01:39:05.465608Z","title":"Revisiting llm reasoning via information bottleneck","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:05.465608Z"},"links":{"cited_paper":"/paper/2507.18391","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:bdf067eb4d1434915c3467b973f9bf8a86c81fba6a2462ae03fcae216edb823a","observation_id":"2d47ed9d-be70-458f-ac3e-f1b4e783acb8","resolution":{"observed_at":"2026-08-02T01:39:05.465608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:05.597752Z","title":"RED: Unleashing token-level rewards from holistic feedback via reward redistribution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:05.597752Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:019c1475059771735a578f65a1a45b2700e92e6c2f15df0d8feed1927513f4a9","observation_id":"a2ef72b9-6fad-4cf5-bc2f-4e97442b67c9","resolution":{"observed_at":"2026-08-02T01:39:05.597752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:05.743422Z","title":"Can we further elicit reasoning in LLMs? critic-guided planning with retrieval-augmentation for solving challenging tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:05.743422Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:57d4c061f2765e4ead888b041bbed82c829cc0483a08b864e3feb2bb1f30e76c","observation_id":"80a54d28-261d-4a24-9277-f7be0d804108","resolution":{"observed_at":"2026-08-02T01:39:05.743422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:05.881210Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:05.881210Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:1511777c5cda25aee83fd74fa0d7b7ff8ef74709f3f72ba75c564f93b1c91427","observation_id":"71afbd51-17a8-4d77-a281-67b2a3efd58b","resolution":{"observed_at":"2026-08-02T01:39:05.881210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:06.013709Z","title":"Ravr: Reference-answer-guided variational reasoning for large language models.arXiv preprint arXiv:2510.25206, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:06.013709Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:e33ce5af25b0eb79ec57050ffe6594e2c7551590b4a52eeba884d240d020583d","observation_id":"29d4ae00-9413-4c24-a698-8104a05dbb6b","resolution":{"observed_at":"2026-08-02T01:39:06.013709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:06.145093Z","title":"and Lab, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:06.145093Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:e65af4ed28605e879ca7fddb2f763933248babbf162659f93fb63209a970d692","observation_id":"4aadada7-4f06-40c2-ae7f-1c52211b643a","resolution":{"observed_at":"2026-08-02T01:39:06.145093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:06.341996Z","title":"American mathematics competitions (AMC), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:06.341996Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:f8165e5854cac3e7b6d53c1be45ad48f6d128132bd2be8d4e369b41993f3fb1a","observation_id":"25553960-5153-441d-a7f7-d972e5747e04","resolution":{"observed_at":"2026-08-02T01:39:06.341996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:06.502677Z","title":"American invitational mathematics examination (AIME),","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:06.502677Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:f0a5098f0a4f9638ff3cb952b3849f04548ac9dd8ebd6e0014223a81cb62174a","observation_id":"378c8d48-05fa-42ab-89c3-d7fbe08828c7","resolution":{"observed_at":"2026-08-02T01:39:06.502677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:06.860327Z","title":"L., Stickland, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:06.860327Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:927337f106c138bd16a110ac441124b7bd149f537d289c0668c1d7f7dab83797","observation_id":"da0d60d1-89d8-4da0-8fe0-adffee18193d","resolution":{"observed_at":"2026-08-02T01:39:06.860327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T01:39:07.049351Z","title":"Proximal policy optimiza- tion algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:07.049351Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:cc185e5a24f9ef659fa0bd4c86e0c243f26dff5c909da9464ce7ec1e9262cacf","observation_id":"0cf673c1-2b74-44d7-a479-ee9a0a320d1f","resolution":{"observed_at":"2026-08-02T01:39:07.049351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:06.661112Z","title":"Accessed: 2025-12-23","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:06.661112Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:a8f97d45def1fcf62084922d4ff668ce080fc69d7cd6f55799b8c3174a608520","observation_id":"40e7aa23-9973-41a1-bbe8-68ba3ebc29eb","resolution":{"observed_at":"2026-08-02T01:39:06.661112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:07.405827Z","title":"On entropy control in llm-rl algorithms.arXiv preprint arXiv:2509.03493, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:07.405827Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:a6c01a5440d29bf8cbe182b9d6dc85b7cca635ebdfc7ab671a0387c107e00e7d","observation_id":"61dfcddc-5072-4349-ab74-4c0092e78eca","resolution":{"observed_at":"2026-08-02T01:39:07.405827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-01-27T18:59:08Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-02T01:39:07.574318Z","title":"Self-distillation enables continual learning.arXiv preprint arXiv:2601.19897, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:07.574318Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:08d0b98ce5435a3b1e2ac4588eb025af4ac63af1e5a3a74cc468ce93769d14ce","observation_id":"1f33537c-e256-496a-9950-69b95093438c","resolution":{"observed_at":"2026-08-02T01:39:07.574318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T01:39:07.238935Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:07.238935Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:23cb687c90746f483e0c2a703f2b59fa9599d73551a9d00a6f394f4eae6052a0","observation_id":"e94f6c29-ce3c-4863-a626-f99a505f94d6","resolution":{"observed_at":"2026-08-02T01:39:07.238935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-02T01:39:07.864772Z","title":"Kimi k2: Open agentic intelligence.arXiv preprint arXiv:2507.20534, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:07.864772Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:7f0e0254eb62cc8adc13db4f2c1fb247cade4b4dac1107d14e421a7b9f0354da","observation_id":"b1bec4d7-fd43-4282-aa3e-8760191cd133","resolution":{"observed_at":"2026-08-02T01:39:07.864772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-02T01:39:08.003116Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:08.003116Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:4af172ff2e65563ecb29959a7c212bd789de0e2a0b32af5776b12169fcd379a2","observation_id":"87738a82-72e2-41dc-bae3-09dd7cd67609","resolution":{"observed_at":"2026-08-02T01:39:08.003116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:07.745985Z","title":"Espo: Entropy importance sampling policy optimization.arXiv preprint arXiv:2512.00499, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:07.745985Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:37095796bcdec52acf354f5dbf3924c1d84a6921f00a10521cfbe0ac1053aad3","observation_id":"ce0c3b6b-14d8-4b8e-9bbf-26743f2329ba","resolution":{"observed_at":"2026-08-02T01:39:07.745985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08141","last_updated":"2026-05-18T14:17:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-09T12:24:08Z","title":"SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08141","snapshot_observed_at":"2026-08-02T01:39:08.323586Z","title":"Arbitrary entropy policy optimization: Entropy is controllable in reinforcement fine-tuning.arXiv preprint arXiv:2510.08141, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:08.323586Z"},"links":{"cited_paper":"/paper/2510.08141","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:6b67764e12c292ce5987b788e06efbb4a9025f4e0d67bf4c187a29dc229f0516","observation_id":"9f56af7d-adc5-4061-ac52-35a00dfab8da","resolution":{"observed_at":"2026-08-02T01:39:08.323586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-08T10:27:53.369430Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-08-02T01:39:08.449103Z","title":"Harnessing uncertainty: Entropy-modulated policy gradients for long-horizon llm agents.arXiv preprint arXiv:2509.09265, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:08.449103Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:2141a83ecda77032c5a26aa02f3cdd6b0dac691bdd0b5fb74dad61471c11b336","observation_id":"ff2c5ad0-5fd8-464e-8202-baa1d11ad2fd","resolution":{"observed_at":"2026-08-02T01:39:08.449103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:08.192396Z","title":"and Karkhanis, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:08.192396Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:ce538a49805e7c9bb348bba99d865e98214b630b1c9356c0188d830effb662e2","observation_id":"73026038-d1e2-4d6c-926f-ef4f97237b75","resolution":{"observed_at":"2026-08-02T01:39:08.192396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:08.714342Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for LLM reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:08.714342Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:60828b2c0b3650c4b127625c0597da5a4d85fad9b382a2c626921bf1621b657f","observation_id":"c18f4ab1-a996-42ca-be58-bfbab0daff46","resolution":{"observed_at":"2026-08-02T01:39:08.714342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:08.906301Z","title":"MMLU-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:08.906301Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:b42b32c2049688657e2f1889a987ef0649687489b0fb4bd7d31b4d85a9be56ba","observation_id":"83fa065d-7d82-4a64-9b34-c917ca434a1c","resolution":{"observed_at":"2026-08-02T01:39:08.906301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:08.605142Z","title":"Math-shepherd: Verify and reinforce LLMs step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:08.605142Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:12affc1d0029ed899680babeb07bde345e419b70e49d23140b74a0d1bd0a89d9","observation_id":"8f2f0074-1d9b-49d1-84ec-92c6fd15cd36","resolution":{"observed_at":"2026-08-02T01:39:08.605142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:09.162940Z","title":null,"venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:09.162940Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:2b5a617608d01d43528e32804c8de95a0ab28dac4a4251f61f55a2cddc4d85f4","observation_id":"ddb3deaa-f872-47f7-b5f4-6ecc6f2c91f6","resolution":{"observed_at":"2026-08-02T01:39:09.162940Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:09.291533Z","title":"Quantile advantage estimation for entropy-safe reasoning.arXiv preprint arXiv:2509.22611, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:09.291533Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:ffb2d2c7fdc5c266c4526997b302cdc9579b2418477198f70ccb6d5a250b8ce1","observation_id":"52a76309-0236-4747-90da-a17746c21878","resolution":{"observed_at":"2026-08-02T01:39:09.291533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.10165","last_updated":"2026-05-11T10:03:41Z","snapshot_observed_at":"2026-07-06T22:48:35.345421Z","submitted_at":"2026-03-10T18:59:01Z","title":"OpenClaw-RL: Train Any Agent Simply by Talking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.10165","snapshot_observed_at":"2026-08-02T01:39:09.040248Z","title":"Openclaw-rl: Train any agent simply by talking.arXiv preprint arXiv:2603.10165, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:09.040248Z"},"links":{"cited_paper":"/paper/2603.10165","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:30dfc1ee73fb0cf524da96dbec41a665b30d4726a18c3c5c335127e8484cfb08","observation_id":"43079864-152a-4fda-b2cd-4706f00e4322","resolution":{"observed_at":"2026-08-02T01:39:09.040248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:09.686011Z","title":"Reasons to reject? aligning language models with judgments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:09.686011Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:d95c6ad9035ac1579182767369b54cd216289ec1651335bb98a04fae76aa8190","observation_id":"cf97f670-e25a-4dfc-bc18-fbb7f0b853f9","resolution":{"observed_at":"2026-08-02T01:39:09.686011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-02T01:39:09.838682Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:09.838682Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:5b4970d34dd65bc85f7be87ed19b03410e90c2682b44205b053950cedc1a13b1","observation_id":"804dc322-12c0-41bd-b001-027a18c64b29","resolution":{"observed_at":"2026-08-02T01:39:09.838682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:09.482306Z","title":"A., Osten- dorf, M., and Hajishirzi, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:09.482306Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:7cbfbb66dacba2d0b2084bb417daf601b3015e7c3605456f31d69ccfdd3cf5c5","observation_id":"5017778e-003b-4130-a602-849d58ae4ddc","resolution":{"observed_at":"2026-08-02T01:39:09.482306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:10.134964Z","title":"Self-distillation bridges distribution gap in language model fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:10.134964Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:7a03caea7834190d293ec191089f736159ece5579cb64eb77403117300e1561d","observation_id":"30e4be79-6d98-45a4-b9e9-669e3bc40d89","resolution":{"observed_at":"2026-08-02T01:39:10.134964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:10.331443Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:10.331443Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:73f03517285625ee3a1a17c979f8503b8d6888fb2603f3c00003ddbd534ee97f","observation_id":"d0a49c8e-a0dc-4b59-b561-71e72d61c698","resolution":{"observed_at":"2026-08-02T01:39:10.331443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T01:39:09.987173Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:09.987173Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:76ec2f1358052108d14dc085d50a40ebe683ff412db2da3c8eb3932ae8eee955","observation_id":"6c38c0ee-0f90-401d-af90-170dc0ea9620","resolution":{"observed_at":"2026-08-02T01:39:09.987173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:10.461306Z","title":"Does reinforcement learning really incentivize reasoning capacity in LLMs beyond the base model? InThe Thirty-ninth Annual Conference on Neural Information Processing Systems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:10.461306Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:043e45359b7194aeceac6faf45c7d972b6e7decddef625dc9609acab62ddc72c","observation_id":"bbdfea30-7b90-42f2-9959-1aa0c07b2398","resolution":{"observed_at":"2026-08-02T01:39:10.461306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06218","last_updated":"2025-05-17T15:48:09Z","snapshot_observed_at":"2026-08-07T17:20:13.063588Z","submitted_at":"2025-03-08T13:40:10Z","title":"SCoRE: Benchmarking Long-Chain Reasoning in Commonsense Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06218","snapshot_observed_at":"2026-08-02T01:39:10.555531Z","title":"Knowlogic: A benchmark for commonsense reasoning via knowledge-driven data synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:10.555531Z"},"links":{"cited_paper":"/paper/2503.06218","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:b71cb5613664d05cc4b16a2098d1dbf87ed16daadcaf255814a53ec73ee31533","observation_id":"c46e2e8f-02b8-4482-9d30-57bcf13ee76d","resolution":{"observed_at":"2026-08-02T01:39:10.555531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:10.410737Z","title":"DAPO: An open-source LLM reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:10.410737Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:0f3b5c009677e7d5d69e11cbfe168b9746394692a02deb44738c938369cd09f8","observation_id":"17252ee0-4e5a-4a37-bc01-6e96b3b77dce","resolution":{"observed_at":"2026-08-02T01:39:10.410737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:10.749976Z","title":"R., Kailkhura, B., Lai, F., Zhao, J., and Chen, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:10.749976Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:626aed3667aee1d9b55b3382efec0dd5a3426b012f28f2cc48cb70ae542055ce","observation_id":"de45ab0f-6525-4a0b-8a4a-4ac946e6c732","resolution":{"observed_at":"2026-08-02T01:39:10.749976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-08-02T01:39:10.853118Z","title":"First return, entropy-eliciting explore.arXiv preprint arXiv:2507.07017, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:10.853118Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:0344e3bcf949682eebba5caaca651c4e417e254d5949a2b593f1221de1930393","observation_id":"8331d4b8-dc11-4eda-b24c-c560ab2b1b34","resolution":{"observed_at":"2026-08-02T01:39:10.853118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-02T01:39:10.657660Z","title":"Group sequence policy optimization.arXiv preprint arXiv:2507.18071, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:10.657660Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:b8b33ef41d5c7c9e88596dde6373918779dd1685a62b3054f724fb57dca0b83c","observation_id":"ee0017c6-1e68-410b-b189-a4cd75cdf2f4","resolution":{"observed_at":"2026-08-02T01:39:10.657660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:10.953149Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:10.953149Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:b7ec55b1666e1f1d326831b77af2433cac6d92056d4877da03d354b8a4dea545","observation_id":"2d65af65-e512-42f9-b615-bd93fd42e247","resolution":{"observed_at":"2026-08-02T01:39:10.953149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:11.054736Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:11.054736Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:f058ccc4baa0f297462f9fa5f517ae225ba3cf2e29aa879c8105af0e71d2492b","observation_id":"4291b401-e973-4b24-aaa0-f65e5ad55dce","resolution":{"observed_at":"2026-08-02T01:39:11.054736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:11.181475Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:11.181475Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:74b765c89aa6e0c7c1fa0856aa1f6fe9b3c66e09508a4f89fa374c3987657793","observation_id":"b3aae2d3-5a8a-4f6a-97a7-4faf062ba1d2","resolution":{"observed_at":"2026-08-02T01:39:11.181475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:11.357786Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:11.357786Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:3ddf0c6b2445e5ff179a7b75bd574eb52a9cb40d97643cf72d7b15186d4d099c","observation_id":"ef22e5eb-c616-46c7-90a0-0193d8386361","resolution":{"observed_at":"2026-08-02T01:39:11.357786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:11.464437Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:11.464437Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:312772a74e38ba3d02783c5069591253663ccc12a1fcf195d33da95a1f9ed8f4","observation_id":"f6baacee-6734-4eb0-a29b-3a115665d2f3","resolution":{"observed_at":"2026-08-02T01:39:11.464437Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:39:03.851537Z","title":"URL https://aclanthology.org/2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:03.851537Z"},"links":{"citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:c73bc8973148995b5f70a0202799dabfb78c485a4dafe51db4f53ab0d4f15e7b","observation_id":"064e667f-ead7-4b58-9de7-827eee6bce35","resolution":{"observed_at":"2026-08-02T01:39:03.851537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10150","last_updated":"2026-04-29T10:02:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T10:17:38Z","title":"Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10150","snapshot_observed_at":"2026-08-02T01:39:04.601106Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:04.601106Z"},"links":{"cited_paper":"/paper/2510.10150","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:ee799d08f2837304037300b9145d238154264fdfac5a1894bfb0ee7ff5753207","observation_id":"4e3e6b8c-43f5-4ad2-a9d5-4ff845c7fd23","resolution":{"observed_at":"2026-08-02T01:39:04.601106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2607.14614."}