{"as_of":"2026-08-07T05:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59e92e0c33016b5beb195d7cbd29213b03681e45bb5811cb2dce856c8df3a9f6","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T04:43:45.592808Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03126/citation-record","integrity":"/paper/2607.03126/integrity","json":"/paper/2607.03126/citation-record.json","paper":"/paper/2607.03126"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:1502.05477 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:8ebf36526d0fb3cf6d6284e9b67e57b6a14b3a8bcbade712625d74156cd3638a","observation_id":"e3052aea-30c8-4319-b6b0-26d7461f2cad","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:b4ca4d40d3d1c10c93d6a7510155d4597a417541bdc88428c93f860a35931761","observation_id":"947c6400-98be-42c0-b218-f585eafd3dcc","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20347","last_updated":"2025-12-01T12:02:46Z","snapshot_observed_at":"2026-08-05T19:35:12.428969Z","submitted_at":"2025-11-25T14:25:19Z","title":"Soft Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20347","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2511.20347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2511.20347","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:1fd8e3edf9972e79913fa905a42efed671c1d453808de59db6fff4700d264c53","observation_id":"737e21f0-dc9a-4a05-8ffb-369bf2b87791","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2506.01939 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:5d3041997e3fd38782a15d3055448a712ec0b8e17ff61aca17d3dff796eea7db","observation_id":"f057cd68-3b1a-49aa-a41b-0ce3ad0c47eb","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15778","last_updated":"2026-05-15T04:36:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-21T16:34:01Z","title":"Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15778","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2507.15778 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2507.15778","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:f740aefbfda1f657e18f52c4d47ba061fa5767141a38cc142c5099a761c1c218","observation_id":"d6b1045a-4fbf-4446-937c-26eb9d5d696f","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:1cbc6b3bd477f821ecf64be1c31ecb32911894272353feb1ae37e89a93945371","observation_id":"f96f6cb7-628f-4332-b8f9-c724631727a4","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:0c61c63de7e85c00ec10f00cc8d0173ae87c2b157ddb6edf49732bc31a9bb028","observation_id":"cebbacb8-3fa8-4211-b1ef-c1ea3ca49bae","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:35249c5e57d542ee0f0c77424fd47618ca6cecc7a5268265bad7df80429c175c","observation_id":"41de0120-ff82-421f-8cb5-7a89f7d4653a","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:cc0d200c10f807d2a49ee499319a4c394c55dfca309c5f1ef90b42830ab724b4","observation_id":"764de9a8-9774-4576-a722-076b72e92254","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2409.12122 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:989657f72caf38a77b907ee206db5411a64de54a00ca38880a5963f3694d5f8d","observation_id":"1e43b077-4e75-4865-9294-ec36dcf53544","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2103.03874 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:8827e9691cf9dfe9e64786d27c0cd618cc18c47129c8395ee5666a33ad261261","observation_id":"de7998a5-366e-478b-842e-3e61672b6024","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2512.00499 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:b7c8468c6df88473855c7d1f0031ff3fb845402869907845af3e9464402b6c6b","observation_id":"b11d8f47-e326-4edd-afa1-2dbc28b1b72d","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2512.02556 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:86c2f89d5bcc7167fe98384959cb107444c235539e359a6724b4931b6cbfa75d","observation_id":"678d2cd0-e4e9-4bd3-8b66-73ad7b8bb7ad","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-05T20:06:13.107818Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2410.01679 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:a53d783cd00f22454e0c46da08f8f83b07d731532e153b45ec7362097280d6b7","observation_id":"4e61ab1e-c568-4a6d-9cbf-62b4391d7674","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:1904.09751 , year=","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:571305d930cfd6dd0eeb85a6a5765babcb62845df94a7ee832d84c57e716e7d8","observation_id":"aab26ffb-5446-4974-920c-0f907189a081","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.03953","last_updated":"2018-03-02T20:20:52Z","snapshot_observed_at":"2026-08-04T06:22:23.897655Z","submitted_at":"2017-11-10T18:29:00Z","title":"Breaking the Softmax Bottleneck: A High-Rank RNN Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.03953","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:1711.03953 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/1711.03953","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:e8c5655e3c3b50b02169d7bf7a7f19867c3c1896f5e68403d8c49f2d9768d17e","observation_id":"7a04e0bd-647d-47c6-9af7-af3ae83c004d","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.00512","last_updated":"2019-09-02T01:51:46Z","snapshot_observed_at":"2026-07-06T08:18:18.838990Z","submitted_at":"2019-09-02T01:51:46Z","title":"How Contextual are Contextualized Word Representations? Comparing the Geometry of BERT, ELMo, and GPT-2 Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.00512","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:1909.00512 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/1909.00512","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:c53bc8e2117792b7688e530783729f6197e757cd2b0ec8a5e193ccee9e311518","observation_id":"e7d16614-bf15-4e42-886f-c89b57f4f571","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2508.03772 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:d461d99b44fbee0dad25b8e85d6cc434bf088b9bc11321cc196f88ce49e29c27","observation_id":"cae054db-03a2-4552-9a83-beed53d4c70f","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:1506.02438 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:82d3a0b15ad7b1edd336f863c91ba9b42a43b4295667c46e6ec15c22bdf2678d","observation_id":"ea6e9c6f-dfb7-43da-a2cf-eb2c5fa6dfeb","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:ff7e18ec7d0a1f50d5fc778b84d1ddec91406ea1926ccc5b2f0657861aaeb1b8","observation_id":"26ffa2b8-ba11-4ddb-abd5-3d29f82196aa","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:ea2fdb180d60c40de93ef1995684ee8fcf1cb4e9ef455d5b1865770cf5ad1e7b","observation_id":"7146b0e1-3ab0-42c0-96df-eb6cbff48f31","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:344141f0135bb2e4a9d9a8df204d512dde3704120fff3298d7595a2f7e90374d","observation_id":"222d8d89-46cd-4e62-9fa2-d7b13393daa0","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:0b678d9b1dc0802acf44ca1ec915d337c10923ab44cdc778832e690ad6441074","observation_id":"07868e43-ee4f-4f92-9cfe-2b9aa976a6ae","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:8569d3b02321e4a380c43bb8cda37ad8de93d0d72931c2c5d86683c82903e988","observation_id":"375c0cfb-aa83-4821-aa2c-029937ed8b36","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:ee6d82dd67b22d6585c10424b36c35614bada482afb68b7aa0dea9ae146a477e","observation_id":"99d00fa8-36ff-4602-8be3-76173c628c09","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:2a80f227395db03c23a200348af3031f7801d4eb280f27e7ac884e14e834740d","observation_id":"b2f9c852-e189-4737-8824-7b68a37fa9f5","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:cc68f8e642cc1734b1d28db4c19ef6ff55f63c70201e9d97da744c6c544fa6ac","observation_id":"73954a07-3f46-4764-963c-33deab1883f8","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"Group Sequence Policy Optimization , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:4123a47525912e99e541e52990697768206ab10f26b7bead3c0cf35321fa7302","observation_id":"5eaea446-5a00-49b0-a45f-397042a2293f","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:b7d5039afc365898320f18f55415ccb6dee1fe0ac9cb4286aebfe8cbd62e15a0","observation_id":"5c453e6e-abde-494a-b0e8-170f02863938","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:7b6baa801db8a0fc28f80ae411898e2b7d2373c523056509e49fe00bdb9dc6b1","observation_id":"9258d580-ada7-4887-8e75-b2204878adcb","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"The Surprising Effectiveness of Negative Reinforcement in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:055d2c922f1c18f7e7c7f6d7d4af16addbdb2ec5a4ad2b59feddb4d8b76b84da","observation_id":"a04275be-bbd1-4ce3-99ac-aff0f9b32438","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:ffbba81e38592b1d3048344efd86e42723cf3a41b4d209c05ffc84662fa1a7a8","observation_id":"cc950ee1-3c0d-4136-b533-2236d70fc596","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:d0a10c34cd475a30d2547363466c828f9cc8508335ac5831eed5c2f88ba8573d","observation_id":"064e3653-0e29-49a9-880a-f40c6fe8a71f","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:7a3c1b3990f91468885c4018ec4a3e5db027ecbfa744dc523936f7b95c014da6","observation_id":"796110b0-12cb-41e3-839e-3c31ec514fda","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:7670fa40d0df48e5cc65e77fc1f7cebe5e084e0251831b88dfd200af3dbec236","observation_id":"b9ca9c34-01f3-4be6-a64f-e4885c206d3c","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:fa5d99110c70bb522788dee8ce5dfeb4b7e8a7cbc793eec411cc6eadc3322ec3","observation_id":"1305588a-aba4-49ea-b803-3ec40888bba9","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:27ff4fd2a544e2b0ae6fdaaa1360e5567f550f81d4a029dd86625b261df7c273","observation_id":"417ffbcc-e5aa-4c92-9003-ab27def07efa","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:6d161e6adef9df0835ecb3299ea3ff30a0f098e7cb2b9411ff15530e21cc342c","observation_id":"19c04beb-8f8e-4581-a21e-e507618b2789","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:fb49eb7465e99c80f801571b1d889e3307b666c62d37b38a64e1581c20ce7d9f","observation_id":"ea38b194-d501-441f-b48b-71ee8b14f0bf","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:ecfb93c1bc38d91d11929ecc9ac95b3b64a80bad878f862fb18a6064a91d5886","observation_id":"bf2e7bb4-0908-46ee-b9fe-3a53bdfab326","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:d4dc98746f62a84f90d611189cfcd7b5040a97d93c3ca21af51c324adb714011","observation_id":"574e847d-d5ca-456a-b8f2-56059625704e","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"EuroSys , pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:47c6f446a5d9522128e40c4dabfa2e2b61f5660967aa40014f56e9c86c086320","observation_id":"9ced3c37-7082-4028-a5e8-ebad0bc14c30","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:932449fab2d174612ee9047c72dcd88ee6ef9ce2fd0a425451f0c22a3d27b222","observation_id":"2e5e5e17-12b9-474e-9725-8ba659ae4d64","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:9ba910b626a3406f5da7d072c11a95c6d50a182203047a369287d6276bcbc4a8","observation_id":"c65049ba-6464-4af6-8cbe-6c186b2279d0","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:8d479f135ff1bfb695797e7b7ea51a27270ba1efad87f263649b2843d2ee9100","observation_id":"03288198-c143-47ca-9a60-de488a8ef9ec","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"NeurIPS Datasets and Benchmarks , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:ed9d2f65fa8fff0d0a5abbdfc4108ddcd8df7578b49d7567f12e37265730f7fb","observation_id":"346455b6-6575-478d-a63b-f52c6a2eb607","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"Bowman , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:29b4cf91241f2929f43b16ed40ef662ef6711f684b32e400a63145bff1d06bac","observation_id":"120ce18e-0019-4ab7-bc26-65718f97dfba","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:1275c33c2f2d8bb575ffa0c4d6ea0703ea3b925a7dbae6a2593fd9db965fc4e2","observation_id":"8a65fa13-ce6f-4355-86ab-11cadc521da3","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2305.18290 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:d798ba93fdfd8fab930413205c4133dfce455a4fe4e9d7915cb11c540977d015","observation_id":"30bd001a-7007-4d6f-a195-3487a0aa98a6","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2107.03374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:a0aeb0c9f32a36b4abf4f160a3b3ec00fbf154e23e89891dc9a83b3898ae3cbc","observation_id":"edf5678b-0755-4282-af06-5fa35cbbfff2","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2303.08774 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:78254a3453fdb0a4231cb3433106aa37f25778475bce14efb1a3942a77633aec","observation_id":"c3be849d-22eb-4fa8-a489-501ae2273f88","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2203.11171 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:9ec219b2b630ead10670b7fb2b90ae8c80817ea3d503c77c8ced1709ed8f443d","observation_id":"34d8eb3a-0c8d-400b-9f9b-d957ecabc9bb","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2403.07691 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:4bb4b79ffd0d2e41df179f302c43227461213a05e187de1396af6d27851d9f07","observation_id":"9d487959-c269-476d-9ddb-ee785076d2d2","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08464","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2406.08464 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2406.08464","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:399822b84677321198c00c15dfa52da512f42d1379b58258951db757bef6fefd","observation_id":"66eea0af-7452-413b-b4a9-020538f53763","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2403.08295 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:917c2792c31958c98e00bbb6601c6be7b8c6413c8768586c76c48d8e122ee474","observation_id":"d16b1e3f-95a5-4bc6-9e19-ded4e05dd677","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2310.06825 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:68832a48eda0d534fc657147ecbeeed38f2b2774992c0178336f910f99642af5","observation_id":"0c51f0fc-7d4b-4740-9e2f-39cd06934ce9","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2404.14219 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:f0792be5a54cc92a1f3e946db6fdcd8d3e23279f2d8158c08553f1feabb7849f","observation_id":"1121d046-ff11-485a-a0de-521e8a4e01ad","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2403.04652 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:c0e7c143636502bd8953213a72d565409dd0cf2b1dcaacb51b8eba9b5328b16f","observation_id":"b5b2c717-996b-4d72-98a6-5ec32397123f","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2308.12950 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:19520643cedc8e18e207d93ce334c40dda2dd3248b3a48c2b63699019b8ba026","observation_id":"4838cbaa-9d4e-44dc-99f8-298070cbdf59","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:8866d9e4d3cf6ac6116aace29aca1656df845877d9552a5d8181dd47e80a723f","observation_id":"bbee1ddd-f728-437b-b356-eaf20d3e6718","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:284a257d8e575c0cdb616f105b59cb58e0b5ec503d87a23a9e51e644ca87b1b7","observation_id":"f8480593-5aca-42d0-b729-89a2d2005206","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:76dd44ca2715dd47d36e563c05b4963282ff7dda054eaf99fb0accc46641b84a","observation_id":"9d4adb8b-5686-4258-94e5-667ad64b4065","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:9254c827e846c33af8c64513ed727620b37a61b0a6ad0d1fb01a06746123c6d9","observation_id":"47741ddd-2dfb-4650-91be-2f6fe70dd2f9","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:02514eb87a0b15d9c95010a9c7aa889f9b0e711d586c29f5e5cc1098fa7e1646","observation_id":"f1460f2a-aeee-4764-90c4-0617bbf30f06","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2110.14168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:23ad0922f97f0469159550244ae10003fda35aa5018c6c30b003af1208c91bd6","observation_id":"71610023-6284-43ba-b148-7a8f9110418d","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:8cae342125b95f76ee8dc722d3e20381ab509e1ed61cc2294f6c1eee8cf9c47c","observation_id":"b63488fb-5771-4dac-9475-d9994d1aaaaf","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-07-06T16:35:07.121479Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2310.12036 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:8730a0a67fec72a8b47b0125e88e1333773538dec138a8b54e79e91b6820a794","observation_id":"a5e8bc7a-5eba-4e50-a3b7-20421d5bdd65","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2402.01306 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:c137a64f3cea1636ced13e53fc043d24a2a52ef1f408c79a8f3720c6c82cf8c2","observation_id":"1847f053-70c2-4582-8f94-d80693041965","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10670","last_updated":"2024-07-15T12:35:00Z","snapshot_observed_at":"2026-07-06T18:46:26.900364Z","submitted_at":"2024-07-15T12:35:00Z","title":"Enhancing Retrieval and Managing Retrieval: A Four-Module Synergy for Improved Quality and Efficiency in RAG Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10670","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2407.10670 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2407.10670","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:dff24de7bf51f293a1c27e1fbb1e975ea5e2234278735eebfe27f08d3830dfa1","observation_id":"cb0a7af7-e5b4-443f-8cb8-ee74261f805f","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2305.20050 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:3ebcceec576d5beb980c031a20ca1c13d218ad28c9460e87cbd7e1d384284e64","observation_id":"acb144af-b2d6-4fe3-b2a2-19e4510fc399","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2512.21625 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:719ab0fb092a33b31ab4e79f82bc4c2fe833c3de77f2b22252a29e1b83942995","observation_id":"ea0cc37f-5245-4527-85db-be47bd744205","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21199","last_updated":"2024-12-31T08:20:42Z","snapshot_observed_at":"2026-08-06T14:11:44.657165Z","submitted_at":"2024-12-30T18:58:58Z","title":"HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21199","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2412.21199 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2412.21199","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:085b425f6339c3aacc48a8a08cd12e8af05f0ee121bfbc78b5ec37c21bce2f6c","observation_id":"9e3c6695-b408-4083-a1cc-6c9803c17d38","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"International Conference on Machine Learning (ICML) , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:84494754df364a344e49b996754d9f9c4ebd637075c39f696ff471df09f41796","observation_id":"05a46d29-782d-4768-adcb-ac5f2e2847ee","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T17:17:56.686166Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":73,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2607.03126."}