{"as_of":"2026-08-07T11:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d72109187f563c6185db3313b3aebd339be92f717b626b3b758d1daebe3cc0b","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:31:49.368412Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:24:20.906356Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13702","snapshot_observed_at":"2026-08-03T14:24:20.906356Z","title":"Value-free policy optimization via reward partitioning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-06T07:38:24.259000Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:20.906356Z"},"links":{"cited_paper":"/paper/2506.13702","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:cfa50e684b550a00d7290103b4bf22fc50615eafe753277ac59cb36ac473ee84","observation_id":"58037a65-8d50-481a-8f54-57238aecf6dd","resolution":{"observed_at":"2026-08-03T14:24:20.906356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13702/citation-record","integrity":"/paper/2506.13702/integrity","json":"/paper/2506.13702/citation-record.json","paper":"/paper/2506.13702"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.817651Z","title":"Rrhf: Rank responses to align language models with human feedback,","venue":null,"work_id":"689d45a3-3e19-4df1-9400-01176e558b34","year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.229111Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:68b4a145099ae5a1375118402f2487dbfb04d84702d27ac444d46f2c4117c838","observation_id":"7d1e438d-cf68-4314-9294-e3aba8e89a37","resolution":{"observed_at":"2026-08-07T00:31:49.821253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-07T08:32:00.916309Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-07T00:31:49.233090Z","title":"Rlhf workflow: From reward modeling to online rlhf,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.233090Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:822d16a99971dcffedc9efe6f542307c5022b41b3a5ca5d7971da3331e125bb0","observation_id":"2be3843c-13a7-4a96-be30-6551e33c15e0","resolution":{"observed_at":"2026-08-07T00:31:49.233090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.807541Z","title":"Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms,","venue":null,"work_id":"c4a797a5-fc61-4a58-89fb-7e0804b1777a","year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.236673Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:1b3338e8fea2fe3a341eaa74e921aee318657b498b3fa59013749ba7399fae38","observation_id":"c6740c56-52c9-4774-bd8a-e41a14d51045","resolution":{"observed_at":"2026-08-07T00:31:49.811145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.241247Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.241247Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:93fbfa196c2a9ed2970b1f0cbf0baceead60569b653064044d307a8a62d11cd0","observation_id":"0364f190-1d28-4505-b39d-323425002d42","resolution":{"observed_at":"2026-08-07T00:31:49.241247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.791719Z","title":"Generalized preference optimization: A unified approach to offline alignment,","venue":null,"work_id":"204007d9-d2ae-4c1d-81a3-8208c7bf8a1e","year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.244822Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:405bcf2fe980d9a8d432c8b56334d68f3fa051d3b972cd146d6712e47a330c09","observation_id":"170bbaa3-093d-4e6d-a9ea-1ab59660b784","resolution":{"observed_at":"2026-08-07T00:31:49.795028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19107","last_updated":"2024-05-29T14:11:29Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T14:11:29Z","title":"Offline Regularised Reinforcement Learning for Large Language Models Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19107","snapshot_observed_at":"2026-08-07T00:31:49.248057Z","title":"Offline regularised reinforcement learning for large language models alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.248057Z"},"links":{"cited_paper":"/paper/2405.19107","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:03efd572a3b54deca8f0600bdc2b3f533ac48e8bb81fe516d6d8be0b18ea14a3","observation_id":"848849fa-a948-449d-976a-015b8f7fb801","resolution":{"observed_at":"2026-08-07T00:31:49.248057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.782171Z","title":"Model alignment as prospect theoretic optimization,","venue":null,"work_id":"26aafd6a-a12f-4cf5-917a-cac2461113f7","year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.251658Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:96ae9cc1a2205b116618c24a7a2c5de712b052f887ca54671fff107334294f76","observation_id":"ffe4e4d3-d6bc-4aa1-8966-aed06214946b","resolution":{"observed_at":"2026-08-07T00:31:49.785448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.254776Z","title":"Instruction tuning for large language models: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.254776Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:fb8b2e204df681b297f7e39257a7299bcaeb03f42186c29146bfd7f4ce322540","observation_id":"6699bbdc-bc91-4330-9be9-e3013b84bd57","resolution":{"observed_at":"2026-08-07T00:31:49.254776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T00:31:49.259019Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.259019Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:36cbc1c11c6d0142626a0f6ded7bc8ff49f93071bcf3ff1c1acb397a9a906165","observation_id":"fb0b05c5-085b-4d2c-b061-a4849a9ca341","resolution":{"observed_at":"2026-08-07T00:31:49.259019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.772001Z","title":"Trust region policy optimization,","venue":null,"work_id":"e37ac855-c9a1-48ff-8996-635a12857ddd","year":2015},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.263025Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:69b10eaeedfd7133fc858672985f3d5671b74e86c1de99f29fc9734c1b80039c","observation_id":"ff63cb40-f6da-4a37-bc7b-9a7815d04dff","resolution":{"observed_at":"2026-08-07T00:31:49.775562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.266419Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.266419Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:f93a19ef3f77212c48b6db7d842eda732a030ce8bc9b230182f05b2a85dc47d3","observation_id":"3b6d7598-5178-4239-ba4a-ae55ba16e2ab","resolution":{"observed_at":"2026-08-07T00:31:49.266419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:31:49.269741Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.269741Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:2bbf1bcf6b5240164d33507e521ec1d6774ed2061c1b598b9fc34bf87c7da43f","observation_id":"bc503428-b3a4-4786-8dab-a4ce942ed59c","resolution":{"observed_at":"2026-08-07T00:31:49.269741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.755349Z","title":"The claude 3 model family: Opus, sonnet, haiku,","venue":null,"work_id":"9250ce1d-d789-4ca5-8936-91dabe4e19f3","year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.272989Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:b7f19e89ac76ddec918d5d17a49bafec6ae40547f777f561c3f096bf7ea36656","observation_id":"41a6f198-8d6c-4b8d-bc1c-481155b2fd4c","resolution":{"observed_at":"2026-08-07T00:31:49.759152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.745103Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing,","venue":null,"work_id":"b0397a8c-066a-4921-8e72-5646dc4037e8","year":2025},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.277532Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:7dd6f9ec8891ce15df5566874d5450b7b825bbfac6fd54bfd98fac591ff488af","observation_id":"3056ed27-b9f2-4632-b3e7-ae35c551fc55","resolution":{"observed_at":"2026-08-07T00:31:49.748634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.734518Z","title":"Guiding pretraining in reinforcement learning with large language models,","venue":null,"work_id":"bdaa25b6-19ea-4023-9fe4-1473d15f1bc5","year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.280587Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:5aa2bf00a9e59783aab2db80efa8ed4ba5cd6295dfc03f6545306e608408c790","observation_id":"cff56b3c-ca0c-458e-92b1-3cd249e28eca","resolution":{"observed_at":"2026-08-07T00:31:49.738544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-04T23:38:14.844517Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-07T00:31:49.283692Z","title":"Rrhf: Rank responses to align language models with human feedback without tears,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.283692Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:f61ada2ee79a916f08948f3ef7ddda61a4f0993a36be71a62eeb71a26ef9efce","observation_id":"0d3ab8c7-82c6-472a-85b1-493e848b096b","resolution":{"observed_at":"2026-08-07T00:31:49.283692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.723892Z","title":"CREAM: consistency regularized self-rewarding language models,","venue":null,"work_id":"bac41e95-6def-48c3-be03-a686f90983b3","year":2025},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.287664Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:20a904f6c0111d767d08831c302dc7f268e2afa100830dfbe185ca0f37020752","observation_id":"8e48b80a-f4a5-4b8c-a791-f04e80f8181f","resolution":{"observed_at":"2026-08-07T00:31:49.727405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.714517Z","title":"Self-rewarding language models,","venue":null,"work_id":"e16c2725-8535-46cd-b49e-45d2c8ba68f3","year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.290911Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:892a83dc08ca696c9df7e5c73580cab626f2607c4e6aef79d581ae318c682ec3","observation_id":"0267a425-915e-45a6-a8be-60f29fa65428","resolution":{"observed_at":"2026-08-07T00:31:49.717989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T00:31:49.293738Z","title":"Slic-hf: Sequence likelihood calibration with human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.293738Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:2d6870fde898679e1f0bd08be9fdc923c69f917b7e7ab2d51e785bb7f04b76b6","observation_id":"586052fa-c7b1-42f5-b7d7-8e467d6e9ebc","resolution":{"observed_at":"2026-08-07T00:31:49.293738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:31:49.297393Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.297393Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:d1f2742bfe620d11dda8320d6b71f45d98019174ce4eee3faf0cc5e1bda18a1c","observation_id":"15bae0be-35c2-44a2-bd98-8b0a8a551dbd","resolution":{"observed_at":"2026-08-07T00:31:49.297393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T00:31:49.300277Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.300277Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:06a29f8ce4a5f49fcfe9067e30ddfb4d4f13db83b47a8234faa2280da04cc63b","observation_id":"163ec618-6992-4fcf-ae7d-625c5dd4cf0a","resolution":{"observed_at":"2026-08-07T00:31:49.300277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11704","last_updated":"2024-08-06T22:37:06Z","snapshot_observed_at":"2026-08-01T16:04:10.873571Z","submitted_at":"2024-06-17T16:25:04Z","title":"Nemotron-4 340B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11704","snapshot_observed_at":"2026-08-07T00:31:49.303322Z","title":"Nemotron-4 340b technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.303322Z"},"links":{"cited_paper":"/paper/2406.11704","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:623629a8cf5b43b0f4e98307166eb6728d03279d73ff15359ef90e3be7da2bcf","observation_id":"2acf63e6-e1f2-4458-9c6f-427069ec6d62","resolution":{"observed_at":"2026-08-07T00:31:49.303322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.306523Z","title":"Rank analysis of incomplete block designs: I. the method of paired comparisons,","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.306523Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:58cd6dc05d9670dc7167e4edfa917befa35081ddf5abe15733361766286e7716","observation_id":"4d4fdb80-5a78-4520-b10c-85b41aeb9bdf","resolution":{"observed_at":"2026-08-07T00:31:49.306523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.698349Z","title":"A general theoretical paradigm to understand learning from human preferences,","venue":null,"work_id":"3c2f277e-70db-486e-944b-5b7e674a81c1","year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.309895Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:9cc18668167ee0a670d771bf6d381de65a699db5f13ae8be77956c42e9a7f533","observation_id":"b0633016-44d7-4956-a4d3-a56c310edf3e","resolution":{"observed_at":"2026-08-07T00:31:49.702083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.689341Z","title":"Advances in prospect theory: Cumulative representation of uncertainty,","venue":null,"work_id":"f4f386d6-feb8-4073-97a9-aad165b88457","year":1992},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.312840Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:9c4b584ff8d59bac092b21fd14da8efd62e382cda071d0b0fe18bb8c2639af95","observation_id":"f496c456-0247-4c12-b42d-338ec07bae57","resolution":{"observed_at":"2026-08-07T00:31:49.692625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-07T00:31:49.315854Z","title":"Ultrafeedback: Boosting language models with high-quality feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.315854Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:dfc7345783cd51bfb27392cda71cc2b741fa1a1643616a1b6e33e344f7653d49","observation_id":"efb414d2-4669-4b7d-a5eb-e8b65446ba0b","resolution":{"observed_at":"2026-08-07T00:31:49.315854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.679085Z","title":"Alpacaeval: An automatic evaluator of instruction-following models,","venue":null,"work_id":"ce99277b-b7a9-4b0b-9dd2-9e7d0bcfce1c","year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.319398Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:2ab530dda7762869e7366a3ba76269d56ae0ccd2bae44ddb88fca3b4bdd0b57b","observation_id":"7262b461-5e87-474b-85dd-4960bc1d8d80","resolution":{"observed_at":"2026-08-07T00:31:49.683149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.322892Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.322892Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:29964f85a217b8225cbbbd3a77567917b23cd05c155a9224ceadee2aa3b81d23","observation_id":"29968375-32d7-49df-bf73-acb155c2e158","resolution":{"observed_at":"2026-08-07T00:31:49.322892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T00:31:49.326677Z","title":"Instruction-following evaluation for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.326677Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:6a38618b5390cb40d21b085e0608c15d28bfa0c7a76817dac1a8bfd32c67c0ad","observation_id":"3b78be03-5ee5-44bc-9e33-ffbaca2aee97","resolution":{"observed_at":"2026-08-07T00:31:49.326677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T00:31:49.330155Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.330155Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:30cc3a0f697aedbddce8f81fc92cdd86de0f09f845dbaad4cad551ba6b5420f0","observation_id":"2b07c684-5b46-4e78-b412-79e35815b2c1","resolution":{"observed_at":"2026-08-07T00:31:49.330155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.662954Z","title":"Scaling up models and data with t5x and seqio,","venue":null,"work_id":"d471bc27-8cc3-4e85-9da8-b6b9d33d2480","year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.333178Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:0704e2684ebf666d67f4177ce2217336cb7c42e5a5fb03f63e04b6e453dc0027","observation_id":"17fce266-5c00-4cb7-852f-8059491a6f1c","resolution":{"observed_at":"2026-08-07T00:31:49.667368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.336652Z","title":"Mistral 7b,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.336652Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:b7d2849e34924bdd3033a42c8ff0c47833bc9a46df51db229f6ced3c91aa2316","observation_id":"7fb1bfa7-74ea-4b4e-93ff-1c7f6ca8f999","resolution":{"observed_at":"2026-08-07T00:31:49.336652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.646187Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":"34653c7c-ec7b-4973-8f49-2c147f15fb0b","year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.340728Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:ab99a96b953ab02b1198a6c76ea193838c0938884e9f494b7ac120e5936c6d0a","observation_id":"ab1ceb4b-8ef4-47cf-9ba4-9e85d1442e9d","resolution":{"observed_at":"2026-08-07T00:31:49.650316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T00:31:49.344252Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.344252Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:9ce58fb380a37e96bb24c3c31dd3a7b55dde4c816d946e04e30c45acd23dbd44","observation_id":"edba6570-de0e-4a9b-9180-4ac294105a90","resolution":{"observed_at":"2026-08-07T00:31:49.344252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-07T00:31:49.347457Z","title":"Bertscore: Evaluating text generation with bert,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.347457Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:7f77805837471606d5a494027ec916dd868804aa345af0e30224d562e46f185b","observation_id":"526d418b-dd00-4c0e-8f9d-32f81c3ca79a","resolution":{"observed_at":"2026-08-07T00:31:49.347457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.350864Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.350864Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:0aad0e5a887e9ded2c8954cdb6425b2b78482e606a52493b195ff45c69a6e293","observation_id":"762e49c1-11ac-4aac-bf6e-ea267e0d46be","resolution":{"observed_at":"2026-08-07T00:31:49.350864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.629818Z","title":"A diversity-promoting objective function for neural conversation models,","venue":null,"work_id":"5947ea9f-03d8-400a-a8aa-8c47c528642c","year":2016},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.354796Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:26670d7413b6d70d693773c52e5a75b794f9738fede2e7ebadabab9b31e5ed41","observation_id":"1c2fe268-4e4a-4beb-85cc-8fae2cd7f522","resolution":{"observed_at":"2026-08-07T00:31:49.634832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-07T00:31:49.358212Z","title":"A survey on llm-as-a-judge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.358212Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:aa503f2b7b5869eccb377be50b70edf18ebedc26b365b20222c12fb2d16143a7","observation_id":"c84dfb56-bb9d-4b13-8610-5d333745a163","resolution":{"observed_at":"2026-08-07T00:31:49.358212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T00:31:49.361713Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.361713Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:745b00efdc12f0380e45e32d001dcfc82265e606e6011ec5ae3c276cf7d3a173","observation_id":"0c8e74f6-81cf-4fd3-9c7a-df18274cf243","resolution":{"observed_at":"2026-08-07T00:31:49.361713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.619771Z","title":"Claude 3.5 sonnet","venue":null,"work_id":"b60d6fdb-4252-4841-93f4-74e1519ec1a6","year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.365419Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:74395d9e136d8b39373e83c0230b5b2977a788ec370614c817edf1f42e6d3703","observation_id":"d8c59ea9-5c99-45a5-bbd7-2c6f3921eecc","resolution":{"observed_at":"2026-08-07T00:31:49.623894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.368412Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.368412Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:9a809565ede960fb1aac579802444ba9483c4a4d2d8b8ea026ff2bb5929b4ad4","observation_id":"9a806028-570f-490e-bdc4-e44b439ba7ac","resolution":{"observed_at":"2026-08-07T00:31:49.368412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T08:32:28.024919Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2506.13702."}