{"as_of":"2026-08-17T17:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:60f1b436b419af492d49e9cb63e238eed1465b2bc368bda0d89573b4af788ce6","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:57:59.957126Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.29246/citation-record","integrity":"/paper/2607.29246/integrity","json":"/paper/2607.29246/citation-record.json","paper":"/paper/2607.29246"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:55.107801Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:55.107801Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:681b277b3f40287361d479f1fea0efebf20c382132855378ad6ab3d92fcf6f02","observation_id":"2252a65d-8797-4a2d-88ac-2bce9c40056d","resolution":{"observed_at":"2026-08-03T10:57:55.107801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T10:57:55.270507Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:55.270507Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:1b56051c66d9cf2b14bc7ee1d97edcea606ef31d693b7a9e203c07020a430a49","observation_id":"c56373e8-8d14-4135-aa16-9e83e4560f72","resolution":{"observed_at":"2026-08-03T10:57:55.270507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:55.474776Z","title":"Constrained policy optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:55.474776Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:2765529775708afa8dedf6c8916ffc5c052d3cabd6693021710eafe943226043","observation_id":"3c428343-9b71-46ba-97f9-9d108374649c","resolution":{"observed_at":"2026-08-03T10:57:55.474776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-03T10:57:55.639962Z","title":"A general language assistant as a laboratory for alignment.arXiv preprint arXiv:2112.00861, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:55.639962Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:a023ee83139880941254dd475534c433777eff9eafada393be8c301d75e1cb5a","observation_id":"710a68b9-ed44-4579-a283-d54ab2267edc","resolution":{"observed_at":"2026-08-03T10:57:55.639962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-03T10:57:55.776508Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:55.776508Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:ef80d4fa762186360beaecb728788e5556366f9d9fbfd54ee9106cd6e1e74fd8","observation_id":"c886ddbb-9dfd-40bf-878c-c32ef9e2f118","resolution":{"observed_at":"2026-08-03T10:57:55.776508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:55.906800Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:55.906800Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:7da08c56d00d99476fe0a4c1237bbf9b3c3da0b8834f1005407535adcdb2d6fc","observation_id":"f536a981-51e5-491c-8815-21f3cb3dd3b8","resolution":{"observed_at":"2026-08-03T10:57:55.906800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:56.053973Z","title":"Dynamic multi-reward weighting for multi-style controllable generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:56.053973Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:2120cfc345b1765ad65a7e18f026ca3b370f751d52820263f959ad621c393cb7","observation_id":"00b266f5-8f52-4085-974c-087954635c6e","resolution":{"observed_at":"2026-08-03T10:57:56.053973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14479","last_updated":"2024-03-06T09:36:54Z","snapshot_observed_at":"2026-08-16T14:40:39.780978Z","submitted_at":"2023-11-24T13:41:12Z","title":"Controlled Text Generation via Language Model Arithmetic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14479","snapshot_observed_at":"2026-08-03T10:57:56.255359Z","title":"Controlled text generation via language model arithmetic.arXiv preprint arXiv:2311.14479, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:56.255359Z"},"links":{"cited_paper":"/paper/2311.14479","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:da58ec547e8038f809b343bb3773cdd3921ebb4124d57ce66b15cc7de9b8b14e","observation_id":"36b1c5c6-eaf4-459d-b99d-87d16faeede5","resolution":{"observed_at":"2026-08-03T10:57:56.255359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:56.421922Z","title":"Sciknoweval: Evaluating multi-level scientific knowledge of large language models.arXiv preprint arXiv:2406.09098, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:56.421922Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:186d9dae1698666665556e5c3f1bc2b142d9689bc551661724d25e6ae47c3d22","observation_id":"9b35f7ae-9383-43d2-871d-d0bd26217ed8","resolution":{"observed_at":"2026-08-03T10:57:56.421922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-08-17T08:35:42.452149Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-03T10:57:56.478012Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned.arXiv preprint arXiv:2209.07858, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:56.478012Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:8a0790c1d97c941e7a434d46990e537e1cbdbd12570a1e75762a3e8f346cb2a4","observation_id":"76e35d0d-e00e-4726-a1b9-7acb6c8fad02","resolution":{"observed_at":"2026-08-03T10:57:56.478012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:56.556638Z","title":"Training products of experts by minimizing contrastive divergence.Neural computation, 14(8): 1771–1800, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:56.556638Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:de8a31d48a6cc0e740e3cb4107bfe76ffce229d3dc844b12b182ff6c3bc80350","observation_id":"0aeeb0ac-8a3e-44c7-b16d-220ba9594999","resolution":{"observed_at":"2026-08-03T10:57:56.556638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11564","last_updated":"2023-10-17T20:22:13Z","snapshot_observed_at":"2026-08-16T14:51:15.263987Z","submitted_at":"2023-10-17T20:22:13Z","title":"Personalized Soups: Personalized Large Language Model Alignment via Post-hoc Parameter Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11564","snapshot_observed_at":"2026-08-03T10:57:56.614290Z","title":"Personalized soups: Personalized large language model alignment via post-hoc parameter merging.arXiv preprint arXiv:2310.11564, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:56.614290Z"},"links":{"cited_paper":"/paper/2310.11564","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:8f0fba619688d2d2b8c0db97e55c25bcfa4a12eaf2bb0ea5753c9bcca7794d6b","observation_id":"d09ef992-9976-4b7a-ad03-d54637359612","resolution":{"observed_at":"2026-08-03T10:57:56.614290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:56.722704Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:56.722704Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:d9a33561da54fe8dc02a919e1c236776c06381d9f956f01742460e32209f61e5","observation_id":"283c1b82-022e-4dba-9eee-eede598c0b17","resolution":{"observed_at":"2026-08-03T10:57:56.722704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:56.805771Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:56.805771Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:8e7f2495dccb8ca6f882d086f378723f7ad295a8761ee9f345c0f0efc6ca56a7","observation_id":"2c0ac92d-9ac7-47ee-aece-ac1a95b36dc2","resolution":{"observed_at":"2026-08-03T10:57:56.805771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:56.890897Z","title":"Gradient-adaptive policy optimization: Towards multi-objective alignment of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:56.890897Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:dfa575bd2183547e31d9838de45dcc8071660954a5307188159376ed5e123b58","observation_id":"c8f23978-ec55-455c-a541-bddc6d2be2bc","resolution":{"observed_at":"2026-08-03T10:57:56.890897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:56.946072Z","title":"Prefix-tuning: Optimizing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:56.946072Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:fa87b2ff59645e36497acdd2df835571ee0e192fce4396fa08ca246c7c392a93","observation_id":"2338c79f-231e-4e2f-87db-97c88a8d3dd1","resolution":{"observed_at":"2026-08-03T10:57:56.946072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-15T09:57:00.601813Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.00898","snapshot_observed_at":"2026-08-03T10:57:57.027963Z","title":"Dichotomous diffusion policy optimization.arXiv preprint arXiv:2601.00898, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:57.027963Z"},"links":{"cited_paper":"/paper/2601.00898","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:c7329547b690b60e1b42516327f8eb7b56d53efb80053e93dff2edbd18f8e73e","observation_id":"c44bc475-1f86-4cf5-814a-33156b0f5d9a","resolution":{"observed_at":"2026-08-03T10:57:57.027963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:57.111192Z","title":"Mitigating the alignment tax of rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:57.111192Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:b947108ddc7a9c5fcb034563d348d4e5f1cf2d97bbe36b3dea7ffc5484733b89","observation_id":"f4338bba-2e77-45b0-bc39-7ddafa50bf5d","resolution":{"observed_at":"2026-08-03T10:57:57.111192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-03T10:57:57.170681Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:57.170681Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:01c6b1fdca7951b399156c47501c30d33e3f3bc7202e0cbdd39be92faa852424","observation_id":"43580a14-00a4-4046-a1fe-0e31a0e10efd","resolution":{"observed_at":"2026-08-03T10:57:57.170681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:57.209594Z","title":"Dexperts: Decoding-time controlled text generation with experts and anti-experts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:57.209594Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:171839aa9d4cb89497f67273e784f11ae305ca89e4ec0b2f9281bf5302a83c14","observation_id":"f00b3543-9e56-4633-99c3-50c5359b8567","resolution":{"observed_at":"2026-08-03T10:57:57.209594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-03T10:57:57.281195Z","title":"Gdpo: Group reward-decoupled normalization policy optimization for multi-reward rl optimization, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:57.281195Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:4a0c953d862530bd7fca24886ea46922113fe02fdd9740c25e30c0f4107bfe7b","observation_id":"91e8983d-011f-4b77-9d09-18d24677f944","resolution":{"observed_at":"2026-08-03T10:57:57.281195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09117","last_updated":"2023-09-29T15:11:49Z","snapshot_observed_at":"2026-08-17T01:09:14.198127Z","submitted_at":"2023-09-17T00:29:32Z","title":"Contrastive Decoding Improves Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09117","snapshot_observed_at":"2026-08-03T10:57:57.414627Z","title":"Contrastive decoding improves reasoning in large language models.arXiv preprint arXiv:2309.09117, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:57.414627Z"},"links":{"cited_paper":"/paper/2309.09117","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:72ed4e547e46b0da991bbc94ddb9c38aa4e96f5387ae65ad3c6177ee6958bfa8","observation_id":"d09a2950-006e-4929-a5c3-06a546bc80b5","resolution":{"observed_at":"2026-08-03T10:57:57.414627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:57.550904Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:57.550904Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:3177039c695ae916818e314d34edbc0866e0a372953068fb45bd13baa7e3f314","observation_id":"519e1b21-465a-48ff-8af6-285222c09a1f","resolution":{"observed_at":"2026-08-03T10:57:57.550904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:57.658858Z","title":"Patil, Huanzhi Mao, Charlie Cheng-Jie Ji, Fanjia Yan, Vishnu Suresh, Ion Stoica, and Joseph E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:57.658858Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:4802e4ff4bf071d33b5001d2f3512549312abe5ad19da46b15c18325d0c04f61","observation_id":"79d03c10-79d7-4257-9e56-85f8bade94ba","resolution":{"observed_at":"2026-08-03T10:57:57.658858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-03T10:57:57.766979Z","title":"Efficiently scaling transformer inference.arXiv preprint arXiv:2211.05102, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:57.766979Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:4b67e729a60399550451049b87561143eb5a3813d178d3c9d1bab49a79f314f3","observation_id":"60fae710-b15f-47ad-aaab-3b0a667bc766","resolution":{"observed_at":"2026-08-03T10:57:57.766979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:57.931652Z","title":"Toolrl: Reward is all tool learning needs.Advances in Neural Information Processing Systems, 38:105523–105553, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:57.931652Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:322eea107e2c1a93f56a387766f9ca4c7eb7226aff22dff4ad1277fa0d893217","observation_id":"f4dbf456-c303-4424-8266-63279c71fa1d","resolution":{"observed_at":"2026-08-03T10:57:57.931652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:58.038209Z","title":"Dmoerm: Recipes of mixture-of-experts for effective reward modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:58.038209Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:6983a8e1d630ad0d11c844ea56024a2f082506693b8113e748443be066fec89a","observation_id":"18a6c740-2c46-41a6-bc98-84658d90fbc1","resolution":{"observed_at":"2026-08-03T10:57:58.038209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:58.146712Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in neural information processing systems, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:58.146712Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:b09a5ece720e859f3d9f2e897728f82739bdf31d3e871fd80bd9f08691a65be9","observation_id":"933e819f-9aaa-4f02-9e7d-0e57b9f5a0f9","resolution":{"observed_at":"2026-08-03T10:57:58.146712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-16T14:25:27.754821Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-03T10:57:58.293232Z","title":"Warm: On the benefits of weight averaged reward models.arXiv preprint arXiv:2401.12187, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:58.293232Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:a890bcd5c4ccc7f01bbe4ba69866cd287b6a1115d1fc2e6ea546f62ae5550bf2","observation_id":"d164ed71-f4cc-46b1-90dc-f45e60b3ff22","resolution":{"observed_at":"2026-08-03T10:57:58.293232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-16T07:06:07.822225Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-03T10:57:58.404799Z","title":"Gpqa: A graduate-level google-proof q&a benchmark.arXiv preprint arXiv:2311.12022, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:58.404799Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:94a586f8d6ed42e5edd52ea31e45da512ae7fd424057662ade0dba951cd01964","observation_id":"ddb18dcd-5389-493e-9ace-2059d88a841b","resolution":{"observed_at":"2026-08-03T10:57:58.404799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:58.515088Z","title":"A survey of multi-objective sequential decision-making.Journal of Artificial Intelligence Research, 48:67–113, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:58.515088Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:d1249ada1d0350505779ee6829da1fd7a5f2e2dffb3a4802b5070de370524af5","observation_id":"8628402e-3a1b-475d-9b05-e8d74a491354","resolution":{"observed_at":"2026-08-03T10:57:58.515088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:58.543147Z","title":"Scienceqa: A novel resource for question answering on scholarly articles.International Journal on Digital Libraries, 23(3):289–301, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:58.543147Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:49fe016ef747e9e11babe62820b297f9096d769372b3dce5c36dc0b9dd98c15f","observation_id":"357c0212-c5f2-4562-9d4a-08842e2ba2c8","resolution":{"observed_at":"2026-08-03T10:57:58.543147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T10:57:58.640700Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:58.640700Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:69a75aaed2b940f4d3d83fe9d2a536f39d74651202213f6772a176cfecfdb7fa","observation_id":"cf1a97c0-b3a4-4c86-a02c-b6ddc315f087","resolution":{"observed_at":"2026-08-03T10:57:58.640700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T10:57:58.769275Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:58.769275Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:e8009927a24a3d65b8994b85fdec75db3f47ca7812f674d327a7302ac7b4307b","observation_id":"8885a5af-f4aa-4145-b41c-ea459b4ef695","resolution":{"observed_at":"2026-08-03T10:57:58.769275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:58.923934Z","title":"MIT press Cambridge, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:58.923934Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:8272723edbecf0353eed0cdfba495c38546e065c73f4f67bd53f33387c184de0","observation_id":"59c2228c-b2e3-4d21-969e-27d1be6177fe","resolution":{"observed_at":"2026-08-03T10:57:58.923934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.072272Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.072272Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:719a4c332242de47eed62cbaf72d875bdaf0eecf2051bdd9e342566083e03677","observation_id":"d9549157-ac81-43e7-9ea4-cae6e2590bed","resolution":{"observed_at":"2026-08-03T10:57:59.072272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.184106Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.184106Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:a9514220a17126411bdf7941107804d4eef78fd8daacf8a70a65b390eadb87b0","observation_id":"869403b3-bd32-4e28-859a-bedd41bbcac0","resolution":{"observed_at":"2026-08-03T10:57:59.184106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.278322Z","title":"Interpretable preferences via multi- objective reward modeling and mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.278322Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:b8e0c9ed928864d44d4dedce9dc7da71e7cb1e86fa4dd399c2bab911c6f384c7","observation_id":"15785910-7208-433a-9312-1489c8754843","resolution":{"observed_at":"2026-08-03T10:57:59.278322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-08-16T15:13:42.128297Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-03T10:57:59.358866Z","title":"Aligning large language models with human: A survey.arXiv preprint arXiv:2307.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.358866Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:7e0464f26d41ce777ce12585f857fe8b9f30b7f9f8cd148334de2db9edca002b","observation_id":"2059eb48-5b8f-409d-95e3-8eda809e0613","resolution":{"observed_at":"2026-08-03T10:57:59.358866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07295","last_updated":"2024-06-12T13:55:30Z","snapshot_observed_at":"2026-08-16T13:44:09.826230Z","submitted_at":"2024-06-11T14:24:00Z","title":"Multi-objective Reinforcement learning from AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07295","snapshot_observed_at":"2026-08-03T10:57:59.414952Z","title":"Multi-objective reinforcement learning from ai feedback.arXiv preprint arXiv:2406.07295, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.414952Z"},"links":{"cited_paper":"/paper/2406.07295","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:79d21763ed75f619b9e114f5e084a68320e932ef8c7c8fe41658266c3d07a1b4","observation_id":"53e6144e-33e8-454b-b059-9793794acb39","resolution":{"observed_at":"2026-08-03T10:57:59.414952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.453124Z","title":"Fine-grained human feedback gives better rewards for language model training.Advances in Neural Information Processing Systems, 36:59008–59033, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.453124Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:fd9bf736c88a34a0e73f4661e96c6dddad3ab790ca62f1a626901bc0733c501f","observation_id":"b2f1d597-9f39-42f4-9f2b-210396983f6f","resolution":{"observed_at":"2026-08-03T10:57:59.453124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.464943Z","title":"Rewards-in-context: Multi-objective alignment of foundation models with dynamic preference adjustment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.464943Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:eb661720a6625fb1ee808a19b5cc32a48de08686eab622170d7fc3203c26a032","observation_id":"688eef7b-a850-4b9d-9991-2ddcb722e34f","resolution":{"observed_at":"2026-08-03T10:57:59.464943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.498440Z","title":"Dapo: An open-source llm reinforcement learning system at scale.Advances in Neural Information Processing Systems, 38:113222–113244, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.498440Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:95e42b17db1f14f2a7a39216ca4d3eb4f7081cc8399b835ad925744e8fb4d440","observation_id":"c6f28c77-d3a1-45e7-a0ca-68f330b176c2","resolution":{"observed_at":"2026-08-03T10:57:59.498440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05868","last_updated":"2024-10-10T22:00:41Z","snapshot_observed_at":"2026-07-06T17:57:27.510162Z","submitted_at":"2024-04-08T21:05:42Z","title":"Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05868","snapshot_observed_at":"2026-08-03T10:57:59.532178Z","title":"Negative preference optimization: From catastrophic collapse to effective unlearning.arXiv preprint arXiv:2404.05868, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.532178Z"},"links":{"cited_paper":"/paper/2404.05868","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:00b7bb781a170285700bebb3c02d0e477e3a6e40823ff94506f61af1ee918a8b","observation_id":"236c7969-d734-4214-84c0-fce3c1900fdd","resolution":{"observed_at":"2026-08-03T10:57:59.532178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-03T10:57:59.570265Z","title":"Group sequence policy optimization.arXiv preprint arXiv:2507.18071, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.570265Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:cdcd4bec6fbcb1a73f15b0408075f405964f2c280f086831e24e7e69740131e9","observation_id":"c432441f-4f02-4915-8c54-66fd1168a07a","resolution":{"observed_at":"2026-08-03T10:57:59.570265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.603375Z","title":"Beyond one-preference- fits-all alignment: Multi-objective direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.603375Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:13d3d77482efcb740a94033958a5124691749148cf31b401452c0deda7587b00","observation_id":"fd437aff-d4f8-4944-b63b-fbeec4b8b18c","resolution":{"observed_at":"2026-08-03T10:57:59.603375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-03T10:57:59.636424Z","title":"Fine-tuning language models from human preferences.arXiv preprint arXiv:1909.08593, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.636424Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:5d2cef4cde488832efa026de539acce0c2b6a986650ad261b5fb7c3a3071b00a","observation_id":"4a908d3b-3316-4cfe-92db-d48ff77ec12e","resolution":{"observed_at":"2026-08-03T10:57:59.636424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.669547Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.669547Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:57dd6c647f8306751fba2cacf4f83fed66a7f3a66cdf5b7a89b0cba45cf1da6a","observation_id":"c3f791c3-5068-46c1-b111-0ee663959998","resolution":{"observed_at":"2026-08-03T10:57:59.669547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.703705Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.703705Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:01f1d65e1ccf2ab7a2108a402723b74503ec6f16c606efccfc531d3ca37384bb","observation_id":"2e665d08-12e3-4708-b27b-49ad6f654631","resolution":{"observed_at":"2026-08-03T10:57:59.703705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.735618Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.735618Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:de936e49ca3a66e64cbc7095957d9b55ac5c4c13e96ab79f40d63d98e92c81df","observation_id":"6edc1baf-0eab-471f-a361-e479bf5a0652","resolution":{"observed_at":"2026-08-03T10:57:59.735618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.773858Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.773858Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:e2172965044489c742b1448434043d70340f9ea46c03dd89a45058ba448a751d","observation_id":"a0baae10-9d9a-48d0-a9b6-0f1a15126da5","resolution":{"observed_at":"2026-08-03T10:57:59.773858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.791574Z","title":"A\", \"B\",","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.791574Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:595c0bfee42c75b16a5b166aab25cbe4c1b4249e1fd1d508684b63ddf87aa3e5","observation_id":"40321411-77e6-48c6-ae9f-75596065d0c4","resolution":{"observed_at":"2026-08-03T10:57:59.791574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.829818Z","title":"Provide at least one of<tool_call> or <response>","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.829818Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:350e224823fbe1d97cccbccaa8718873b811b58c06d948257485cd088ebaa2ea","observation_id":"ce02a277-1602-412e-abba-2d5046ed19cf","resolution":{"observed_at":"2026-08-03T10:57:59.829818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.876040Z","title":"name\" field and a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.876040Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:04119fc82fa6e11a889d076ef1d37533593ee6691d120b64b72a9f54027f22e5","observation_id":"a755a497-cc37-4d2a-88fe-99d37282fd9d","resolution":{"observed_at":"2026-08-03T10:57:59.876040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.909007Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.909007Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:5a157db185c60940cd782ccdfa38dd02d8d894c2e96bb5f9d3625976c11a4114","observation_id":"fe4842b0-bf39-4b9c-b21d-b92771163819","resolution":{"observed_at":"2026-08-03T10:57:59.909007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.942109Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.942109Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:bfa3578a5d1b6485c372d6816e6d4f0435fc34448748fb3b1a33060bdbe32431","observation_id":"9a64dbc0-e2c5-4ab3-911e-4f6f06e01b83","resolution":{"observed_at":"2026-08-03T10:57:59.942109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:57:59.957126Z","title":"name \":","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:59.957126Z"},"links":{"citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:d98c4ae0231bd6a959fc33ddd2c6b4552e83394df1e57ac68378327af049d4fe","observation_id":"1c8af99f-cb91-4ad2-8e21-6ff0c6274339","resolution":{"observed_at":"2026-08-03T10:57:59.957126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2607.29246."}