{"as_of":"2026-08-13T21:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ad9b39fc225f7a7165ed3aa549fc51bd2e0895b539242a86c9a5fc147fb0701","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:31:45.734231Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.06248/citation-record","integrity":"/paper/2501.06248/integrity","json":"/paper/2501.06248/citation-record.json","paper":"/paper/2501.06248"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-10T21:31:45.586146Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.586146Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:28743d40fca4a86ebd6d7f4a2d5b2aac5d00345e71f0a7ccba93a7e658996932","observation_id":"63b0bb0d-2444-4081-ac61-41292b01466b","resolution":{"observed_at":"2026-08-10T21:31:45.586146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-10T21:31:45.591475Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.591475Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:a57874ebef70561e8608aa1f185eb2bd4600d10aefb87410c6e26c91ed22a7ec","observation_id":"69553556-f3f6-4317-9aeb-0f9ea8d6161c","resolution":{"observed_at":"2026-08-10T21:31:45.591475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T21:31:45.596208Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.596208Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:0ca3924a1094329959d87422c244963c9ceb4d1cfca7c7c9b175b2118b19b315","observation_id":"056526bc-d7af-4d73-a5af-30a5c2f08331","resolution":{"observed_at":"2026-08-10T21:31:45.596208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:45.602059Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.602059Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:7723dc00a549a0ed64a03e6cac312b0571965af0953b741ccb4f7eeae3363eb5","observation_id":"e3b3b00e-561a-4824-ad5b-31f4003490f7","resolution":{"observed_at":"2026-08-10T21:31:45.602059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10271","last_updated":"2024-06-04T14:34:38Z","snapshot_observed_at":"2026-08-13T07:35:45.083894Z","submitted_at":"2024-04-16T03:59:33Z","title":"Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10271","snapshot_observed_at":"2026-08-10T21:31:45.607085Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.607085Z"},"links":{"cited_paper":"/paper/2404.10271","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:47dbd715f3b56ff5f897e445a4c31872d28901397f072bb89e25273bde2a7cb0","observation_id":"817eda52-d0f5-431c-bd61-25f2726e6f93","resolution":{"observed_at":"2026-08-10T21:31:45.607085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-13T05:02:09.847989Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-10T21:31:45.612012Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.612012Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:ce80ed05293fc4e438d48a2df941bcca42844241c114f909fe50ba421adb4fe7","observation_id":"3abef2ae-4105-4fe2-bd5a-372bbf6d1b1c","resolution":{"observed_at":"2026-08-10T21:31:45.612012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14652","last_updated":"2021-05-31T00:06:10Z","snapshot_observed_at":"2026-08-10T23:13:06.997350Z","submitted_at":"2021-05-31T00:06:10Z","title":"Attention Flows are Shapley Value Explanations","version":1},"cited_work":{"arxiv_id":"2105.14652","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.14652","snapshot_observed_at":"2026-08-10T21:31:46.031413Z","title":"Attention Flows are Shapley Value Explanations","venue":"cs.CL","work_id":"b82ded82-67c8-4b95-9303-00d73d90f1ad","year":2021},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.617402Z"},"links":{"cited_paper":"/paper/2105.14652","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:4234ceaeeed307d1a1aa9b9dea73c385a335c06c371cc4babbac697519b30a1a","observation_id":"0ef1db20-cc05-4cec-9123-ba7a076ec3f8","resolution":{"observed_at":"2026-08-10T21:31:46.036410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14758","last_updated":"2024-11-07T15:40:25Z","snapshot_observed_at":"2026-08-13T00:05:24.831846Z","submitted_at":"2024-05-23T16:29:29Z","title":"Axioms for AI Alignment from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14758","snapshot_observed_at":"2026-08-10T21:31:45.621875Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.621875Z"},"links":{"cited_paper":"/paper/2405.14758","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:3dd622f88931af0ac2570cdcbd050eb089b54d1220fb67a5d669493d5a97d754","observation_id":"d43c383f-e8ab-48e3-9731-411802b1b3a6","resolution":{"observed_at":"2026-08-10T21:31:45.621875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T21:31:45.626337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.626337Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:fc31b8327375acf4c8d4ba4359b0bdf7b1a6ffee76ba45a21d6b90f78b9c92b3","observation_id":"1c32782a-3e91-42a1-9c00-e763f65a879d","resolution":{"observed_at":"2026-08-10T21:31:45.626337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01704","last_updated":"2024-12-16T11:03:31Z","snapshot_observed_at":"2026-08-13T04:35:11.069928Z","submitted_at":"2024-01-24T22:22:00Z","title":"Steering Language Models with Game-Theoretic Solvers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01704","snapshot_observed_at":"2026-08-10T21:31:45.630739Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.630739Z"},"links":{"cited_paper":"/paper/2402.01704","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:804421163c642b2d727339fa605499abcb6aac410a517d115e75315a29411a21","observation_id":"12272422-9d9d-4b21-a3ac-c2ff4ce161fb","resolution":{"observed_at":"2026-08-10T21:31:45.630739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14375","last_updated":"2022-09-28T19:04:43Z","snapshot_observed_at":"2026-08-11T23:28:54.309888Z","submitted_at":"2022-09-28T19:04:43Z","title":"Improving alignment of dialogue agents via targeted human judgements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14375","snapshot_observed_at":"2026-08-10T21:31:45.635195Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.635195Z"},"links":{"cited_paper":"/paper/2209.14375","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:9875dad549316ef21ea1cf25e6182656606dcd73f54fd006b12e1082280ac61f","observation_id":"24db5438-2529-4b7c-8f0c-ccc38c6f2f56","resolution":{"observed_at":"2026-08-10T21:31:45.635195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09139","last_updated":"2023-10-13T14:27:21Z","snapshot_observed_at":"2026-08-13T05:49:49.064747Z","submitted_at":"2023-10-13T14:27:21Z","title":"The Consensus Game: Language Model Generation via Equilibrium Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09139","snapshot_observed_at":"2026-08-10T21:31:45.639950Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.639950Z"},"links":{"cited_paper":"/paper/2310.09139","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:91e209a13db316df8a1d99613ccde0c316b72ddd0967f27a1cfbbbb6fccef412","observation_id":"6080f8c3-ea81-4161-ad10-30f11ebf0a5e","resolution":{"observed_at":"2026-08-10T21:31:45.639950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:46.237350Z","title":null,"venue":null,"work_id":"9658619b-abda-4638-8ffc-cb1aab75457d","year":2018},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.644489Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:e8d72a9d546a4166e2d85fc5bd924f95cf02c8412f8c43df92424737a58f408c","observation_id":"c3d976a8-3a21-4061-9a45-7ad1402a7f05","resolution":{"observed_at":"2026-08-10T21:31:46.242306Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04373","last_updated":"2023-10-10T15:01:11Z","snapshot_observed_at":"2026-08-13T05:55:17.869629Z","submitted_at":"2023-10-06T16:59:17Z","title":"Confronting Reward Model Overoptimization with Constrained RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04373","snapshot_observed_at":"2026-08-10T21:31:45.648887Z","title":"Singh, DJ Strouse, Tuomas Sandholm, Ruslan Salakhutdinov, Anca D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.648887Z"},"links":{"cited_paper":"/paper/2310.04373","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:b92029adb5bc7672b4d4139387201ad8b87d292ca34d93139caaab083ac899d2","observation_id":"23e0c1d8-1691-480e-baa4-8a0aa3aa6c1a","resolution":{"observed_at":"2026-08-10T21:31:45.648887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-08-13T05:12:12.105399Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-08-10T21:31:45.654182Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.654182Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:552e5ade2ea0b1cfc9c5ba58e683b7da7301ec3bbf08d3197a62a7d25745c222","observation_id":"4cfdc89b-b94b-4f18-8c90-3004031e06b8","resolution":{"observed_at":"2026-08-10T21:31:45.654182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17700","last_updated":"2024-10-30T21:24:32Z","snapshot_observed_at":"2026-08-12T23:56:40.811761Z","submitted_at":"2024-05-27T23:16:52Z","title":"Learning Social Welfare Functions","version":2},"cited_work":{"arxiv_id":"2405.17700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17700","snapshot_observed_at":"2026-08-10T21:31:45.899352Z","title":"Learning Social Welfare Functions","venue":"cs.GT","work_id":"46322b08-feb4-49b5-8225-f4f0b654db24","year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.658803Z"},"links":{"cited_paper":"/paper/2405.17700","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:b6de3845afe765e256c323f563e21c5e461d36d6d39bbaa6bed7726cbb5718cc","observation_id":"1b4998d3-5525-4a81-abfd-67e7a4ba4e99","resolution":{"observed_at":"2026-08-10T21:31:45.906234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:46.222900Z","title":null,"venue":null,"work_id":"0e68964c-c956-4f9d-9805-aa9a296901de","year":2021},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.663300Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:853c2552ad9f7ed13b553b1cc27fa3f1a843cbbd5fa418b3e1dc23214763d40f","observation_id":"847d409e-a360-4a39-83a3-f8fdf8999ddb","resolution":{"observed_at":"2026-08-10T21:31:46.227446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:46.207714Z","title":null,"venue":null,"work_id":"8207f544-2e74-45c6-8d0d-3a81be5006e1","year":1978},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.667488Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:c61b6cb4dcd6b2ffac9080a919866d0d46769eb1db71584a1fd4ebeac369ea1b","observation_id":"771fc87a-285d-4986-bfda-c994e177d059","resolution":{"observed_at":"2026-08-10T21:31:46.212247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:46.193144Z","title":null,"venue":null,"work_id":"ea511251-ca01-4c94-9b23-4fb05b62d85c","year":2009},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.672008Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:0d2d818b85e6d3e96a1be68578ece1d8af075fc666c96fc83457fe51b788b192","observation_id":"b1bd732e-37d6-44c9-aa74-bade1ffe93d1","resolution":{"observed_at":"2026-08-10T21:31:46.197705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:46.178366Z","title":null,"venue":null,"work_id":"6c6f3a85-6d06-4237-9390-c60156b82ee4","year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.676572Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:db4dc3bed10e303b3d757b45010d102011b3baee06d63bbfcb100ebb9c51f86b","observation_id":"ddb1ab5c-24e8-42e3-bc45-a5ee8f733e34","resolution":{"observed_at":"2026-08-10T21:31:46.183274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T21:31:45.681223Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.681223Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:2811b6e9a8cc5bb41fe67b3b3e8a5ff9c8e360a7399b34b768c66ddc2520be36","observation_id":"65e807e5-2b58-4273-b5a1-8043d6d25af1","resolution":{"observed_at":"2026-08-10T21:31:45.681223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-13T18:58:52.179453Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-10T21:31:45.685491Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.685491Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:2596bb314befc3b65c348986e403ce26575d10327bb15533417274514f520804","observation_id":"571b9802-8a55-474e-81c0-c2e5a4ec0f20","resolution":{"observed_at":"2026-08-10T21:31:45.685491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:45.690199Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.690199Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:371fd43959fec38a5c680186e8d5f311be660ead59da1c40e39a55b6a1e7f007","observation_id":"b86165bb-7e5f-458a-a718-31a4d8330e34","resolution":{"observed_at":"2026-08-10T21:31:45.690199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-08-13T04:47:08.775275Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-10T21:31:45.694507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.694507Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:04423712ae7ec8a74fa2b70af77d4bda7bc2357f92b28d71eea1c8dc10ffa5b0","observation_id":"e699ef17-cf16-4f60-a1e9-a2a258580c43","resolution":{"observed_at":"2026-08-10T21:31:45.694507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03689","last_updated":"2023-12-06T18:53:01Z","snapshot_observed_at":"2026-08-13T05:08:30.534856Z","submitted_at":"2023-12-06T18:53:01Z","title":"Evaluating and Mitigating Discrimination in Language Model Decisions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03689","snapshot_observed_at":"2026-08-10T21:31:45.698903Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.698903Z"},"links":{"cited_paper":"/paper/2312.03689","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:974f544c975113e2d7cd535de943bfd7976e8a7dd3c8839b4e07802a857ec3a9","observation_id":"aab78833-519c-4606-8f87-c64c2f219b4b","resolution":{"observed_at":"2026-08-10T21:31:45.698903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:46.153269Z","title":null,"venue":null,"work_id":"d986819c-b93c-4fcb-b787-489c56221903","year":1961},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.703389Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:361353139720a6c860548e4638386be69b25962f77e668ac9727853d8b4c494e","observation_id":"e46d02ab-af9a-4a41-91e5-acf244c16eeb","resolution":{"observed_at":"2026-08-10T21:31:46.158280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10817","last_updated":"2024-07-15T15:33:45Z","snapshot_observed_at":"2026-08-12T23:21:55.244752Z","submitted_at":"2024-07-15T15:33:45Z","title":"Foundational Autoraters: Taming Large Language Models for Better Automatic Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10817","snapshot_observed_at":"2026-08-10T21:31:45.707647Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.707647Z"},"links":{"cited_paper":"/paper/2407.10817","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:d1f0a9ae747f1e5b3a48a017039919c1448af7adac0596dbade8c23d9e9b20ed","observation_id":"97accfb3-d797-48ae-9bd5-3cb04c4287d0","resolution":{"observed_at":"2026-08-10T21:31:45.707647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00742","last_updated":"2024-07-19T05:12:15Z","snapshot_observed_at":"2026-08-13T04:29:06.312155Z","submitted_at":"2024-02-01T16:39:28Z","title":"Transforming and Combining Rewards for Aligning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00742","snapshot_observed_at":"2026-08-10T21:31:45.712536Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.712536Z"},"links":{"cited_paper":"/paper/2402.00742","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:339637155cc8e8db1cc5a1a556ecb55f797fd9cf0ba6ffc70dee2addb4fac793","observation_id":"a80e9000-c40a-4121-964b-61f1b9dc0c67","resolution":{"observed_at":"2026-08-10T21:31:45.712536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-10T21:31:45.716752Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.716752Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:efd1ea79bcbc744326a6077a7f18ac28b707b5e80e0057ab0d19c9b4c516f0ce","observation_id":"a26d0694-f2fd-4af0-b501-231962d711fe","resolution":{"observed_at":"2026-08-10T21:31:45.716752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:45.721017Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.721017Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:8cad4542ceb79ac18765ad941439114ef9690742f304b8c66fb52a634cd25c1d","observation_id":"9c7c0d23-7c6c-47ca-9aef-7828554af0ff","resolution":{"observed_at":"2026-08-10T21:31:45.721017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01693","last_updated":"2023-10-30T06:34:35Z","snapshot_observed_at":"2026-08-13T11:25:32.964758Z","submitted_at":"2023-06-02T17:11:37Z","title":"Fine-Grained Human Feedback Gives Better Rewards for Language Model Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01693","snapshot_observed_at":"2026-08-10T21:31:45.725087Z","title":"Smith, Mari Ostendorf, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.725087Z"},"links":{"cited_paper":"/paper/2306.01693","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:3c1e12db388d8c63f0f4a7786744c2e7fb39047edfecdbeee4646a6614437cde","observation_id":"146e3566-1b63-4247-bd29-bb6993028f04","resolution":{"observed_at":"2026-08-10T21:31:45.725087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:45.729401Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.729401Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:f8ff9408179744d46b98391dcc8a9a61b39b71ff022d07d3dd01197a0c9497f4","observation_id":"7a496f50-7965-4c1a-b2dc-cddd7aa76bc5","resolution":{"observed_at":"2026-08-10T21:31:45.729401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:45.734231Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.734231Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:2bc965db8bb6b51ce92fd4573c8a5d9a762f4da9e03c9affeb987554fd9796a6","observation_id":"6b515aae-a9cf-4cbc-919a-138da253c004","resolution":{"observed_at":"2026-08-10T21:31:45.734231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T23:14:12.533178Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2501.06248."}