{"as_of":"2026-08-08T10:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b9af7d99f3e3c5a4bbc9fc164a32bca703d6798f717e3e034753a38ef15223c2","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:21:58.815824Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:52:19.102106Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T08:31:16.863245Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08266","snapshot_observed_at":"2026-08-04T14:52:19.102106Z","title":"Chittepu, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-08T05:03:31.962739Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.102106Z"},"links":{"cited_paper":"/paper/2506.08266","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:92595a0693323d76d8faa26ce9a0b3de4710efd029e00c28236b82269579e558","observation_id":"32637181-00ce-4796-a516-eaa778829233","resolution":{"observed_at":"2026-08-04T14:52:19.102106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"cited_work":{"arxiv_id":"2506.08266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08266","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.08266 , year=","venue":null,"work_id":"57d0ae6a-3e99-4af2-a41a-ef89b68d1d16","year":2025},"citing_paper":{"arxiv_id":"2604.02507","last_updated":"2026-04-02T21:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-02T21:04:17Z","title":"Reinforcement Learning from Human Feedback: A Statistical Perspective","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-13T20:10:43.578904Z"},"links":{"cited_paper":"/paper/2506.08266","citing_paper":"/paper/2604.02507"},"observation_digest":"sha256:b671553a763e1bd3509748857a8a981c630f4df7c6e491a2b45cd13e17503ab1","observation_id":"1437125e-c3ed-4c8c-85f0-a701b5c4ff4e","resolution":{"observed_at":"2026-05-13T20:13:13.609624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"cited_work":{"arxiv_id":"2506.08266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08266","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.08266 , year=","venue":null,"work_id":"57d0ae6a-3e99-4af2-a41a-ef89b68d1d16","year":2025},"citing_paper":{"arxiv_id":"2605.21822","last_updated":"2026-05-20T23:44:06Z","snapshot_observed_at":"2026-08-03T02:30:10.701058Z","submitted_at":"2026-05-20T23:44:06Z","title":"Implicit Safety Alignment from Crowd Preferences","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-22T08:28:41.652865Z"},"links":{"cited_paper":"/paper/2506.08266","citing_paper":"/paper/2605.21822"},"observation_digest":"sha256:f5596e8890ea82af00f9ac1617ec883d073853b33ee5f70624335d9227b581ac","observation_id":"8345e638-7f56-407a-8140-7d5adc8af28e","resolution":{"observed_at":"2026-05-22T08:31:16.865653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08266/citation-record","integrity":"/paper/2506.08266/integrity","json":"/paper/2506.08266/citation-record.json","paper":"/paper/2506.08266"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T05:21:58.599591Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in LLMs , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.599591Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:d2075998e99507cde788cc4c986c5ae211ec3f82bdcc8a6e67d951b1dc577726","observation_id":"56377b31-6649-45fe-88dc-a8000252c936","resolution":{"observed_at":"2026-08-07T05:21:58.599591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.604175Z","title":"Constrained Markov decision processes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.604175Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:28c0dd6323e7b2371032e6e87f47cfeb8a1a122a7c310c2acd450e46ac10e78e","observation_id":"1d856b60-19ac-4048-827b-1bafa03f8893","resolution":{"observed_at":"2026-08-07T05:21:58.604175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T05:21:58.608048Z","title":"Constitutional AI : Harmlessness from AI feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.608048Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:6479cb0bf8fb7cace6a8edfb116ba62dc2454098f1d10d0432a2ba1637e59565","observation_id":"d6aa3d0b-ca63-4b80-8d0d-c16bd0df323a","resolution":{"observed_at":"2026-08-07T05:21:58.608048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T05:21:58.612077Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 b","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.612077Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:afc9142810a4895eb5dcd2decb3a3c57533078f00fc7ffc391cd4a25ab5b446e","observation_id":"fbe55287-cb2e-4b07-84f9-2299ce6ab95d","resolution":{"observed_at":"2026-08-07T05:21:58.612077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.615943Z","title":"Convex optimization","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.615943Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:e29123733fdff6a3486d7d0e0646a0979fc9d8b8554670e1e4b07b190064cba6","observation_id":"c12c71ee-0016-4ee0-9047-9f03ee6fe616","resolution":{"observed_at":"2026-08-07T05:21:58.615943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.516795Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":"592b6563-a7bd-4c7e-8fdc-10cdbe0c60e5","year":1952},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.619931Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:eeb4fc2c3fe142ea2f797e8ea9540f1421cf4665510e38c69946019c6c523609","observation_id":"d59d16e5-e0a7-46dc-a0cb-a7bed72ca393","resolution":{"observed_at":"2026-08-07T05:21:59.520895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-03T14:31:51.401500Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-07T05:21:58.624040Z","title":"Brown, Miljan Martic, Shane Legg, and Dario Amodei","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.624040Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:e2486e56359948c1840c46a17d3cba72be681f9bf17d9f083cd9c9e04d121e31","observation_id":"f2e01823-14fb-4cb4-b533-7bcffd74649e","resolution":{"observed_at":"2026-08-07T05:21:58.624040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-07T05:21:58.628042Z","title":"Safe RLHF : Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.628042Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:74a623eba80de4cb90d257769fa9dfe4796b20abbcfa711229ce92605a26ce92","observation_id":"43af2ee8-fb62-4003-a3d9-36fbd6627858","resolution":{"observed_at":"2026-08-07T05:21:58.628042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1206.6404","last_updated":"2012-06-27T19:59:59Z","snapshot_observed_at":"2026-07-06T02:50:47.096675Z","submitted_at":"2012-06-27T19:59:59Z","title":"Policy Gradients with Variance Related Risk Criteria","version":1},"cited_work":{"arxiv_id":"1206.6404","doi":null,"metadata_source":"pith","pith_arxiv_id":"1206.6404","snapshot_observed_at":"2026-08-07T05:21:59.221743Z","title":"Policy Gradients with Variance Related Risk Criteria","venue":"cs.LG","work_id":"21d46410-cd45-470d-ab5e-2342fbad5b04","year":2012},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.631826Z"},"links":{"cited_paper":"/paper/1206.6404","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:2d48f0ce25d7eaf586da28cc0a0043d3612b3be1893eeba86a5653931ba7cb74","observation_id":"d0462d37-6aa5-49ff-b43f-4347a7448210","resolution":{"observed_at":"2026-08-07T05:21:59.225698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03451","last_updated":"2021-07-23T15:05:22Z","snapshot_observed_at":"2026-08-04T17:33:16.934762Z","submitted_at":"2021-07-07T19:25:57Z","title":"Anticipating Safety Issues in E2E Conversational AI: Framework and Tooling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03451","snapshot_observed_at":"2026-08-07T05:21:58.636063Z","title":"Stevie Bergman, Shannon Spruit, Dirk Hovy, Y-Lan Boureau, and Verena Rieser","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.636063Z"},"links":{"cited_paper":"/paper/2107.03451","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:d91fd2640e9cc7efc6ae375c089baaec9f3a5e312db99ca2140f7e46c527d6c5","observation_id":"e182abdc-9e22-47b8-9852-ac3d6f0eb28d","resolution":{"observed_at":"2026-08-07T05:21:58.636063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14387","last_updated":"2024-01-08T04:46:56Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-22T17:55:50Z","title":"AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14387","snapshot_observed_at":"2026-08-07T05:21:58.639987Z","title":"Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.639987Z"},"links":{"cited_paper":"/paper/2305.14387","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:37873435f72e90d3fca776452bce0d32f018108bc9e7213c2549d0bc610684df","observation_id":"e8c042f1-7573-493f-aac2-c9a443c337f4","resolution":{"observed_at":"2026-08-07T05:21:58.639987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.505300Z","title":"Fundamentals of optimization theory with applications to machine learning","venue":null,"work_id":"cb2869a7-2e7f-44d8-949e-f0bc441b1289","year":2019},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.643947Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:3e4246839f10ec5a004f0da079467192b69270822bf86362e50a055530c2dfc9","observation_id":"2f07684d-8a34-45e2-9aaa-acf16bc1838d","resolution":{"observed_at":"2026-08-07T05:21:59.509176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-07T05:21:58.647177Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.647177Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:2c0fe783caad73b0d97108be20ea8d8a98972cd954341b28721e671d7118cab4","observation_id":"16df702a-b512-4412-854f-3cd7bae3fe74","resolution":{"observed_at":"2026-08-07T05:21:58.647177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.494250Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"26883cb7-035f-4e75-aea5-f59a5f782d34","year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.650410Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:c02855f1b754c83ce80e2937fab71d28bd957d3cc53832eef5c98e2de95227a8","observation_id":"3268aad4-55be-4c92-9fa7-318e0e010cf5","resolution":{"observed_at":"2026-08-07T05:21:59.497961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.482378Z","title":null,"venue":null,"work_id":"690d321c-33c0-41d7-9852-723aeaf182db","year":2020},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.653546Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:4329dff2212fe396b71047de7fa7d2ec2e2225aa21f378914cdd4c173091dbfb","observation_id":"94183662-19cc-44e8-b867-3065a1951642","resolution":{"observed_at":"2026-08-07T05:21:59.485906Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.471274Z","title":"Fairness guarantees under demographic shift","venue":null,"work_id":"14199629-b6db-425c-82d8-80cf9704402c","year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.659981Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:5241324f1caae2b12ace6962e1b4c58efb81afdaafdaa90e1ed4095eaea3d5ad","observation_id":"adafa1f0-2f03-4377-afbc-cc0c6935a6eb","resolution":{"observed_at":"2026-08-07T05:21:59.475161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14375","last_updated":"2022-09-28T19:04:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-28T19:04:43Z","title":"Improving alignment of dialogue agents via targeted human judgements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14375","snapshot_observed_at":"2026-08-07T05:21:58.668478Z","title":"Improving alignment of dialogue agents via targeted human judgements, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.668478Z"},"links":{"cited_paper":"/paper/2209.14375","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:f8be40186ee410da750164893813258143c1be40cb02bf5f53b60ea838e7ea70","observation_id":"fb60a32b-e206-4001-9b95-87797be7d16a","resolution":{"observed_at":"2026-08-07T05:21:58.668478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:21:58.671965Z","title":"The Llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.671965Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:e89e14ccf4ded4c9a7d5702b41085ddbc4d55527a5f8e280d84e264394495835","observation_id":"b4fca4c5-6a67-46c0-8bf4-05c628320eea","resolution":{"observed_at":"2026-08-07T05:21:58.671965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09050","last_updated":"2017-11-24T17:14:34Z","snapshot_observed_at":"2026-07-06T06:11:03.450432Z","submitted_at":"2017-11-24T17:14:34Z","title":"Ethical Challenges in Data-Driven Dialogue Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.09050","snapshot_observed_at":"2026-08-07T05:21:58.675367Z","title":"Ethical challenges in data-driven dialogue systems, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.675367Z"},"links":{"cited_paper":"/paper/1711.09050","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:385b2cc5c4164d1d72d8d972f9d53542601084815a9ac376679a4b9562feb819","observation_id":"df3cfe86-df38-4464-b643-b1f6920c81ed","resolution":{"observed_at":"2026-08-07T05:21:58.675367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.679396Z","title":"Probability inequalities for sums of bounded random variables","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.679396Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:16a0d040bbadd70ffb1c5f93167c80ddc251533fe0412bfc7a685164c2e0aed6","observation_id":"d3b9665f-e183-41e6-9990-aaf7b1ae7336","resolution":{"observed_at":"2026-08-07T05:21:58.679396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.452592Z","title":"One-shot safety alignment for large language models via optimal dualization","venue":null,"work_id":"63756f8b-d3cb-4a4d-b05a-5eedbaf2978f","year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.682720Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:dc5c9a66a18cdc0b33ebd862fd7adce918e47de2645edce863c9b14721f8125b","observation_id":"5bf73396-d333-484c-8515-8a597fe4ae00","resolution":{"observed_at":"2026-08-07T05:21:59.456542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-07-06T08:03:53.351060Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-08-07T05:21:58.685785Z","title":"Jones, Shixiang Shane Gu, and Rosalind W","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.685785Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:90f156619bb7dc4029d4da000da2a1f4f502b3c977cf982699fb4db054bfc263","observation_id":"085d504c-bea5-441e-8287-5688ca3b64fa","resolution":{"observed_at":"2026-08-07T05:21:58.685785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.689205Z","title":"Beavertails: Towards improved safety alignment of LLM via a human-preference dataset, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.689205Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:6e03e8fdd871a68a1e5821af5475f5b03ca07e8de2d0b6939c6dd101c98ac7a5","observation_id":"4b85f2f4-dc88-4f8d-a4d0-1933183454bd","resolution":{"observed_at":"2026-08-07T05:21:58.689205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.440866Z","title":"ChatGPT for good? O n opportunities and challenges of large language models for education","venue":null,"work_id":"10ad2070-aa5a-4342-8c0a-6109325561b7","year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.692927Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:cbc936d6dc550c98c7accf78a72e7014b2e32377e1ff46c28527325e57c0c5c4","observation_id":"3a4a982a-e92c-4f25-8552-7c6e80c6392b","resolution":{"observed_at":"2026-08-07T05:21:59.444817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.428091Z","title":"GPT -4 passes the bar exam","venue":null,"work_id":"5a6ef3b2-61d6-4cac-9acc-582fe264a81a","year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.696131Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:ce65fa24cb66aab90f2fabe178f2930a67a241c3ba4a353b6d929aa1cd339078","observation_id":"78efc2c2-f73b-463f-bdd9-560b19c3c745","resolution":{"observed_at":"2026-08-07T05:21:59.432588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.699651Z","title":"Buy 4 reinforce samples, get a baseline for free! In DeepRLStructPred@ICLR, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.699651Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:48f6662a0d7c1cec8c6192b1c2ec65ee640604a1e7a84e099faaf3ced8f6c583","observation_id":"a9a7b0f8-a552-4b74-bd8c-f14dc96d2620","resolution":{"observed_at":"2026-08-07T05:21:58.699651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.409839Z","title":"Kung, Morgan Cheatham, Arielle Medenilla, Czarina Sillos, Lorie De Leon, Camille Elepa \\ n o, Maria Madriaga, Rimel Aggabao, Giezel Diaz-Candido, James Maningo, and Victor Tseng","venue":null,"work_id":"6d97c3af-6240-4720-9922-52e242c13b95","year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.703396Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:d13830c89da59bc96a5a23c17df651875f244bfa6b28b895921a9e3f6f749dac","observation_id":"31cb7100-2d54-4f7c-bc55-069b11578069","resolution":{"observed_at":"2026-08-07T05:21:59.413594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02475","last_updated":"2024-03-04T20:39:24Z","snapshot_observed_at":"2026-07-06T17:39:29.151236Z","submitted_at":"2024-03-04T20:39:24Z","title":"Enhancing LLM Safety via Constrained Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02475","snapshot_observed_at":"2026-08-07T05:21:58.706600Z","title":"Enhancing llm safety via constrained direct preference optimization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.706600Z"},"links":{"cited_paper":"/paper/2403.02475","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:77ba5bd5c051001196661e57d6c1771e2d7869812937bff2d0be38980d42a08d","observation_id":"094a5a8d-af98-4b91-83a0-bad6ed9f6a95","resolution":{"observed_at":"2026-08-07T05:21:58.706600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.397360Z","title":"Offline contextual bandits with high probability fairness guarantees","venue":null,"work_id":"cc6bb730-b0be-4d5c-878b-a0d84d1e8b3d","year":2019},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.710273Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:272299407f9be635fd9299a3981ba3090e386106952b66173aea14c12c9cdb29","observation_id":"00e2e0a5-26c9-4697-956f-4b4fb406a4e0","resolution":{"observed_at":"2026-08-07T05:21:59.401561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.386119Z","title":"Krumholz, Jure Leskovec, Eric J","venue":null,"work_id":"b063e9de-17cb-40f7-b47d-25fdbfc89eb2","year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.713452Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:c6a56e239739f7cefdef1f30839dc4bbd6b1e106387bef02ed9d8d750a82c2ec","observation_id":"fc679d97-1a53-4ad8-b491-8692792fbc38","resolution":{"observed_at":"2026-08-07T05:21:59.389891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.374933Z","title":"Rule based rewards for language model safety","venue":null,"work_id":"0a36fd5b-3b3c-4a86-84dd-9a9d65cdb647","year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.716656Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:122fa6848f3501fe8cc64eec453c970d1b2828044f3ba02d25df2992ce43706e","observation_id":"bce4a920-bc4e-44b7-b7fd-fb5af4712eee","resolution":{"observed_at":"2026-08-07T05:21:59.379311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T05:21:58.720364Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.720364Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:16144abff09c2ba7f3fe95db4303ebaa1cff841f4afc338b3ede7b91067b1998","observation_id":"ce0cb1d9-f734-47cb-b6ed-741e6ad2addd","resolution":{"observed_at":"2026-08-07T05:21:58.720364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19933","last_updated":"2025-02-27T07:28:35Z","snapshot_observed_at":"2026-07-06T19:39:59.961070Z","submitted_at":"2024-10-25T19:08:23Z","title":"Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization","version":2},"cited_work":{"arxiv_id":"2410.19933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19933","snapshot_observed_at":"2026-08-07T05:21:59.022598Z","title":"Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization","venue":"cs.LG","work_id":"3b0bc07a-a5eb-4206-b258-70a0a37531ab","year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.724147Z"},"links":{"cited_paper":"/paper/2410.19933","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:19babe316959db7dbc0eaa047791061e47e1c51983b0f31c0ccf33e70af5e699","observation_id":"08ef3aa0-5ad6-4b8b-a146-bd0f8c20961f","resolution":{"observed_at":"2026-08-07T05:21:59.026775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T05:21:58.727951Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.727951Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:7cac2fa19013295e56d0b258731cca956c15324f774425085e12736b0565f608","observation_id":"f5776140-9477-4cb4-93ed-fd1f3ff2abba","resolution":{"observed_at":"2026-08-07T05:21:58.727951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T05:21:58.731769Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.731769Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:e9b2fc437202703fcbd2b3c0bce5c183905658b6f2ff01b9dc4421cec068bd29","observation_id":"6dba9141-8a58-4692-a9b2-e1d3b097c395","resolution":{"observed_at":"2026-08-07T05:21:58.731769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-07-06T18:25:35.827334Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-07T05:21:58.735489Z","title":"Sikchi, Joey Hejna, Bradley Knox, Chelsea Finn, and Scott Niekum","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.735489Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:9fa51fa66c9667243eb26114784858d91cdeb9e15d70e2528cb1043ee643e552","observation_id":"14082912-204e-42f1-be50-db845eab2700","resolution":{"observed_at":"2026-08-07T05:21:58.735489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.363319Z","title":"Rewarded soups: towards pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards","venue":null,"work_id":"0a7133f1-c2a7-4480-a9e1-0c8970207a00","year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.739826Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:0409eba7225dac9bff947908c555d12340f30cd3cb39b81adebf645cf13d4758","observation_id":"681def66-995e-4f7e-b389-928d39c912c2","resolution":{"observed_at":"2026-08-07T05:21:59.367354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.352355Z","title":"Simultaneous statistical inference","venue":null,"work_id":"814f02c2-a751-422c-b992-72135bde9543","year":2012},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.743188Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:e48a27fd25d16dd5cab098e3b17a2f1d3cbd8c7b57dc35dcaa988ef2720e3342","observation_id":"feb3e995-1e75-40f7-870f-c1a9fbca64fb","resolution":{"observed_at":"2026-08-07T05:21:59.356121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:21:58.746310Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.746310Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:c2b4bce37ada841f1c710f791b4ac4886a8a32c49512fee72a1c965f5e59e415","observation_id":"5fcea960-3005-4e63-bfb7-1b218532842a","resolution":{"observed_at":"2026-08-07T05:21:58.746310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-06T19:18:51.065158Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-07T05:21:58.749826Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.749826Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:64d94b0f359289f4b6f149fc064ee879547e02ff74ff6a4e209ce12f30e2ee05","observation_id":"0425a0d8-0177-4019-85af-d75be4267884","resolution":{"observed_at":"2026-08-07T05:21:58.749826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.341161Z","title":"The probable error of a mean","venue":null,"work_id":"ede8b247-a754-4f3f-b88e-1d1c447d37a6","year":1908},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.753669Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:d2fa07c7c159ca42cad6b1876caac1ab644ebdb0a1ed3b423a382dd37c48108f","observation_id":"449cef09-448b-4918-8f7b-1c2c972aa1c0","resolution":{"observed_at":"2026-08-07T05:21:59.345555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11555","last_updated":"2025-02-17T08:40:30Z","snapshot_observed_at":"2026-08-07T18:13:19.634959Z","submitted_at":"2025-02-17T08:40:30Z","title":"Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11555","snapshot_observed_at":"2026-08-07T05:21:58.756875Z","title":"Equilibrate RLHF : Towards balancing helpfulness-safety trade-off in large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.756875Z"},"links":{"cited_paper":"/paper/2502.11555","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:5438837148405fa4f0296d1b3e8a607e32b857ece4624b4b8115c5b0cd377a67","observation_id":"7de895b4-008b-4581-abd2-f98f8bea42bc","resolution":{"observed_at":"2026-08-07T05:21:58.756875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.760319Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.760319Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:a5722d5f4ae3b45407a6f151e76a41278fae3139ca24abf38cb4dce84de2c832","observation_id":"5fc9254e-270a-4133-9587-da6866bd2b74","resolution":{"observed_at":"2026-08-07T05:21:58.760319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.323874Z","title":"Preventing undesirable behavior of intelligent machines","venue":null,"work_id":"04c6cc69-d7b8-4562-94bb-63e179a054df","year":2019},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.763641Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:d8901310fd467d35c8d8eafca805ce026067e9c994f240e17111763592478d54","observation_id":"d515259b-92f9-4ecb-b751-de47abce81f2","resolution":{"observed_at":"2026-08-07T05:21:59.327648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-07T05:21:58.767276Z","title":"Lamda: Language models for dialog applications, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.767276Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:08730c7b4e73019093a05300bfd2ea7049a411b7dcb971163ddd4c8e403aea2e","observation_id":"64dc4375-c341-49e2-8d1f-aa55230916cd","resolution":{"observed_at":"2026-08-07T05:21:58.767276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T05:21:58.770901Z","title":"LlaMa 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.770901Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:da87745827f3bd7eaa44b25b024851b47f04380aed1061c43c405eb84918299f","observation_id":"c6401466-52e9-49e9-8e0b-1907d3b73769","resolution":{"observed_at":"2026-08-07T05:21:58.770901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.312446Z","title":"Tran, Rei Sato, Takumi Tanabe, and Youhei Akimoto","venue":null,"work_id":"2f9ce317-e20c-4770-b6d0-7ddb3d3416a6","year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.774310Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:0402d7d514024384ab3ebfd73b08ba69f377b3b391c4bc313ff7fb0822e9c8b1","observation_id":"ce9dc7c0-7761-480a-a53a-8b110137fd31","resolution":{"observed_at":"2026-08-07T05:21:59.316321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11744","last_updated":"2022-08-24T19:14:56Z","snapshot_observed_at":"2026-07-06T13:45:11.872750Z","submitted_at":"2022-08-24T19:14:56Z","title":"Enforcing Delayed-Impact Fairness Guarantees","version":1},"cited_work":{"arxiv_id":"2208.11744","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.11744","snapshot_observed_at":"2026-08-07T05:21:58.928821Z","title":"Enforcing Delayed-Impact Fairness Guarantees","venue":"cs.LG","work_id":"af2b4996-df42-4530-b709-d7208ec13829","year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.778283Z"},"links":{"cited_paper":"/paper/2208.11744","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:c591f542fde24768ec189f210212dc2873295030ff3676214f0907aea635ba01","observation_id":"46904a93-d126-448b-ac6c-959027d47ce8","resolution":{"observed_at":"2026-08-07T05:21:58.932492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-07T05:21:58.781959Z","title":"Ethical and social risks of harm from language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.781959Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:a8afd0e7ccf0c7f9f5ec76ca1402ef93e6044eec3fb0c4dfef7088e06b1d92ca","observation_id":"5b6357af-c971-41de-9d6a-10a85f23d23e","resolution":{"observed_at":"2026-08-07T05:21:58.781959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.785508Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.785508Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:5665804e5502e6bb9c96d04c0866c2a0d915d2a718ba1d98cac2f0b42da091be","observation_id":"367a0044-733d-4030-86de-d0ac856dc876","resolution":{"observed_at":"2026-08-07T05:21:58.785508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07079","last_updated":"2021-08-04T21:33:39Z","snapshot_observed_at":"2026-08-06T19:00:21.027890Z","submitted_at":"2020-10-14T13:26:39Z","title":"Recipes for Safety in Open-domain Chatbots","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07079","snapshot_observed_at":"2026-08-07T05:21:58.788856Z","title":"Recipes for safety in open-domain chatbots, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.788856Z"},"links":{"cited_paper":"/paper/2010.07079","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:fd821bfeaeec57a4d5f1899efe4f45e12e6cb3eea03499abe45f061093dc21b9","observation_id":"17688df0-e3b8-42e0-91ee-ffcc0610464f","resolution":{"observed_at":"2026-08-07T05:21:58.788856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T05:21:58.792512Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.792512Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:18e646c43e79ffa5174cf03b863ebb46d70dc5df1edda3649f03a498d734bb69","observation_id":"215d5810-a9fe-434f-b1cf-63c3a55c3b00","resolution":{"observed_at":"2026-08-07T05:21:58.792512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.293414Z","title":"A large language model for electronic health records","venue":null,"work_id":"3ec39c4b-484e-4779-9741-49ab1852cdfd","year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.796231Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:b24a06da747948d65b48d9c9ab1c057d744c65dfa7155479b4eca93063c17dd5","observation_id":"3e7ecda3-d383-418a-9fd8-e16ffa389a83","resolution":{"observed_at":"2026-08-07T05:21:59.298310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15313","last_updated":"2025-04-08T11:04:33Z","snapshot_observed_at":"2026-07-06T19:06:45.969497Z","submitted_at":"2024-08-27T17:31:21Z","title":"Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models","version":2},"cited_work":{"arxiv_id":"2408.15313","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.15313","snapshot_observed_at":"2026-08-07T05:21:58.879423Z","title":"Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models","venue":"cs.AI","work_id":"f54b8ab8-6ac2-40d4-9905-58efe3cb3e81","year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.799911Z"},"links":{"cited_paper":"/paper/2408.15313","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:8e741834b9936f9a14b54912590a03c53e8838aa3c95935d658ea249d2128975","observation_id":"f8037334-eadc-4a1f-8d46-ec3f0acf2601","resolution":{"observed_at":"2026-08-07T05:21:58.886951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-07T05:21:58.803923Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.803923Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:87d5b7c04e55e58d6e516c65bd38b6a084d38722ce684f118655b829ce0655ac","observation_id":"373be2dd-3351-4c21-85a9-93d010d415bf","resolution":{"observed_at":"2026-08-07T05:21:58.803923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04964","last_updated":"2023-07-18T08:44:47Z","snapshot_observed_at":"2026-08-07T18:08:01.409989Z","submitted_at":"2023-07-11T01:55:24Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04964","snapshot_observed_at":"2026-08-07T05:21:58.808116Z","title":"Secrets of RLHF in large language models part I : PPO","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.808116Z"},"links":{"cited_paper":"/paper/2307.04964","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:3af389f87d4a831335c96e71aabeeb9b98c32afaa03fc10d5e25839577e8aa65","observation_id":"4e532ecc-f56f-4b18-b185-9ca210e2b8c5","resolution":{"observed_at":"2026-08-07T05:21:58.808116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01663","last_updated":"2022-11-10T01:02:29Z","snapshot_observed_at":"2026-08-07T11:16:05.200996Z","submitted_at":"2022-05-03T17:50:06Z","title":"Adversarial Training for High-Stakes Reliability","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01663","snapshot_observed_at":"2026-08-07T05:21:58.812008Z","title":"Ziegler, Seraphina Nix, Lawrence Chan, Tim Bauman, Peter Schmidt-Nielsen, Tao Lin, Adam Scherlis, Noa Nabeshima, Ben Weinstein-Raun, Daniel de Haas, Buck Shlegeris, and Nate Thomas","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.812008Z"},"links":{"cited_paper":"/paper/2205.01663","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:62673305ee5a84968fcf7fd7742068e90350ec3e7ade30a1bb407a83a9192563","observation_id":"8ba6c1c8-f416-430f-a4e4-1450569e1f9a","resolution":{"observed_at":"2026-08-07T05:21:58.812008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.815824Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.815824Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:71536d7e2806b41f01ee29636b27de22031b592e3a76261d2525b3b14245459e","observation_id":"f98a0e96-415d-4e86-9bf3-5e8cacb70470","resolution":{"observed_at":"2026-08-07T05:21:58.815824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:12:42.307191Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":4,"verified_fuzzy":17},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 3 inbound Pith citation observations for arXiv:2506.08266."}