{"as_of":"2026-08-06T11:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:72efdaed7609a015ca297826c4338b14bf84f84ba85ecae02a3d8839e9ac9b52","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T00:27:39.321158Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.04477/citation-record","integrity":"/paper/2605.04477/integrity","json":"/paper/2605.04477/citation-record.json","paper":"/paper/2605.04477"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.784889Z","title":"Abbasi-Yadkori, D","venue":null,"work_id":"8fe165ae-2348-4194-93b3-3aff04f6400b","year":2011},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:2ccb86c51e5e9b6c9e3cdb5f4c0bb3dd393ac7c338a1704885ddf837a59adcf1","observation_id":"ac52137f-0dfd-4b70-ba0a-5242fd9060fa","resolution":{"observed_at":"2026-07-07T08:43:28.785978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1102.2670","last_updated":"2011-02-14T04:06:31Z","snapshot_observed_at":"2026-07-06T02:23:26.911229Z","submitted_at":"2011-02-14T04:06:31Z","title":"Online Least Squares Estimation with Self-Normalized Processes: An Application to Bandit Problems","version":1},"cited_work":{"arxiv_id":"1102.2670","doi":null,"metadata_source":"pith","pith_arxiv_id":"1102.2670","snapshot_observed_at":"2026-07-04T08:39:41.739681Z","title":"Online Least Squares Estimation with Self-Normalized Processes: An Application to Bandit Problems","venue":"cs.AI","work_id":"5b17a5a1-3e93-484f-99ae-97134a3aa134","year":2011},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"cited_paper":"/paper/1102.2670","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:92fcf5dc5f3be62eacb58303de56f073e5f793c20b5ad865d1b09239177a89b0","observation_id":"8d2f0328-4118-4919-88fb-c3732ed2f9f9","resolution":{"observed_at":"2026-07-01T00:35:10.418229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.795323Z","title":null,"venue":null,"work_id":"0868b980-1080-41e5-b73c-2278f691432f","year":1995},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:9def772efa29245707573aea737899cf65a97ef4c9c63929d9b514b78834238f","observation_id":"66a85e3f-1c65-4521-8204-01fc191a02e6","resolution":{"observed_at":"2026-07-07T08:43:28.796424Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.795638Z","title":null,"venue":null,"work_id":"70161aef-2707-4b41-84be-b536e6d5679d","year":2002},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:fb46d1574879ca556be40b6d6fa71e35b12a5cb28e7aa3f1bb6f2c42e57ee3f3","observation_id":"7b97dbb8-36ec-4ea5-be3b-368108431a23","resolution":{"observed_at":"2026-07-07T08:43:28.796828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.777822Z","title":null,"venue":null,"work_id":"9a6b6ff1-20e4-46de-9d2d-c50a7b2deb7f","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:805dc2ee12b3dcc08e72c86bfc2e288d8fd2dd9b47987fb7c9363d424fef4a78","observation_id":"59201b32-1257-40de-88fe-897dc28932cf","resolution":{"observed_at":"2026-07-07T08:43:28.778932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":"2402.14762","doi":"10.48550/arxiv.2402.14762","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MT-Bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":"arXiv (Cornell University)","work_id":"759d28e6-9f1c-4043-a34b-2ddfd671d288","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:6f45bdde5cbc2a42507ca6f661742342130597543347e8d3e06ab1a791d031f1","observation_id":"66ea7f5d-b4a0-4328-a510-91626b9c075a","resolution":{"observed_at":"2026-07-01T00:35:10.421147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.791723Z","title":null,"venue":null,"work_id":"4d1cdd4b-f90a-4515-88ba-1e09320f8489","year":1952},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:be5a7a592740a9e01bda195a1f95ff80f1c5229ec59faa0773741bec97cd5299","observation_id":"7a9fdac5-4d95-473d-bd4a-9286626ed371","resolution":{"observed_at":"2026-07-07T08:43:28.792798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.790419Z","title":null,"venue":null,"work_id":"fb353480-a924-40b2-9703-1711f7f17da7","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:6c56ee3edf25cfef2329958608cb83c6e201ae484b6b187ad97f52b56820759b","observation_id":"90272d87-abbb-4d79-8a22-333ef821c809","resolution":{"observed_at":"2026-07-07T08:43:28.791510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.779707Z","title":null,"venue":null,"work_id":"6c1e5c52-afe0-4e36-8d05-8c02a9dcd01c","year":2025},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:5c9f04b8b37722289a33171e5d0a76deaf773e416c43e632efc39814eb9600e5","observation_id":"9efe4dd6-a8ed-4ecf-9bd2-3fe5f8687293","resolution":{"observed_at":"2026-07-07T08:43:28.780933Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.783210Z","title":null,"venue":null,"work_id":"84b5a75c-d9b3-4e48-ab2a-3b1c36cf87a0","year":2017},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:a809463cc22b38579ed5932bfe6c6d068fed1b7c17db3d297ce0ba0573494b78","observation_id":"b79f5054-d602-481f-b0c5-e88b6c475db9","resolution":{"observed_at":"2026-07-07T08:43:28.784289Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:c3326e19c46a2dba547390d01fa0870177ab200f1ad1a6492b752042890370c5","observation_id":"1cfbeb39-5772-4cf1-87ff-b161addf6b30","resolution":{"observed_at":"2026-07-01T00:35:10.415630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.788066Z","title":null,"venue":null,"work_id":"473ca6e1-cf11-4609-bc27-f63547f3cce8","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:87d232c83a8f3dc833da81feb409e7acb17345d1320b408b5bce77978d2463ef","observation_id":"1f482ad3-ca24-4ceb-b281-713a95ec8b78","resolution":{"observed_at":"2026-07-07T08:43:28.789130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":"2404.04475","doi":"10.48550/arxiv.2404.04475","metadata_source":"pith","pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","venue":"cs.LG","work_id":"ef25adcf-addb-445e-b3b5-858eeb9883ca","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:69f8bb95308d5f14f68a740d0cabcae9724d88f57ef3c8875959fc5e975c27ff","observation_id":"46b304d5-ee22-4ca3-954b-a6aa53e05467","resolution":{"observed_at":"2026-07-01T00:35:10.421157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.797405Z","title":"Dwaracherla, S","venue":null,"work_id":"acc719a4-9281-475f-8175-81fa4e71ea77","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:b20a3653107a47a987a404537adc0b3a8f56e837f5328797bbd11cc08479f2e6","observation_id":"7c9527d3-0653-49f7-a9f0-54ffaa087035","resolution":{"observed_at":"2026-07-07T08:43:28.798501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-07-06T17:26:47.184846Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:d75a66fa49cb38b87afeb1b0088ae9c695358364750c23b5f8fd5509b47b715a","observation_id":"1a5303a5-7923-4d03-9a3c-e3cf9e802322","resolution":{"observed_at":"2026-07-01T00:35:10.418679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.772942Z","title":"Hendrycks, C","venue":null,"work_id":"2b3a5e4a-4ced-4890-8ac2-64c9fc6ac04c","year":2021},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:56a4f8c659964089b56726bb3ee1fe1b200d7b45d004784ae253c3f282d758a2","observation_id":"b14ac81c-580e-4e83-a32e-a52c9ba14453","resolution":{"observed_at":"2026-07-07T08:43:28.774075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.793827Z","title":null,"venue":null,"work_id":"d240af79-305a-49b0-89c4-c0091f51b549","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:cf6670276254a2535103cd9a4ddc2ba7095d4f5930432008a3f5a83644fda4fe","observation_id":"e7db404c-5e41-4dd2-b6dc-774931c8b50d","resolution":{"observed_at":"2026-07-07T08:43:28.795110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.781366Z","title":null,"venue":null,"work_id":"979fd9de-4135-4213-921d-184d5b8b5643","year":1985},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:bac69bef80d0bdb143777a721b5d02bee036ab7a04eb99811d3af221df934373","observation_id":"724e391a-7667-4e6b-9198-de01403f8f90","resolution":{"observed_at":"2026-07-07T08:43:28.782442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.783032Z","title":null,"venue":null,"work_id":"b9b8e2a4-3493-456e-b46e-67b7a38ed08e","year":2010},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:56faf46aacbdbbe8a3a08d4ed028e21fd46667b2fcb2f30102a4ee6e1b93f164","observation_id":"fe4aadb7-74b9-4a75-92f4-54b29626623d","resolution":{"observed_at":"2026-07-07T08:43:28.784100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.778029Z","title":null,"venue":null,"work_id":"9c953bec-7126-4929-a0de-94d5d1304aea","year":2025},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:7ef69733492a4a11941b36eb04b314effe3c6f433e247d79f88fffd5b2e49b53","observation_id":"5444e995-32b5-4ee4-915a-1eec75cef248","resolution":{"observed_at":"2026-07-07T08:43:28.779135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.751323Z","title":null,"venue":null,"work_id":"e1ef80d7-2a08-4313-a639-18c5b8d71abf","year":2006},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:c7ea7422a9996da8bf763cecd3117b83fd6b8dcf36ebb63a5e5722e1f191fd86","observation_id":"d431dc00-ee7e-4d9b-86dc-7367b19acf20","resolution":{"observed_at":"2026-07-07T08:43:28.752413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.745733Z","title":null,"venue":null,"work_id":"d11dbbb2-559f-4015-93a2-c08b5aa77faa","year":2022},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:53dca596ebebc5a20db79bf079456399a1288152e448ad8041e93fee4cd6bce3","observation_id":"68dddbd1-720d-40d7-af77-7963577cb0b1","resolution":{"observed_at":"2026-07-07T08:43:28.746772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.781506Z","title":null,"venue":null,"work_id":"cd6106ca-03c3-45e9-a845-2554b85b20bd","year":2025},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:22669f323625a1879c4daae3118314d5c109e15ab31c46d66fdd781ca137d4da","observation_id":"3b3419c9-0a24-4988-93c5-61ab5f6ce848","resolution":{"observed_at":"2026-07-07T08:43:28.782635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.786429Z","title":"Ouyang, J","venue":null,"work_id":"1fc5fa27-0ef9-441c-85d3-7a828bd414a2","year":2022},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:ce873e3a811ab87d40d3aa7951eb9f5b494fc20ebd95ad918d83177ddb7e569c","observation_id":"528f463a-61e5-4873-83e7-e6c332bcc039","resolution":{"observed_at":"2026-07-07T08:43:28.787447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.776544Z","title":"Rafailov, A","venue":null,"work_id":"d440e27e-db9a-4f27-88f9-ab1e1c0f7305","year":2023},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:9c30e214053015d5f0b3b478ce4c729353ea28f69fb571aa959afff13f808d26","observation_id":"6124bd09-3912-4a28-8d51-701fbf7b9fed","resolution":{"observed_at":"2026-07-07T08:43:28.777526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.784747Z","title":null,"venue":null,"work_id":"0ad6e508-3865-4fe9-b0c7-f9e130169ae6","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:2afb16767ca067289b3cfdcbb8a7e603931fc0b8cd02ccd9c9df76c081879803","observation_id":"5157bf7e-6766-43e0-9d5f-8b6426faa818","resolution":{"observed_at":"2026-07-07T08:43:28.785810Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:add6de7e055f010bf4ba3f9a7ef0b5c393f5ff82060f87394a07584f0d1565b2","observation_id":"a8e835f5-b00a-45b1-9e56-e379ddcbcfe4","resolution":{"observed_at":"2026-07-01T00:35:10.423898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.756998Z","title":"Sherman and W","venue":null,"work_id":"f86a5ae7-e10f-4eca-9a5b-45d562d3d681","year":1950},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:f7dec018949b1d8d1fd6ee380085cf0b873a13198f88d6483b2c3a662f18f4ce","observation_id":"a70acb00-a1dc-45e2-9587-e5226f3a5188","resolution":{"observed_at":"2026-07-07T08:43:28.758420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.786583Z","title":null,"venue":null,"work_id":"d1984491-e0e5-4f51-b3ab-38c21e79c622","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:c912e028c9bcf5ebee90b3e293fcd0db07413831eba408476896a71f8e37286a","observation_id":"9bd38557-1297-4da1-8826-c588fb31939f","resolution":{"observed_at":"2026-07-07T08:43:28.787643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:06d8c686f148e2d3402a6bfac47d78afc0720fd3c9f583267cb3e8f3b1dcf821","observation_id":"147d0e39-30c0-4dd4-aa95-3b3d87ae0173","resolution":{"observed_at":"2026-07-01T00:35:10.413107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-04T10:08:59.188374Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":"2510.11686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-07-16T02:22:28.823656Z","title":"Representation-based exploration for language models: From test-time to post-training.arXiv preprint arXiv:2510.11686","venue":null,"work_id":"d87f359a-d84a-4789-a7ba-032baf0f3636","year":2025},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:dd8b8dfbf928f353054d80af9e4e6492c9309e060902037f0d00ae4ae00e8627","observation_id":"dfdd086b-4452-41ad-96de-66c7666fd2de","resolution":{"observed_at":"2026-07-16T02:22:28.823656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.760345Z","title":null,"venue":null,"work_id":"3982d42e-179f-4c8e-bf42-ee7c6164dab9","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:a5c47196c35d1f4e0051a23ff2595bf4d6794d509d6e2ce7c0b1504521987e0b","observation_id":"00237546-cee1-417e-8e8f-c4d121cbf96d","resolution":{"observed_at":"2026-07-07T08:43:28.761434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.769416Z","title":null,"venue":null,"work_id":"88edfca8-1dfc-4bae-814c-853e50f51db9","year":2026},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:129ac04119838d1487976ff8f69e418539291d031f6aee8027b63f5c75b169de","observation_id":"507e69ee-2fcf-496e-9aa6-a591109b1581","resolution":{"observed_at":"2026-07-07T08:43:28.770518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.788653Z","title":null,"venue":null,"work_id":"9532eb80-0d9b-4ca0-bc04-1cda67e8f12e","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:04a8d30b6bd863da7892872960c138af7de1182e9a951f499df139b659eb0426","observation_id":"cd512669-f46d-4609-8894-6fad6d930528","resolution":{"observed_at":"2026-07-07T08:43:28.789832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.770972Z","title":"Xiong, C","venue":null,"work_id":"c5a44631-271d-4386-a92c-675892bad684","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:c33b9d62f2fcbf427e58aa530759dd9ae79ea35d242a137a6cf04beff5d49a1a","observation_id":"011847c1-0ac6-4c7a-aea4-405c0aca7de3","resolution":{"observed_at":"2026-07-07T08:43:28.772066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19332","last_updated":"2024-11-05T07:21:18Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:59:07Z","title":"Self-Exploring Language Models: Active Preference Elicitation for Online Alignment","version":3},"cited_work":{"arxiv_id":"2405.19332","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19332","snapshot_observed_at":"2026-07-01T00:35:10.408592Z","title":"Zhang, D","venue":null,"work_id":"9d430286-aaad-418f-a20d-6c64282dd194","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"cited_paper":"/paper/2405.19332","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:193307f30e935a44409e8b09ba15bbee6da6361732fba726ccae14d003cbed8e","observation_id":"982bf544-798f-40b6-b81c-1003b1591837","resolution":{"observed_at":"2026-07-01T00:35:10.410391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.776087Z","title":"Zhang, H","venue":null,"work_id":"e5efb7a6-197b-41a7-a305-a94372c32208","year":2026},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:5684629c01889afc5d9f2793ac3b83a06ec40f8072d312d628d1996cbbca6cd2","observation_id":"bf74eceb-12de-4c8e-bcff-d0a127d82a6d","resolution":{"observed_at":"2026-07-07T08:43:28.777130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.792095Z","title":"Zhang, S.-A","venue":null,"work_id":"2f729fb1-d470-42cc-8bb4-9a81feccd173","year":2025},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:ddc78c47fe03df9c8ad0b135fc141945cc7cee1f7d4a83c061d77ce0e9b0441c","observation_id":"a34848c7-db17-4966-bfdf-1ae8fd5908ea","resolution":{"observed_at":"2026-07-07T08:43:28.793228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.753424Z","title":null,"venue":null,"work_id":"4b48de45-4719-4eb2-87b8-72fd35265979","year":2026},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:882214038ce49e42ecc516e079180fe50cb4403b2ea34de60f84314ee5ef8728","observation_id":"04cdc8d3-3859-4aaa-a0d2-d389120ca9a6","resolution":{"observed_at":"2026-07-07T08:43:28.754696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:b831b10f5cb1030f2ca3b772a355da44a75000cc2035c6e4ee64d127b99ba1a4","observation_id":"754f1ef1-1628-4e0b-b4f3-c6b36a820e0c","resolution":{"observed_at":"2026-07-01T00:35:10.407105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:43:28.772599Z","title":null,"venue":null,"work_id":"e11bf7a9-52a6-4845-8260-587dcb3ef0a1","year":2025},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:c78d28e2e69da0763f11efe3f5f2b7729fa4238939d63b703ef51498788b3ee1","observation_id":"94b7afdb-a103-4396-80ad-e6776af0e48f","resolution":{"observed_at":"2026-07-07T08:43:28.773665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":10,"verified_fuzzy":9},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2605.04477."}