{"as_of":"2026-08-23T10:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd17152ed52e2ccd9adae62d61ec3cdeb40eaf61bab096966f06248e9dcb0e1c","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:21:37.480991Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:50:28.097413Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:59:40.158119Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11463","snapshot_observed_at":"2026-08-16T11:50:28.097413Z","title":"Curiosity- driven reinforcement learning from human feedback,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-18T07:29:47.820993Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.097413Z"},"links":{"cited_paper":"/paper/2501.11463","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:cd8791acd49a1af511c9156c4591e019ed36b4fc32a32bf966175ee5cf819b37","observation_id":"c1f33125-130b-4524-aa1c-2a2cadc76e4a","resolution":{"observed_at":"2026-08-16T11:50:28.097413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11463","snapshot_observed_at":"2026-08-05T11:56:55.153630Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02170","last_updated":"2025-09-03T10:39:50Z","snapshot_observed_at":"2026-08-12T22:56:39.509645Z","submitted_at":"2025-09-02T10:22:46Z","title":"Avoidance Decoding for Diverse Multi-Branch Story Generation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T11:56:55.153630Z"},"links":{"cited_paper":"/paper/2501.11463","citing_paper":"/paper/2509.02170"},"observation_digest":"sha256:77019088c6757aea72b6f418db05f6d3e07ef7e9b92e4c624484ab7bf800b577","observation_id":"67b78455-0897-42a2-acf6-43fce24cef22","resolution":{"observed_at":"2026-08-05T11:56:55.153630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11463","snapshot_observed_at":"2026-08-03T01:05:26.423214Z","title":"Curiosity-driven reinforcement learning from human feedback.arXiv preprint arXiv:2501.11463,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-15T18:55:19.443984Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.423214Z"},"links":{"cited_paper":"/paper/2501.11463","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:aad89591c5934e3c9e7e7c13014e415e3aa968799c17aa35f2a55f277408c5dc","observation_id":"8ba30e36-23e4-44aa-bc17-7e45b0c1344d","resolution":{"observed_at":"2026-08-03T01:05:26.423214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":"2501.11463","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.11463","snapshot_observed_at":"2026-07-04T07:59:40.158119Z","title":null,"venue":null,"work_id":"c9cadc4e-a747-4aee-8cfb-bfa098c32fec","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-08-15T21:55:25.625601Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":187,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2501.11463","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:416d654aec9d59452becf96af06406b29bc639205ea574626749b37f3304cf24","observation_id":"3383f364-3f79-4012-bfb2-90f49dbc3e79","resolution":{"observed_at":"2026-07-04T07:59:40.159435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.11463/citation-record","integrity":"/paper/2501.11463/integrity","json":"/paper/2501.11463/citation-record.json","paper":"/paper/2501.11463"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-10T18:21:37.279408Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.279408Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:53256e593040cd997035bce650e568288ab74af7d888391293a47d14374470e9","observation_id":"75aaf1dd-d8b1-4051-8a58-6cb50b6fb916","resolution":{"observed_at":"2026-08-10T18:21:37.279408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-10T18:21:37.283993Z","title":"Brown, Jack Clark, Sam McCandlish, Chris Olah, and Jared Kaplan","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.283993Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:28f737621d9b51d71345d50b9c3d51207a1041187d57d0fb9819228e16f42d20","observation_id":"2b448799-681c-4306-a1f4-1edc01ff7d79","resolution":{"observed_at":"2026-08-10T18:21:37.283993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-10T18:21:37.288709Z","title":"Brown, Jack Clark, Sam McCandlish, Chris Olah, Benjamin Mann, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.288709Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:30e63c1981455e25cb9195ac3a87dcfa4da0c9c89a23641132116c976d18f557","observation_id":"23a26cf7-86d9-44bf-b0bf-abff340a0304","resolution":{"observed_at":"2026-08-10T18:21:37.288709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:38.043259Z","title":null,"venue":null,"work_id":"7b520eb9-814b-4300-82f6-78cab688958f","year":2016},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.293220Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:6724121feac98cfe2607d663f54852905c5ad61b9900223adc683ce36f7a9cf1","observation_id":"48ae12b7-7a43-412d-897b-15367a132529","resolution":{"observed_at":"2026-08-10T18:21:38.046913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13032","last_updated":"2023-12-07T19:56:21Z","snapshot_observed_at":"2026-08-16T14:50:45.640595Z","submitted_at":"2023-10-19T12:13:58Z","title":"Quality-Diversity through AI Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13032","snapshot_observed_at":"2026-08-10T18:21:37.297140Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.297140Z"},"links":{"cited_paper":"/paper/2310.13032","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:8494ded421c83c6433529c5f71123b89e99d6fd51c7bd2f81adeecbfc0ed7545","observation_id":"f2faac84-9df4-4bec-aa82-43928cf6a9f8","resolution":{"observed_at":"2026-08-10T18:21:37.297140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:38.032355Z","title":null,"venue":null,"work_id":"f0a87402-43fa-4600-b46b-c25a7b9b95f4","year":2019},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.301476Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:cf76556e10dc8c7e26c024328716531f4176a24b821d9e9f4dedc263d89ff8fa","observation_id":"9e50ef19-dd91-4319-a18b-3e5a0390f9a4","resolution":{"observed_at":"2026-08-10T18:21:38.035978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:38.021844Z","title":null,"venue":null,"work_id":"2b2c945b-43c9-4e6b-92c6-b08eb614b880","year":2019},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.305587Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:bf7f93b63c75dfeb685541a4df93ade1a53cb77137f239b6bf7a967ecd0ee7a0","observation_id":"666cd16a-1fb7-4351-a0a0-c78a4cfa3bed","resolution":{"observed_at":"2026-08-10T18:21:38.025470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07792","last_updated":"2022-12-15T17:38:58Z","snapshot_observed_at":"2026-08-16T16:24:07.071093Z","submitted_at":"2022-10-14T13:21:33Z","title":"Robust Preference Learning for Storytelling via Contrastive Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2210.07792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07792","snapshot_observed_at":"2026-08-10T18:21:37.711937Z","title":"Robust Preference Learning for Storytelling via Contrastive Reinforcement Learning","venue":"cs.CL","work_id":"23b4aaa5-b2fe-425e-aea3-21ebd7a3c1dd","year":2022},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.309364Z"},"links":{"cited_paper":"/paper/2210.07792","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:4bc6cdc5fc8cacd4226fd9223173d6adacb0ba26671222f9009fc2b7fd17eba3","observation_id":"c9bdcca6-4cd8-4dbb-99c0-759070e88f8a","resolution":{"observed_at":"2026-08-10T18:21:37.718099Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02743","last_updated":"2025-02-14T23:02:03Z","snapshot_observed_at":"2026-08-16T13:12:51.615126Z","submitted_at":"2024-10-03T17:55:13Z","title":"MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02743","snapshot_observed_at":"2026-08-10T18:21:37.313259Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.313259Z"},"links":{"cited_paper":"/paper/2410.02743","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:95b31065675e9e1be1b69b78960fe9f678bd8d5e44ee568760b9dc9fdb02700c","observation_id":"f1dda98a-c9c6-40e0-9824-1d24df36789d","resolution":{"observed_at":"2026-08-10T18:21:37.313259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.317295Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.317295Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:ed354492f4b983a38acbb461cee3f08fa5bf954b94e92e8ff3a0cb1ae1a756c6","observation_id":"5ebe5560-1554-4741-9855-523088a1fb29","resolution":{"observed_at":"2026-08-10T18:21:37.317295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:38.010605Z","title":null,"venue":null,"work_id":"066cec08-072e-4b2a-b62a-2136a3577b91","year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.321244Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:4d988bc82e90d8b723cb5662de47a18991b93108f99578f03fc9d962bb84c1eb","observation_id":"0ea5b238-dd95-4fb4-8867-54af34ec5c3f","resolution":{"observed_at":"2026-08-10T18:21:38.014432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.324892Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.324892Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:6fc9f575583ed5e7598fcfb8e1a2058f50c48900c240af80c88457ef299a085e","observation_id":"842d757c-ead6-4c2d-8ce0-a471e3e31bc0","resolution":{"observed_at":"2026-08-10T18:21:37.324892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-10T18:21:37.328315Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.328315Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:8fc898c030186e9e569a34e6ece531d827d6917d8811fc0fa8048a15b54b2402","observation_id":"fbeb767d-7f03-4b23-a49c-a90dbf7d9824","resolution":{"observed_at":"2026-08-10T18:21:37.328315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.991674Z","title":null,"venue":null,"work_id":"838d1464-7ae4-4667-b984-30c9bd35d1d4","year":2023},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.332092Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:e7ddd726039b1618185ffc21ba403e41aeba1cecb0918304cb18f353ed875b45","observation_id":"6585c1d5-7de4-4f01-91df-cf180f67d474","resolution":{"observed_at":"2026-08-10T18:21:37.996522Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T18:21:37.335631Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.335631Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:459d53d47533615d253afd8a7996fb718847447cd2529b5436bebdfcafff21cf","observation_id":"5e36b825-d1cf-4589-9f7b-27b6dede4d57","resolution":{"observed_at":"2026-08-10T18:21:37.335631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.980535Z","title":null,"venue":null,"work_id":"b91d1220-c5fe-46cc-9f71-9b38f916f1b4","year":2023},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.339234Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:89ca4ce4cc54d4ea7ef8e5cddee8bf33c47131bce11fecf882e4d23028ada2fd","observation_id":"39dea6f4-620d-4b49-a5b4-3a966585eaa4","resolution":{"observed_at":"2026-08-10T18:21:37.984444Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.969378Z","title":null,"venue":null,"work_id":"f26d2fec-9c14-452f-98f3-72c507506302","year":2018},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.342916Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:1638ea93d4c0d0bca26b61d7a1d80cf8f304521f1546a6a4a9801efffb0a7773","observation_id":"18c92a1c-b7ba-4152-a81c-b2cac710e41e","resolution":{"observed_at":"2026-08-10T18:21:37.973341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.957799Z","title":"Glass, Akash Srivastava, and Pulkit Agrawal","venue":null,"work_id":"29670c40-ed72-44af-90e9-486bb033e4db","year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.346335Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:7705a22758498220edc9078ac01f610ff74bb4eb6ff6521ecf5405a56dde6127","observation_id":"1ecc97d1-0f34-4502-80d3-321822372c27","resolution":{"observed_at":"2026-08-10T18:21:37.961763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.351065Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.351065Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:0c03a73e9e6ac2c94f27cd36e7dfe2bec8d481bcf297833f146cf3e7911bc1c4","observation_id":"b51389eb-5a07-410e-899b-9d179eee7150","resolution":{"observed_at":"2026-08-10T18:21:37.351065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.938877Z","title":null,"venue":null,"work_id":"a0358b83-dfd4-4c43-aed6-6fac04737ff1","year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.354487Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:051093c1523ce9404c4d110c28eefc3aba67af074adae18b76aac72d4c0f504c","observation_id":"6413a6cc-e154-43e1-8836-14f1a8c47f90","resolution":{"observed_at":"2026-08-10T18:21:37.942518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.357924Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.357924Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:4492620ec4c261f4c2900b83df9dbca2e6ada76ddbbf821aab45246580bcc417","observation_id":"125e65f3-5493-4cb3-96fd-4659e6c2d048","resolution":{"observed_at":"2026-08-10T18:21:37.357924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.361373Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.361373Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:e3dd2d8ecb8eb84411a3909ad0a30f7ee8904812441ec2b9e665336b741c225d","observation_id":"22d86c07-4060-4598-a1d1-99bcc18ad473","resolution":{"observed_at":"2026-08-10T18:21:37.361373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.914232Z","title":null,"venue":null,"work_id":"b1a36eb5-b8f1-441b-b70c-e8548819b0e1","year":2023},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.364587Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:4f558df6c357da92785858877956252d19d12bf82921968127386d64b1a0ad8e","observation_id":"9d0f8288-3628-4560-af52-5966ab4753d4","resolution":{"observed_at":"2026-08-10T18:21:37.918197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08072","last_updated":"2024-12-17T07:30:54Z","snapshot_observed_at":"2026-08-20T03:10:33.834054Z","submitted_at":"2024-08-15T10:44:38Z","title":"I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08072","snapshot_observed_at":"2026-08-10T18:21:37.367999Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.367999Z"},"links":{"cited_paper":"/paper/2408.08072","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:7403153b899d24df9c80e6c8fe11b5638b9f86264d78b58c0447efd3f6aa207c","observation_id":"11c83419-a2d3-47d8-a4c9-2ad2b1337591","resolution":{"observed_at":"2026-08-10T18:21:37.367999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.902223Z","title":null,"venue":null,"work_id":"bb3793a0-30d4-4ed9-a6ca-3c67191f5257","year":2022},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.371511Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:97b46e0f6fb4dbedd16a391248be0c7327851c81083aaf26130e7cec2cfde2e2","observation_id":"159aa98e-5493-4cc1-b04e-153dc25cde4b","resolution":{"observed_at":"2026-08-10T18:21:37.906475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-10T18:21:37.374578Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.374578Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:a40be8ad2386b2f0307f7aae78668c9159a72799286185ed525b12487d75dbdd","observation_id":"73826fd4-a384-47c3-9445-292b58ca9ffd","resolution":{"observed_at":"2026-08-10T18:21:37.374578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.890355Z","title":null,"venue":null,"work_id":"9c9a245c-ee71-40c2-a6e8-958bf2bd03a0","year":2016},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.378239Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:c7c619661c6d87f435ac402421c096ab0984215d74cdd2ec6ef39bfa767f96a7","observation_id":"b1848864-b63e-4121-9bf7-a0041bd85d02","resolution":{"observed_at":"2026-08-10T18:21:37.894523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.878851Z","title":"Bellemare, A \\\"a ron van den Oord, and R \\'e mi Munos","venue":null,"work_id":"34ed460e-9f5b-4ef9-b2d7-0e29c92ee25f","year":2017},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.381680Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:227efe45710d90e517799dff88540a207dd60dfb2602a611a07b7bbe9c5f6319","observation_id":"f3e900cd-80be-470a-9a06-5f795c75c074","resolution":{"observed_at":"2026-08-10T18:21:37.882827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.384975Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.384975Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:2ad4dfc9a8b3713dfec766468ee53245c7eba738f58509a14dd9b4f3d30323f3","observation_id":"24ad0f3b-fb08-4d31-be67-10791b1ad772","resolution":{"observed_at":"2026-08-10T18:21:37.384975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.860964Z","title":null,"venue":null,"work_id":"b0dc0e22-0f07-493f-bf83-b066e4da738c","year":2017},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.388190Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:8ac736cff5c179cb626c25bf056f27e4220819b74a97122136434ae4f39634f4","observation_id":"d9e33f2d-a512-4e51-90a8-fd0197310855","resolution":{"observed_at":"2026-08-10T18:21:37.864901Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.391593Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.391593Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:932a3a5230bce7ec7afbccbd76721a08b6179a1ef984f17496860fe54976d731","observation_id":"1f42b683-9b06-4713-9877-755898c86271","resolution":{"observed_at":"2026-08-10T18:21:37.391593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.395201Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.395201Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:2a0db4cf69a05f8aebf2f70ef99c432868bff309be84b5d7f5da086564b4d28c","observation_id":"2b04304f-65e7-487a-9893-aab167ddb2c4","resolution":{"observed_at":"2026-08-10T18:21:37.395201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.398679Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.398679Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:1798ec0f0c22eda778723cfaea3489f1b7912bd07bf56ea5bb05918c12c9a7aa","observation_id":"a42c2fe3-91bd-4bf5-abf6-c0c534bbc3a1","resolution":{"observed_at":"2026-08-10T18:21:37.398679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-18T03:59:39.242039Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-10T18:21:37.402322Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.402322Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:549d6580509937a0cd95a3a58b10c7c1e867049f713f1598bcc053aafceab19b","observation_id":"0c38027f-6ba5-4ec3-9133-85a1c3cb501d","resolution":{"observed_at":"2026-08-10T18:21:37.402322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.841869Z","title":null,"venue":null,"work_id":"87157fb0-38be-492f-9027-83a31e1316c2","year":1991},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.406397Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:b12067cdd9bfea4895b92e088d8c04d4aacbcd39e4aec9f7b3fab5ffed1a5473","observation_id":"1da51b33-7f97-4def-a11e-51c4077e6036","resolution":{"observed_at":"2026-08-10T18:21:37.845834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.830818Z","title":null,"venue":null,"work_id":"8c666836-da4e-45f2-ae3d-76fb335691d8","year":1991},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.410014Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:e4b6f871302487a30b38c191c568f4d383c6b5598b35d61cdfdc72fa8ef40b2d","observation_id":"14f9ed15-7a7e-458f-9738-a57fd626bb02","resolution":{"observed_at":"2026-08-10T18:21:37.834566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1507.00814","last_updated":"2015-11-19T22:40:30Z","snapshot_observed_at":"2026-08-18T02:29:03.842532Z","submitted_at":"2015-07-03T04:11:15Z","title":"Incentivizing Exploration In Reinforcement Learning With Deep Predictive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.00814","snapshot_observed_at":"2026-08-10T18:21:37.413739Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.413739Z"},"links":{"cited_paper":"/paper/1507.00814","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:fb621302294bfb76bdf14b6fd1b2fe36afaaf92c34171ba9a7874bb4de003d46","observation_id":"ac394264-efe0-4f54-ab63-be50791917c2","resolution":{"observed_at":"2026-08-10T18:21:37.413739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-21T14:30:27.126880Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-10T18:21:37.417501Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul F","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.417501Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:d1f18d0b5ebdff4edb33915867d266e513b03a3998f2a77326ed3cca441f4beb","observation_id":"1a5e5681-7f98-48b0-8489-2c90bc12f057","resolution":{"observed_at":"2026-08-10T18:21:37.417501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T18:21:37.421348Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.421348Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:c093a7d7968208e45b590a090f88e796745bf8285bc389e04f5be1678b034c21","observation_id":"853d3ae0-f135-4c9e-bd84-3094b2799e6b","resolution":{"observed_at":"2026-08-10T18:21:37.421348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.425001Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.425001Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:92d23e0e7c924c4f5c6548816f43b01a5f6917c36984c12d7f33309bff4b8498","observation_id":"73c0118b-78fe-46a0-ba7c-35517fe81d22","resolution":{"observed_at":"2026-08-10T18:21:37.425001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-10T18:21:37.428564Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.428564Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:db976e56c074ef762192a76608d296c14d42c37873192550e8c5e090aa25e31b","observation_id":"e63fdbf0-1375-47de-9bdf-14c58977c34a","resolution":{"observed_at":"2026-08-10T18:21:37.428564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.819337Z","title":null,"venue":null,"work_id":"76ca36b5-877a-419a-b372-a0d37ab605a7","year":2017},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.432569Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:f6fc035fbba0c3a0e0eeb0c762c40d7e6dddd123c50d4f579631a952c80ee20a","observation_id":"6992dfdd-56f4-45eb-92eb-93f79a76edfd","resolution":{"observed_at":"2026-08-10T18:21:37.823209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.808466Z","title":null,"venue":null,"work_id":"03fa7545-bd44-420c-8822-b17bcd21c607","year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.436419Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:43cc87d09955771dc89fe5260d5ea60bbd5d23fe74d77276ada43ae273379e48","observation_id":"374518da-571b-4f5c-8973-6f09962a0e53","resolution":{"observed_at":"2026-08-10T18:21:37.811910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02209","last_updated":"2024-07-02T12:17:07Z","snapshot_observed_at":"2026-08-18T18:01:17.209885Z","submitted_at":"2024-07-02T12:17:07Z","title":"Generative Monoculture in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02209","snapshot_observed_at":"2026-08-10T18:21:37.440086Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.440086Z"},"links":{"cited_paper":"/paper/2407.02209","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:3bdfa906084baa75800d03f725610fda725487b33d66fc39db9785f0c34b3b08","observation_id":"899a1e39-071f-4e75-a52c-c0f63297ae94","resolution":{"observed_at":"2026-08-10T18:21:37.440086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.798123Z","title":null,"venue":null,"work_id":"b1dd5ee5-126f-4e97-90fe-24a0b59b76ca","year":2023},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.443950Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:24fe1f62b5e8bd1ef1c93898ae3a70f79e6c2725ef87fc224e7821407726bedb","observation_id":"b99d810a-0b1b-4ab1-bb12-87fcabc06165","resolution":{"observed_at":"2026-08-10T18:21:37.801664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-13T02:06:18.586697Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-10T18:21:37.447810Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.447810Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:d4ae4ca451d844a562b88f129abbf38a31ffbb8a70d04a915ff3a357748b270f","observation_id":"86be2fbe-e6bc-4699-9001-2d4920c47f3a","resolution":{"observed_at":"2026-08-10T18:21:37.447810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.787506Z","title":null,"venue":null,"work_id":"e517637b-0dbc-4607-ab9b-71598d24acb6","year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.451459Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:1c6e1bd2615c2be55da1ba00e71eed9d12f58cc341b67e2b8e1611250f32cadf","observation_id":"e0272511-cb13-4617-85da-c6a49d36e289","resolution":{"observed_at":"2026-08-10T18:21:37.790889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08683","last_updated":"2024-10-11T08:39:28Z","snapshot_observed_at":"2026-08-21T20:42:58.713096Z","submitted_at":"2024-07-11T17:21:03Z","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08683","snapshot_observed_at":"2026-08-10T18:21:37.455009Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.455009Z"},"links":{"cited_paper":"/paper/2407.08683","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:60e1f0caad668a0139cd6ccf736f516128c272c4cb2fd3dbbcd4355178299d02","observation_id":"2f8f7139-3aad-4d1e-916c-170fa4030d46","resolution":{"observed_at":"2026-08-10T18:21:37.455009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-08-16T15:11:14.289525Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-10T18:21:37.458748Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.458748Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:19a6004efbb288dc6402e7ac7a8f379f2bff5044e10e44c939ec61ed4190fdc4","observation_id":"9fb83aab-dfe0-4eaa-83ea-22db674c60c9","resolution":{"observed_at":"2026-08-10T18:21:37.458748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.462485Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.462485Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:1bb6c64f25fd097f4ce7b701ab1c13f14e87f642ec825d3a15cb589f983ee2bb","observation_id":"b2eb9e11-3434-471e-95ae-9fe5d863cd18","resolution":{"observed_at":"2026-08-10T18:21:37.462485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.466338Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.466338Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:a63d7186afdf64194c36172dbf1fcd138329474f7b4143c89126be7d019f3e9a","observation_id":"631f5bbc-199c-44e1-b99f-bda9d3859013","resolution":{"observed_at":"2026-08-10T18:21:37.466338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.770304Z","title":null,"venue":null,"work_id":"2e03849a-360c-45e5-86a9-a32174e25da0","year":2018},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.469750Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:b6a6fec292099554b2dae9c565a7baf03d0f3f064029b5bddcddeed3888e5202","observation_id":"5a8021b5-4082-424a-ba4e-fc28d6241e91","resolution":{"observed_at":"2026-08-10T18:21:37.774174Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-21T16:54:14.450108Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-10T18:21:37.473173Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.473173Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:c24d567f562188de160a6aed6e00196af772532d67b9ebe1abd71126f24d4391","observation_id":"c206f32a-14d1-4478-a8e1-af62c62500df","resolution":{"observed_at":"2026-08-10T18:21:37.473173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.476857Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.476857Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:6de2b9a82d57fa12a861cab93dcc3ebff4d7469fec75c6c0c7ed8fa58c144800","observation_id":"2f1d644f-fc87-4860-8618-e5a40ceaf127","resolution":{"observed_at":"2026-08-10T18:21:37.476857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:21:37.480991Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.480991Z"},"links":{"citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:41c97c9f0edb25d8207633dc2da7dc26255e64adcb467f72469c14e37a6f5073","observation_id":"fe0568f0-7da8-45a5-b224-a8057dea6954","resolution":{"observed_at":"2026-08-10T18:21:37.480991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 4 inbound Pith citation observations for arXiv:2501.11463."}