{"as_of":"2026-08-16T11:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1671444e374c0a5d1d79be1806d2fc18503de520474b7291d35eb3f987f8994","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T01:00:59.166273Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.02363/citation-record","integrity":"/paper/2505.02363/integrity","json":"/paper/2505.02363/citation-record.json","paper":"/paper/2505.02363"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:59.362798Z","title":"Cited on pages 5 and 16","venue":null,"work_id":"e23e7d36-375d-46da-b397-b31d6bde6b3c","year":null},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.119432Z"},"links":{"citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:1cebcc20af7008f450287f35c129f9a27bf4bbe72e18f443fba04ed79db84710","observation_id":"afa7c4fe-c646-41fd-a6bd-0cba96c303e7","resolution":{"observed_at":"2026-08-16T01:00:59.366877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-15T00:47:58.611457Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-16T01:00:59.123289Z","title":"Cited on pages 3, 5, and 16","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.123289Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:a94806796875430cd3f22e40aab36e647dbd74c50f850c6659871590c05b81d6","observation_id":"34a21b43-a5f4-4ce6-86bf-5441e713869f","resolution":{"observed_at":"2026-08-16T01:00:59.123289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15282","last_updated":"2024-12-18T15:38:39Z","snapshot_observed_at":"2026-08-16T04:30:26.301375Z","submitted_at":"2024-12-18T15:38:39Z","title":"A Systematic Examination of Preference Learning through the Lens of Instruction-Following","version":1},"cited_work":{"arxiv_id":"2412.15282","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.15282","snapshot_observed_at":"2026-08-16T01:00:59.257643Z","title":"A Systematic Examination of Preference Learning through the Lens of Instruction-Following","venue":"cs.CL","work_id":"734027a9-aded-43c9-9512-3839859d3790","year":2024},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.132394Z"},"links":{"cited_paper":"/paper/2412.15282","citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:bad7edd5953864323b30a5794a1be50d0a1d1df4f19cc51e5067021a8634bd40","observation_id":"cf4e34e0-4cb4-4431-a782-b4a8b9b6f72a","resolution":{"observed_at":"2026-08-16T01:00:59.264310Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-14T14:43:02.130172Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-16T01:00:59.137081Z","title":"Cited on page 8","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.137081Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:abfebf05587e87ebcb1ec828bfc5ff400484584618736fb00dc8ca8d4b7780fb","observation_id":"b31bec9f-a623-4816-8e5b-1a24272994c4","resolution":{"observed_at":"2026-08-16T01:00:59.137081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:59.349358Z","title":"Cited on page 7","venue":null,"work_id":"f19c0e17-9818-4ad9-a433-ee64f65aa7d1","year":null},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.141276Z"},"links":{"citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:476203636ac1db01847da317da3d0d8e43fb2ce5f64c0d7bb87dad00d70f1239","observation_id":"793b61c2-6c27-4657-a4c6-d876e1558bd5","resolution":{"observed_at":"2026-08-16T01:00:59.354235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01462","last_updated":"2024-07-16T16:51:38Z","snapshot_observed_at":"2026-08-16T04:30:51.769824Z","submitted_at":"2024-06-03T15:51:04Z","title":"The Importance of Online Data: Understanding Preference Fine-tuning via Coverage","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01462","snapshot_observed_at":"2026-08-16T01:00:59.145137Z","title":"Cited on page 7","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.145137Z"},"links":{"cited_paper":"/paper/2406.01462","citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:b5c836df536499da6585037a2284e38faac81b236f5a698f14ccef3de3de7365","observation_id":"576fcff5-0de5-47ff-8f57-a900f2251c2b","resolution":{"observed_at":"2026-08-16T01:00:59.145137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:59.336560Z","title":"cc/paper_files/paper/2020/file/ 1f89885d556929e98d3ef9b86448f951-Paper","venue":null,"work_id":"8aa6d82f-2c43-4221-9237-203e5c49fe45","year":2020},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.149804Z"},"links":{"citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:7ff3422a74b7fa0656cf12eaf373cd8150aad9cdd86e35dba4ea609d47441c67","observation_id":"b00d6e0f-6d90-4bd3-9caf-f5d435a1b991","resolution":{"observed_at":"2026-08-16T01:00:59.341017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:59.324818Z","title":"Cited on pages 1 and 7","venue":null,"work_id":"9c44f773-5965-40f8-b9ad-d31a46966187","year":null},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.153805Z"},"links":{"citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:e7a27664855ae7941621adf810e8ad2b9f4952236144f36f75e6fec9d1bd781b","observation_id":"574c9829-6181-4031-af24-46290e623a13","resolution":{"observed_at":"2026-08-16T01:00:59.328588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08448","last_updated":"2024-05-14T09:12:30Z","snapshot_observed_at":"2026-08-16T08:34:45.090223Z","submitted_at":"2024-05-14T09:12:30Z","title":"Understanding the performance gap between online and offline alignment algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08448","snapshot_observed_at":"2026-08-16T01:00:59.162363Z","title":"Cited on page 7","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.162363Z"},"links":{"cited_paper":"/paper/2405.08448","citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:0768c873a94a427323ef1dc9618475a43c6492c74fc43d37db0c0cd427c09842","observation_id":"b61b3eeb-439c-4c70-9546-e2dddc94c7d9","resolution":{"observed_at":"2026-08-16T01:00:59.162363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-16T01:00:59.166273Z","title":"alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.166273Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:6584dfd2097a81e1a05b619ceda6f0e59693ced08db87148a2fffad609d6ab21","observation_id":"a1acd6bc-b786-4519-97db-86183bb6da36","resolution":{"observed_at":"2026-08-16T01:00:59.166273Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T01:00:59.127796Z","title":"acl-long.309/","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":309,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.127796Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:cd62d04276cd9dba161fc310a5465fb00953fb2facf44ddfb28c9143bf4970f5","observation_id":"b5cbbd16-688e-4e4a-9e57-33d7c7e4f2ae","resolution":{"observed_at":"2026-08-16T01:00:59.127796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:59.387372Z","title":"acl-long.662","venue":null,"work_id":"f38021c1-9b65-4ddf-be55-13adcdc4ad83","year":2024},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":662,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.101760Z"},"links":{"citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:2864c72ac25b01445e955e20c8303e176620a3e7641492d494ca99e33ed34765","observation_id":"8e809b21-aa7c-4dbd-9dea-3d88109d9200","resolution":{"observed_at":"2026-08-16T01:00:59.391858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:59.157860Z","title":"URL https: //aclanthology.org/N19-1421","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.157860Z"},"links":{"citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:c653a678e81eb3be18be1c551b266783ee8a78f4da4aa940c84b0de76621f6f5","observation_id":"041082b1-e0c6-4775-9b78-516ac6f1b0af","resolution":{"observed_at":"2026-08-16T01:00:59.157860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10616","last_updated":"2024-12-13T23:42:24Z","snapshot_observed_at":"2026-08-15T01:36:16.632123Z","submitted_at":"2024-12-13T23:42:24Z","title":"Hybrid Preference Optimization for Alignment: Provably Faster Convergence Rates by Combining Offline Preferences with Online Exploration","version":1},"cited_work":{"arxiv_id":"2412.10616","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10616","snapshot_observed_at":"2026-08-16T01:00:59.301176Z","title":"Hybrid Preference Optimization for Alignment: Provably Faster Convergence Rates by Combining Offline Preferences with Online Exploration","venue":"cs.LG","work_id":"8b4c9074-db54-46af-b39c-6d3e5b0d6741","year":2024},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.114689Z"},"links":{"cited_paper":"/paper/2412.10616","citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:82b4b0fb7a02f155d04f1bfa7baaeaf816e4fbbe4fe9bd6cd88755541b95f4bc","observation_id":"99eb5fc0-a8a6-4d90-b54b-f04130792ae2","resolution":{"observed_at":"2026-08-16T01:00:59.305430Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:59.375366Z","title":"Cited on page 7","venue":null,"work_id":"d67a2cc2-89ec-4f80-9112-0fdabdaf7d10","year":2023},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.110420Z"},"links":{"citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:cbd532a1195972421072f862c0f4a0a5ed4b01a351d533a4063943d1d62fc7f7","observation_id":"1fb577bf-7109-4d52-a626-72cd5079c479","resolution":{"observed_at":"2026-08-16T01:00:59.379338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-16T01:00:59.106363Z","title":"Cited on page 17","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:59.106363Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.02363"},"observation_digest":"sha256:10ab8d50f4ca9f8b1243c2dee4fd7bf2bf02f164a44d5221644bf75d05dee393","observation_id":"e2ed02f9-79ae-42fa-a24a-62ceb5f3e2ac","resolution":{"observed_at":"2026-08-16T01:00:59.106363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.02363","last_updated":"2025-05-05T04:54:44Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T04:30:39.226032Z","submitted_at":"2025-05-05T04:54:44Z","title":"SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2505.02363."}