{"as_of":"2026-08-07T10:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91a3baa3f269753f96bbaeb41b81cf307213b1ebb1d14bedfcd599a0f257c6ba","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:54:49.897621Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-05T02:27:50.369374Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"cited_work":{"arxiv_id":"2507.00018","doi":"10.48550/arxiv.2507.00018","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Implicit reward as the bridge: A unified view of sft and dpo connections","venue":"ArXiv.org","work_id":"5f6c0905-16a6-4cf7-85db-82cbedac7ddf","year":2025},"citing_paper":{"arxiv_id":"2508.06412","last_updated":"2026-05-07T07:25:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T15:56:49Z","title":"Sample-efficient LLM Optimization with Reset Replay","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T23:38:08.044450Z"},"links":{"cited_paper":"/paper/2507.00018","citing_paper":"/paper/2508.06412"},"observation_digest":"sha256:f78c94421357754271b63995f7d7f944232bc4e4824efb22dcff01b04309074d","observation_id":"8ba59577-e2d1-4fba-bb7b-b52cc037427d","resolution":{"observed_at":"2026-05-18T23:41:54.724211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"cited_work":{"arxiv_id":"2507.00018","doi":"10.48550/arxiv.2507.00018","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Implicit reward as the bridge: A unified view of sft and dpo connections","venue":"ArXiv.org","work_id":"5f6c0905-16a6-4cf7-85db-82cbedac7ddf","year":2025},"citing_paper":{"arxiv_id":"2512.11470","last_updated":"2026-05-11T03:19:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-12T11:13:00Z","title":"Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-16T22:43:01.937642Z"},"links":{"cited_paper":"/paper/2507.00018","citing_paper":"/paper/2512.11470"},"observation_digest":"sha256:1c2b7788c702ffc422704e9331a51b158e8e6fe69279fb4b3f19528cae0860e1","observation_id":"b63b8c6b-554a-492a-bb64-920db5a6814c","resolution":{"observed_at":"2026-05-16T22:43:37.903879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"cited_work":{"arxiv_id":"2507.00018","doi":"10.48550/arxiv.2507.00018","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Implicit reward as the bridge: A unified view of sft and dpo connections","venue":"ArXiv.org","work_id":"5f6c0905-16a6-4cf7-85db-82cbedac7ddf","year":2025},"citing_paper":{"arxiv_id":"2606.11206","last_updated":"2026-04-22T14:47:30Z","snapshot_observed_at":"2026-08-04T23:02:24.231983Z","submitted_at":"2026-04-22T14:47:30Z","title":"Compatibility-Aware Dynamic Fine-Tuning for Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-05T02:27:50.369374Z"},"links":{"cited_paper":"/paper/2507.00018","citing_paper":"/paper/2606.11206"},"observation_digest":"sha256:329d66988d08c2684dd6752ce977fdfc744eb740afb99a3a8b1bb2aa58430f06","observation_id":"8981378c-8c65-4256-96ea-723f954ccbe0","resolution":{"observed_at":"2026-07-05T02:30:40.875988Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00018/citation-record","integrity":"/paper/2507.00018/integrity","json":"/paper/2507.00018/citation-record.json","paper":"/paper/2507.00018"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.574049Z","title":null,"venue":null,"work_id":"054338a1-b820-49b1-af29-0d6e4167715b","year":2022},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:48.676604Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:12f78334e323f0d622d21ebd03b8b51e960cdc5f7fcb6cea47120a99b442ebdc","observation_id":"155ecc09-68b1-49d9-a69d-74bd2cdbe62a","resolution":{"observed_at":"2026-08-07T00:54:50.577843Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:54:48.842036Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:48.842036Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:5269c33422aac024da8220fb7b939e604b2dd0be903376a63aaec20a666e2aad","observation_id":"63bbd42e-8d4b-418d-b009-286bb6ee8bcb","resolution":{"observed_at":"2026-08-07T00:54:48.842036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T00:54:48.952808Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:48.952808Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:012dbaaa9197002d29010b1d280531301928068845c7f62457bd4f0ab3a9e05f","observation_id":"45844eb2-a2b8-44ab-97ff-08b651d4a23b","resolution":{"observed_at":"2026-08-07T00:54:48.952808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T00:54:49.027509Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.027509Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:8001f5b5faea286577c4406c35f09bb6ca95f5d0782ff61d187d6f61ec883877","observation_id":"740526b3-24a8-467b-8455-7f1896fb89aa","resolution":{"observed_at":"2026-08-07T00:54:49.027509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T00:54:49.161443Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.161443Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:704624dfb872bc2d0b023bc7bf46a68cd961324ea681564e5c7a317b60c17491","observation_id":"299141e7-ae50-4248-b9d6-b70024ebe1a7","resolution":{"observed_at":"2026-08-07T00:54:49.161443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T00:54:49.273212Z","title":"LIMO: less is more for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.273212Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:06fe64600a9db61777d68a42ee6f628bad886cb123e0b90172f75d97a976d61c","observation_id":"d4d41498-8e2e-4cd1-a861-aabeb3829e17","resolution":{"observed_at":"2026-08-07T00:54:49.273212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.560598Z","title":"LIMA: less is more for alignment","venue":null,"work_id":"f612a53b-296c-4e24-a35f-dcf48bee9c84","year":2023},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.378898Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:6f67b4f81d822999178116b7c1d24536315a4391cb3940b6826154817d878964","observation_id":"a6f19c3e-faec-4b6a-9a17-ba0818a03dd3","resolution":{"observed_at":"2026-08-07T00:54:50.565495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:54:49.466452Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.466452Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:e29ec3671c6e685d4032200991491ec4f0a680c165ccce769e88dc4f2026fb4b","observation_id":"2527488a-32c2-45bc-af58-26484812d526","resolution":{"observed_at":"2026-08-07T00:54:49.466452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T00:54:49.570674Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.570674Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:45b8aed3224dcec27b108cce706a05f0385efee279a938bc217e1d662abd69e8","observation_id":"696e9905-ffea-42e7-b833-fc1a31717ae1","resolution":{"observed_at":"2026-08-07T00:54:49.570674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T00:54:49.652357Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.652357Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:e5a36a6cb9c93df0c80cadfe837a6bc8a9c99d4d5757175720ae7272cadbb552","observation_id":"e284614f-2074-41cb-8341-709bb668a09d","resolution":{"observed_at":"2026-08-07T00:54:49.652357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-03T14:31:51.401500Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-07T00:54:49.759695Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.759695Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:9cd0efbf277351c4441de395edb6baedd23622c6bdc4159fe93126d5c443e9c0","observation_id":"56f6fa23-9bfa-41a4-abf7-b522dacc86ce","resolution":{"observed_at":"2026-08-07T00:54:49.759695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T00:54:49.763796Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.763796Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:2b6d53ceb67c46b9d6efe1681887c620a5efb8f4b4a1179afdd0715c5bf09c43","observation_id":"5ba82bcc-c98a-4bea-91d1-b7bba81c268a","resolution":{"observed_at":"2026-08-07T00:54:49.763796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.547475Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":"b478290a-ae57-43ac-8055-324da059bfef","year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.767381Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:f13ad6c2866ac0a5c9d05ce9b59e019cb3ff6587acd8a3e694d0fc09b8092cee","observation_id":"c9a44f64-bdb9-4b72-ab81-bbc7d787c66e","resolution":{"observed_at":"2026-08-07T00:54:50.551637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10490","last_updated":"2025-06-29T05:43:22Z","snapshot_observed_at":"2026-08-01T14:47:14.023229Z","submitted_at":"2024-07-15T07:30:28Z","title":"Learning Dynamics of LLM Finetuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10490","snapshot_observed_at":"2026-08-07T00:54:49.770445Z","title":"Sutherland","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.770445Z"},"links":{"cited_paper":"/paper/2407.10490","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:857e8d9433906c745f952745553c93c8fbaf036b3098336e35c64873a5e221e4","observation_id":"1990d6db-a32b-4898-9e51-03d125c24718","resolution":{"observed_at":"2026-08-07T00:54:49.770445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.12142","last_updated":"2022-11-03T08:14:03Z","snapshot_observed_at":"2026-07-06T11:21:58.323363Z","submitted_at":"2021-06-23T03:43:10Z","title":"IQ-Learn: Inverse soft-Q Learning for Imitation","version":4},"cited_work":{"arxiv_id":"2106.12142","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.12142","snapshot_observed_at":"2026-08-07T00:54:50.170675Z","title":"IQ-Learn: Inverse soft-Q Learning for Imitation","venue":"cs.LG","work_id":"fbeb4fc7-b856-41fb-b167-904447142c09","year":2021},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.774884Z"},"links":{"cited_paper":"/paper/2106.12142","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:dd2a1addefd57a9eb4b49daa92a4770ce03235413668533a3bfed161ff48f8bb","observation_id":"629305d1-60bf-4403-8943-45ff85560ba6","resolution":{"observed_at":"2026-08-07T00:54:50.177850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.533768Z","title":"Huang, Artem Sokolov, Matt Barnes, Guillaume Desjardins, Alex Bewley, Sarah Bechtle, Jost Tobias Springenberg, Nikola Momchev, Olivier Bachem, Matthieu Geist, and Martin A","venue":null,"work_id":"4f180343-21d1-499f-b6ce-85fa40bee156","year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.778563Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:4b882a7b4743a69d950f07968136a4829ca09f45c764d3e3eee8ab33c6c602b2","observation_id":"07a74808-a6d1-4cb0-b197-fc1a7c6aabf8","resolution":{"observed_at":"2026-08-07T00:54:50.538820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12358","last_updated":"2024-08-12T21:13:35Z","snapshot_observed_at":"2026-07-06T18:02:19.428801Z","submitted_at":"2024-04-18T17:37:02Z","title":"From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12358","snapshot_observed_at":"2026-08-07T00:54:49.782191Z","title":"From r to q*: Your language model is secretly a q-function","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.782191Z"},"links":{"cited_paper":"/paper/2404.12358","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:51f8f6df336b2cfa62e98d33fc2fe6cdf3f0901d5df827b119a94f28833f6a0b","observation_id":"cad91d96-f262-4d7b-abaf-21967381882a","resolution":{"observed_at":"2026-08-07T00:54:49.782191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.520941Z","title":"Ng and Stuart Russell","venue":null,"work_id":"519bb037-c7c1-4cee-be9b-92393df501d0","year":2000},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.785707Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:1df88448cf3c8dc0a8ebe320db807af9029d72a51d8f5b298484a997245e8fa0","observation_id":"6c44ace5-62ea-4b09-95ad-04272b92cf4b","resolution":{"observed_at":"2026-08-07T00:54:50.525704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16673","last_updated":"2025-04-05T08:56:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T16:21:00Z","title":"Preserving Diversity in Supervised Fine-Tuning of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16673","snapshot_observed_at":"2026-08-07T00:54:49.789457Z","title":"Entropic distribution matching in supervised fine-tuning of llms: Less overfitting and better diversity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.789457Z"},"links":{"cited_paper":"/paper/2408.16673","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:d220449a46bddf462df98b88f0588ecbd8e571a8441cd99daca92ee910e3ce3a","observation_id":"d7489688-7b8b-40ac-a258-ad77e3a60e29","resolution":{"observed_at":"2026-08-07T00:54:49.789457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.00709","last_updated":"2016-06-02T14:53:33Z","snapshot_observed_at":"2026-08-02T14:37:20.098056Z","submitted_at":"2016-06-02T14:53:33Z","title":"f-GAN: Training Generative Neural Samplers using Variational Divergence Minimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.00709","snapshot_observed_at":"2026-08-07T00:54:49.793212Z","title":"f-gan: Training generative neural samplers using variational divergence minimization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.793212Z"},"links":{"cited_paper":"/paper/1606.00709","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:9d71e70238ff6e45e03c59db22eb3587506de1f04ef7f9cb3309a3ca81131b76","observation_id":"c96eb0c2-448a-4c4c-99d0-6d47d8a457e5","resolution":{"observed_at":"2026-08-07T00:54:49.793212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.509250Z","title":"Sequencematch: Imitation learning for autoregressive sequence modelling with backtracking","venue":null,"work_id":"3d296b69-e84f-4766-82c2-fe548186fb1d","year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.797075Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:70bd6da07b55e7f05b8717519149967a16901fe40ec0e0aa5379fb1f6552672c","observation_id":"cf414451-3f34-4e9e-8547-0d2c55c820d0","resolution":{"observed_at":"2026-08-07T00:54:50.513128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T00:54:49.801207Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.801207Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:0901f6b54e282b6e7f36605313b4da132575bd21583e2f858c984314b8eb029c","observation_id":"6a6ec825-10bf-418a-9762-31c5031510ba","resolution":{"observed_at":"2026-08-07T00:54:49.801207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.497395Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":"b87bc959-b4e3-4b88-8a3c-d36e1f6617cf","year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.805953Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:2db1dc858501488c72925802a8f249aa8dec38c54018685e0332735f253deae7","observation_id":"b37f6627-9498-47ce-bc37-d6434e484211","resolution":{"observed_at":"2026-08-07T00:54:50.501382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.484621Z","title":"Model alignment as prospect theoretic optimization","venue":null,"work_id":"79c85547-4305-4d8b-a389-018554c76e25","year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.809568Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:a22dc295db48e8239158afac38b6e7fbd87bee0bb0ce8f5b6c0a311578475a9d","observation_id":"44bf425c-9e56-45d3-aa8c-48e512fbb21c","resolution":{"observed_at":"2026-08-07T00:54:50.489223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.472390Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":"76dbd120-bb9e-425b-a0ff-e5c81ad00766","year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.813601Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:5a7593dedb01894825a8a84955371bdf6f827b432d90cb6bf19a12d22ea8d239","observation_id":"1b3bfa17-fbe4-42c6-b82a-29bd522508a8","resolution":{"observed_at":"2026-08-07T00:54:50.476399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.459006Z","title":"Disentangling length from quality in direct preference optimization","venue":null,"work_id":"3d5bf46d-6ee1-44c2-b041-632f9fb0b20b","year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.818015Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:5836e0af36e8bfc6eafe151dd67c7d97939706af0a29a487f14ad0f9420d1d96","observation_id":"e98b2b3a-7252-4388-a3a0-77c37cb393d9","resolution":{"observed_at":"2026-08-07T00:54:50.463217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05193","last_updated":"2024-11-27T00:05:44Z","snapshot_observed_at":"2026-08-04T22:49:27.294856Z","submitted_at":"2024-11-07T21:36:52Z","title":"Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05193","snapshot_observed_at":"2026-08-07T00:54:49.821661Z","title":"Dragan, and Sergey Levine","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.821661Z"},"links":{"cited_paper":"/paper/2411.05193","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:f53f4fd46fb24947dcccc85f6ce2b905baf18d8eeea3573fb7d05a7e82cbe659","observation_id":"f97dd5a8-7a18-4ff5-b2f4-fbb033ad99b5","resolution":{"observed_at":"2026-08-07T00:54:49.821661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:49.825840Z","title":"Andrew Bagnell","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.825840Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:3cd825a9b1514f2277514531d61b7986e53156262e61397eac012974350c3d90","observation_id":"3d29a645-ca11-4196-986c-51f102089c7f","resolution":{"observed_at":"2026-08-07T00:54:49.825840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.445243Z","title":"Ziebart, Andrew L","venue":null,"work_id":"79c42659-4c7c-4cd2-a8fe-d4af29ff8bf9","year":2008},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.829770Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:94d34da53879c7167e8fa5d45fbbb620d31b1c830b999d2a1dfaca9c1c1ec56e","observation_id":"7bd585c5-1ff1-46d0-a33a-e316b98163eb","resolution":{"observed_at":"2026-08-07T00:54:50.449803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.432068Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":"7f6b6e98-ea4f-40f7-b8d5-0088b9e581b3","year":2023},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.833846Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:8340fc984079b0a2628ce2baef8e1641ffdbc29660b6186e8882728414809790","observation_id":"d5944051-dabb-4ec1-b356-adc6efc21089","resolution":{"observed_at":"2026-08-07T00:54:50.436243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-07T00:54:49.838199Z","title":"Ultrafeedback: Boosting language models with high-quality feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.838199Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:fd21ab2fb9756dbb1b453438d1f0dc3a6060083836410a9fabf23218567ac616","observation_id":"4da6cf93-416a-4c3c-bcfd-37ed4e76961e","resolution":{"observed_at":"2026-08-07T00:54:49.838199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-07T00:54:49.842747Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.842747Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:35f8ac8261205e62a2ff411fd9c9c93cdc60edc37c1097456925dd081e097777","observation_id":"9cec943e-8c1a-44a2-95f2-7772676d4f1f","resolution":{"observed_at":"2026-08-07T00:54:49.842747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T00:54:49.851308Z","title":"Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.851308Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:f80b979f7841d77a1ffaabbf09fbcf2f2c3bdf6d30a176c21ea9efb753f20d86","observation_id":"8ecdcd53-2441-4def-a799-4c63dd45c8d1","resolution":{"observed_at":"2026-08-07T00:54:49.851308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.418343Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":"43f3c870-93a0-45e8-bf80-102461e8fe9c","year":2023},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.855476Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:588dcb28f2d519771057b7ab756e62d2920251d0f781341cb2d9201e082e81ca","observation_id":"1ac1d6ed-c92c-4bcb-b685-825f7291cc1d","resolution":{"observed_at":"2026-08-07T00:54:50.423410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.404301Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"a72c413b-969e-4245-a64d-1a8ef8b7cf90","year":2023},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.859810Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:a1dd97cacf7d29221658af19cf7896fd973dcb387ce4b81a2bd1f9e62ed87f1e","observation_id":"ebdac33f-13bf-48bd-87bb-d78afd04c21d","resolution":{"observed_at":"2026-08-07T00:54:50.409199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.390699Z","title":"RRHF: rank responses to align language models with human feedback","venue":null,"work_id":"3e4307b2-5542-461c-a330-4bafb900b820","year":2023},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.864623Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:48926644750d195ab7e3dcfb701425c2edaed82842e32e4fa6692d4ea21c7d13","observation_id":"d4f260b2-1c9f-4368-8840-efb07f890521","resolution":{"observed_at":"2026-08-07T00:54:50.395307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T00:54:49.868787Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.868787Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:33ee35adc07db445ea6586cbd57161f23e2916cdca851145169e15c589246295","observation_id":"665991a4-8154-4b0a-a47d-ecd103f3e2eb","resolution":{"observed_at":"2026-08-07T00:54:49.868787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.377260Z","title":"Contrastive preference optimization: Pushing the bound- aries of LLM performance in machine translation","venue":null,"work_id":"fcbbc3ac-dc74-4708-82c7-6d18be7d4bd1","year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.874260Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:f2be7ddfb7e8416bc279d0c8e4829bec9598ddb2201ed817879e4fbdc7b29367","observation_id":"f00328f4-f5c6-4374-9e20-16d2f547f190","resolution":{"observed_at":"2026-08-07T00:54:50.381363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.363662Z","title":"ORPO: monolithic preference optimization without reference model","venue":null,"work_id":"8362b7ae-9337-4dd2-a5db-8d4b34a9234d","year":2024},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.879242Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:d80650531ce6f89aa0cded0a267942bd509728f9fafab06884c0a7192b383e87","observation_id":"8b364a22-3f24-487d-bcf7-1c013b6c60f4","resolution":{"observed_at":"2026-08-07T00:54:50.368537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.350021Z","title":"Rush, and Thomas Wolf","venue":null,"work_id":"b7bd07f7-b1cf-476a-a115-74b475f36f94","year":2023},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.883972Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:4f36c59bc7ea51b7ccf3eb3893f81c343bd3e4cfc71a77ff40437386af51e947","observation_id":"a16ef0d9-cc25-4281-a02f-478cd785d2a9","resolution":{"observed_at":"2026-08-07T00:54:50.354243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T00:54:49.888136Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.888136Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:e855703f5c3a8c903546e0a473426e305a0ff970aba3c0361f3d652fe7b875de","observation_id":"cf15fed3-bf22-4143-b499-94887fc6a6a8","resolution":{"observed_at":"2026-08-07T00:54:49.888136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.335942Z","title":"Generative adversarial imitation learning","venue":null,"work_id":"2a209234-3637-477a-827d-9bd9a9420884","year":2016},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.893394Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:c6ff64ac3fc7c1809652d20d9a086408ba7ecea382584abc09c786ab9c65e411","observation_id":"bf6cfa3c-378f-4d8a-a182-8bad4a1293be","resolution":{"observed_at":"2026-08-07T00:54:50.340230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:50.322903Z","title":"Zemel, and Shixiang Gu","venue":null,"work_id":"f638e4e8-7fd7-40f0-8798-961ebace311f","year":2019},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.897621Z"},"links":{"citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:f6910aeddc04cecba7dac5aef1c97ccfb9f430b9b423307c6758b9a9b9357cfd","observation_id":"b227c1bc-9db4-4bdc-bfeb-552bf873ef87","resolution":{"observed_at":"2026-08-07T00:54:50.326969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 3 inbound Pith citation observations for arXiv:2507.00018."}