{"as_of":"2026-08-18T11:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b68e6695322670ae0dc62883b699e6feb2336f95dadc34159814e9b96c8b0da","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":127,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:02:43.525929Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T20:05:34.173711Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":"2405.14734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-07-08T20:05:34.173711Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":"cs.CL","work_id":"09ac9a7a-d953-4f17-acda-ac268871a79c","year":2024},"citing_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-08-12T12:16:58.791696Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"reference_index":130,"source":"arxiv_source","source_observed_at":"2026-05-16T06:58:36.684583Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2406.08464"},"observation_digest":"sha256:6a3ca7078d90572c926a303d289d13d3d8af848b9f2781a0baa8798b5379f2d7","observation_id":"63664023-8e42-4bd5-875a-d32642e75721","resolution":{"observed_at":"2026-05-16T06:58:36.882351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":"2405.14734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-07-08T20:05:34.173711Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":"cs.CL","work_id":"09ac9a7a-d953-4f17-acda-ac268871a79c","year":2024},"citing_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-05-17T22:58:16.523267Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2406.11794"},"observation_digest":"sha256:919a8d15c22545f1d2add41b1b2e5dbe8dcb86b30d817fb35b39542b397944f0","observation_id":"baad56b5-f9b2-45f3-81fc-d90330cbd6a9","resolution":{"observed_at":"2026-05-17T22:58:17.123554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-12T21:50:34.757342Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08302","last_updated":"2025-09-11T10:17:06Z","snapshot_observed_at":"2026-08-16T17:38:13.606752Z","submitted_at":"2024-11-13T02:45:21Z","title":"RED: Unleashing Token-Level Rewards from Holistic Feedback via Reward Redistribution","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T21:50:34.757342Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2411.08302"},"observation_digest":"sha256:5a866d42e2b64f1b3fc35336e21da98e28293699c17e7aa3fc6aabf6e2e7296c","observation_id":"22771146-9716-4e82-99a5-eb2e0f3b1d5b","resolution":{"observed_at":"2026-08-12T21:50:34.757342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-12T20:31:53.174774Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09661","last_updated":"2024-11-14T18:31:39Z","snapshot_observed_at":"2026-08-18T01:24:20.297241Z","submitted_at":"2024-11-14T18:31:39Z","title":"Adaptive Decoding via Latent Preference Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T20:31:53.174774Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2411.09661"},"observation_digest":"sha256:b21cc32e80918b8f9ada0167be852032b0bfad6f131464858432ce7724b146a4","observation_id":"18980d1f-0ac9-4ffb-9fa1-b91d882aea71","resolution":{"observed_at":"2026-08-12T20:31:53.174774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-12T19:14:36.999314Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-14T15:58:01.989486Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.999314Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:a7187f799f7ea7508fd96c949df5750cbb15ba6431539a254e381ec668ea1d81","observation_id":"70e7b513-cee4-435a-b139-692ff894730e","resolution":{"observed_at":"2026-08-12T19:14:36.999314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-12T17:10:55.524976Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12882","last_updated":"2025-06-06T05:27:10Z","snapshot_observed_at":"2026-08-15T15:30:04.308785Z","submitted_at":"2024-11-19T22:00:01Z","title":"ProSec: Fortifying Code LLMs with Proactive Security Alignment","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T17:10:55.524976Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2411.12882"},"observation_digest":"sha256:4a799c249dd5255b30ffe8e1e879e9a428b8babd4b77a4b4061c3dbd3efa93f0","observation_id":"47c5ec60-efd9-4ef5-a91c-7304256c0429","resolution":{"observed_at":"2026-08-12T17:10:55.524976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-12T13:31:10.621710Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-17T09:18:45.882440Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.621710Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:9ff825bb00e647a69aa0acc815d316a93e42d62d084988e307c5ce13bb656f2b","observation_id":"8c071df3-41bb-493c-a256-f81fcce82abc","resolution":{"observed_at":"2026-08-12T13:31:10.621710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-12T05:13:41.509518Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00631","last_updated":"2025-08-29T17:58:46Z","snapshot_observed_at":"2026-08-14T15:18:22.384221Z","submitted_at":"2024-12-01T01:01:09Z","title":"ROSE: A Reward-Oriented Data Selection Framework for LLM Task-Specific Instruction Tuning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T05:13:41.509518Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.00631"},"observation_digest":"sha256:bbb933c3dc845900c5b9b0e7cecb89fb7f724184cb190292aab9ddef4749d4e4","observation_id":"c46ffce3-d532-42ed-a13c-dea5659f2527","resolution":{"observed_at":"2026-08-12T05:13:41.509518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":"2405.14734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-07-08T20:05:34.173711Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":"cs.CL","work_id":"09ac9a7a-d953-4f17-acda-ac268871a79c","year":2024},"citing_paper":{"arxiv_id":"2412.02125","last_updated":"2026-05-01T15:42:42Z","snapshot_observed_at":"2026-08-17T03:55:38.085306Z","submitted_at":"2024-12-03T03:27:48Z","title":"Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-23T08:20:05.898025Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.02125"},"observation_digest":"sha256:7d62ab3a1de32ece65d4d301d0c6747d3d6b7e685850f8ff575fd451432e0d23","observation_id":"265d9257-8f0d-4d7f-bb49-075d279d7e15","resolution":{"observed_at":"2026-05-23T08:22:44.274185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T23:36:24.742162Z","title":"SimPO : Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-17T01:18:02.245715Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.742162Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:eb53a113ed10f6f54637a4e44190f4116a2b820b181bf4436e9825a50f21b8a1","observation_id":"eb18100c-eed6-430b-a3fd-c97b21c86cb0","resolution":{"observed_at":"2026-08-11T23:36:24.742162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T23:15:56.151799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02685","last_updated":"2024-12-03T18:56:07Z","snapshot_observed_at":"2026-08-12T01:39:13.359412Z","submitted_at":"2024-12-03T18:56:07Z","title":"T-REG: Preference Optimization with Token-Level Reward Regularization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T23:15:56.151799Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.02685"},"observation_digest":"sha256:5e09d54440b9474e8952b75b22e5dd85541a69ac0a870ac327c0a1faf1559832","observation_id":"4c1eeab3-330e-41aa-b0d6-4a8c02f8e333","resolution":{"observed_at":"2026-08-11T23:15:56.151799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T22:06:51.083942Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03822","last_updated":"2024-12-05T02:35:46Z","snapshot_observed_at":"2026-08-18T04:19:06.016742Z","submitted_at":"2024-12-05T02:35:46Z","title":"Beyond the Binary: Capturing Diverse Preferences With Reward Regularization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:51.083942Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.03822"},"observation_digest":"sha256:256d0cbbb86c536f9e6b78abe98b5038ce69e6116b0b3c603743c5d555979f78","observation_id":"802c7432-bfa4-4aa4-bf4b-795b6f5085a5","resolution":{"observed_at":"2026-08-11T22:06:51.083942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T21:38:06.767913Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04305","last_updated":"2024-12-05T16:26:31Z","snapshot_observed_at":"2026-08-17T22:31:11.199367Z","submitted_at":"2024-12-05T16:26:31Z","title":"ALMA: Alignment with Minimal Annotation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:38:06.767913Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.04305"},"observation_digest":"sha256:01a38e7692bc9fc71837413667e95e091f488167c51d027677e0e456706cee66","observation_id":"b0e2d84c-c9d5-4597-acfe-580aae8fcb3f","resolution":{"observed_at":"2026-08-11T21:38:06.767913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T21:15:45.364993Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-18T05:25:21.059219Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.364993Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:5a06883646d80a5dcd2eb279320f2df084dd18df497c2775eb3a7c58d2cdea66","observation_id":"3c91929f-c41c-443e-bb96-11fdea8b1140","resolution":{"observed_at":"2026-08-11T21:15:45.364993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T19:42:46.559026Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06458","last_updated":"2025-07-31T08:52:39Z","snapshot_observed_at":"2026-08-15T03:55:51.221211Z","submitted_at":"2024-12-09T13:02:35Z","title":"Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:46.559026Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.06458"},"observation_digest":"sha256:e3c598cb93cf002ecc1910563fbbb338f4fb8c717a7f14d7b30e2a136a2b223c","observation_id":"026e6fdb-1a4c-42a8-9602-03a242430c1b","resolution":{"observed_at":"2026-08-11T19:42:46.559026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T17:17:00.459083Z","title":"Preprint, arXiv:2405.14734","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09203","last_updated":"2024-12-12T11:57:59Z","snapshot_observed_at":"2026-08-18T06:30:22.367680Z","submitted_at":"2024-12-12T11:57:59Z","title":"CleanComedy: Creating Friendly Humor through Generative Techniques","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T17:17:00.459083Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.09203"},"observation_digest":"sha256:f69c116941c6900e5b41a848531658c11cea961efa67e708b9ce1207e41c4bb8","observation_id":"2942322d-55b3-4fc2-bc61-621f284992ed","resolution":{"observed_at":"2026-08-11T17:17:00.459083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T15:55:20.375425Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10616","last_updated":"2024-12-13T23:42:24Z","snapshot_observed_at":"2026-08-15T01:36:16.632123Z","submitted_at":"2024-12-13T23:42:24Z","title":"Hybrid Preference Optimization for Alignment: Provably Faster Convergence Rates by Combining Offline Preferences with Online Exploration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:55:20.375425Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.10616"},"observation_digest":"sha256:678cb192529581ba0e42db7f3feaa50f7de96987622b57358fe5d8cfed64204b","observation_id":"f16a6eec-9670-4ec8-95b9-68c29bf7a740","resolution":{"observed_at":"2026-08-11T15:55:20.375425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T15:41:48.837869Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10742","last_updated":"2024-12-14T08:25:28Z","snapshot_observed_at":"2026-08-13T05:00:41.916166Z","submitted_at":"2024-12-14T08:25:28Z","title":"WEPO: Web Element Preference Optimization for LLM-based Web Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:48.837869Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.10742"},"observation_digest":"sha256:36ac1b3a08f301f20d938f27a7f926b9f4944e9f0f9d2adf1ae5e5d09f6d843c","observation_id":"b24f63fe-024a-40dc-b521-c3f89c9a7e50","resolution":{"observed_at":"2026-08-11T15:41:48.837869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T14:06:48.154835Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.154835Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:69021a5f97a8aa3588317bee4af85373a74f63cbfdd20217a0e5d37a9b6a55ef","observation_id":"3ada8865-7075-4e2d-ac37-d98dea9d8925","resolution":{"observed_at":"2026-08-11T14:06:48.154835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T13:44:15.481684Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12865","last_updated":"2024-12-17T12:49:14Z","snapshot_observed_at":"2026-08-15T08:28:27.510214Z","submitted_at":"2024-12-17T12:49:14Z","title":"Preference-Oriented Supervised Fine-Tuning: Favoring Target Model Over Aligned Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T13:44:15.481684Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.12865"},"observation_digest":"sha256:a6a3f5874a5f97d40432a6072f04231b490945ae4dcf0ae677249994f5bc4cca","observation_id":"11b68d6a-a06d-47dc-9a3e-a1628785fa47","resolution":{"observed_at":"2026-08-11T13:44:15.481684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T12:48:58.966786Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13862","last_updated":"2024-12-18T13:55:42Z","snapshot_observed_at":"2026-08-14T07:37:10.037547Z","submitted_at":"2024-12-18T13:55:42Z","title":"Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T12:48:58.966786Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.13862"},"observation_digest":"sha256:a9480960173363016d4f92321f0620a3cffa6d38ea3892188abae0725796e5a0","observation_id":"5b26f855-819d-4343-aa5e-9c62415b335f","resolution":{"observed_at":"2026-08-11T12:48:58.966786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T12:37:34.261999Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14033","last_updated":"2024-12-18T16:52:38Z","snapshot_observed_at":"2026-08-17T14:26:28.065607Z","submitted_at":"2024-12-18T16:52:38Z","title":"Hansel: Output Length Controlling Framework for Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T12:37:34.261999Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.14033"},"observation_digest":"sha256:8ade6c819caab7462242f9482a44e5b463d9515f47b5e39ed74d76da688bde31","observation_id":"8489d4b5-97ab-47f5-9741-966797a17cf8","resolution":{"observed_at":"2026-08-11T12:37:34.261999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T12:16:31.937213Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-15T23:47:47.627897Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.937213Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:3c27482844a00b39eda3cd3b5ef4097d8e80f9600eadb3b8d1fd84f714046192","observation_id":"0943c1fb-e0db-48ed-9cf5-9f167b4771ef","resolution":{"observed_at":"2026-08-11T12:16:31.937213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T16:21:35.407893Z","title":"ArXiv, abs/2405.14734","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15244","last_updated":"2024-12-13T14:18:58Z","snapshot_observed_at":"2026-08-17T23:39:18.134853Z","submitted_at":"2024-12-13T14:18:58Z","title":"MPPO: Multi Pair-wise Preference Optimization for LLMs with Arbitrary Negative Samples","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T16:21:35.407893Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.15244"},"observation_digest":"sha256:5478d94e27ebaf71328e4e1c498046b9406f1fdac2a2ce7a8cd3b663b45e6ad8","observation_id":"22304670-4771-4e4c-b3e7-b02ca9d3d064","resolution":{"observed_at":"2026-08-11T16:21:35.407893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T11:17:49.032269Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.032269Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:9506955a33254f8627f5f27c03dfa2c7d650fa6f83e32a016bd3e5504a8a8bea","observation_id":"7e34296a-7701-469c-a51c-ec0dffb8eec0","resolution":{"observed_at":"2026-08-11T11:17:49.032269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T11:09:13.309116Z","title":"Simpo: Simple preference optimization with a reference-free reward.arXiv preprint arXiv:2405.14734, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15838","last_updated":"2024-12-30T07:27:58Z","snapshot_observed_at":"2026-08-16T14:52:33.599355Z","submitted_at":"2024-12-20T12:27:16Z","title":"Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T11:09:13.309116Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.15838"},"observation_digest":"sha256:a7860099ce85134ee707615711e073592686a7cd1f67dd6183be24ab2d97ebcd","observation_id":"a48d06eb-8497-4b7b-899f-0363ca074d8b","resolution":{"observed_at":"2026-08-11T11:09:13.309116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T05:56:02.095376Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17018","last_updated":"2025-06-03T04:11:32Z","snapshot_observed_at":"2026-08-18T07:20:17.048563Z","submitted_at":"2024-12-22T13:47:46Z","title":"GAS: Generative Auto-bidding with Post-training Search","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:56:02.095376Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.17018"},"observation_digest":"sha256:d95c9de99bdc63b93e6f8e3f4abb67790748c2748380e35962837736785b30fe","observation_id":"52e84489-14ee-4766-9d38-dfb01f313e87","resolution":{"observed_at":"2026-08-11T05:56:02.095376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T05:53:01.299517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17061","last_updated":"2025-05-19T15:18:10Z","snapshot_observed_at":"2026-08-15T02:53:21.438083Z","submitted_at":"2024-12-22T15:16:44Z","title":"Multi-Agent Sampling: Scaling Inference Compute for Data Synthesis with Tree Search-Based Agentic Collaboration","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T05:53:01.299517Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.17061"},"observation_digest":"sha256:32cb44ed037e3d42682d5da841919f15d76ef322e9fab7ce76ed1a3db5d94fe1","observation_id":"1395c49a-5a41-4d11-bc37-eb62a3e543cd","resolution":{"observed_at":"2026-08-11T05:53:01.299517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-10T23:16:55.365253Z","title":"Simpo: Simple preference optimization with a reference-free reward,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-16T07:26:08.250432Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.365253Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:2eaf543412c9bef9e741cfbaffa18f6c616c6579557ab874d558e81a83c6a2fa","observation_id":"bfb8b9a2-dfad-482d-80c0-6fe951c4ab8f","resolution":{"observed_at":"2026-08-10T23:16:55.365253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-10T23:21:34.130362Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-16T06:16:25.545815Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.130362Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:a284cda9637613863214a206b4330c64d886bf23766b370d7198e2e6b7c54f73","observation_id":"3e8f2b64-e06a-4f87-b95e-65de95d3453b","resolution":{"observed_at":"2026-08-10T23:21:34.130362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-10T22:54:43.781667Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00555","last_updated":"2025-07-12T18:07:42Z","snapshot_observed_at":"2026-08-14T12:41:01.952206Z","submitted_at":"2024-12-31T17:33:12Z","title":"Prune 'n Predict: Optimizing LLM Decision-making with Conformal Prediction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:54:43.781667Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2501.00555"},"observation_digest":"sha256:7ffdc98f7d1631c662abcfc53be0b2d734991282e2ff886189530328a321dbcf","observation_id":"fd3a5cdb-fec5-4abc-ab22-a51ad16235c2","resolution":{"observed_at":"2026-08-10T22:54:43.781667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-10T17:52:11.073589Z","title":"Meng, Y ., Xia, M., and Chen, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11877","last_updated":"2025-01-21T04:11:59Z","snapshot_observed_at":"2026-08-16T18:43:35.840096Z","submitted_at":"2025-01-21T04:11:59Z","title":"From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T17:52:11.073589Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2501.11877"},"observation_digest":"sha256:125b1625ffb4df24f951246779b61ceb59914b205e7f3826c333013268ff7abb","observation_id":"87e5657a-153e-49d4-8ab5-6b8a297d1cb5","resolution":{"observed_at":"2026-08-10T17:52:11.073589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-10T17:09:06.805981Z","title":"Simpo: Simple preference optimization with a reference-free reward, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-08-18T10:17:24.497798Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T17:09:06.805981Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2501.12570"},"observation_digest":"sha256:b2f10771f70d7815f49b0b79f74471f927c4baffa328f4ecede47ad204fdda6e","observation_id":"b26a325b-b3e5-4786-b35b-a585af4cfed3","resolution":{"observed_at":"2026-08-10T17:09:06.805981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-10T16:58:02.508364Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12735","last_updated":"2025-02-07T02:13:27Z","snapshot_observed_at":"2026-08-17T20:21:27.504758Z","submitted_at":"2025-01-22T09:12:09Z","title":"Online Preference Alignment for Language Models via Count-based Exploration","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T16:58:02.508364Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2501.12735"},"observation_digest":"sha256:fb58416fa3787ea9db652dede3664c4a1925139c742c239852f5431abe214e6c","observation_id":"0aa02464-c6fb-408b-9cb4-382731f3dc7e","resolution":{"observed_at":"2026-08-10T16:58:02.508364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-10T15:33:49.329189Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-16T21:03:21.394644Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.329189Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:f17329dea7184f71f4c4d4e76537013888e68de296e4fb5f77ca6b3111daa9ba","observation_id":"378b2aeb-276e-4b79-a9fd-fc4fb01b0e8e","resolution":{"observed_at":"2026-08-10T15:33:49.329189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-10T15:20:07.170523Z","title":"arXiv preprint arXiv:2405.14734","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14225","last_updated":"2025-03-13T03:55:17Z","snapshot_observed_at":"2026-08-15T23:32:40.921048Z","submitted_at":"2025-01-24T04:09:03Z","title":"Multi-agent KTO: Reinforcing Strategic Interactions of Large Language Model in Language Game","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T15:20:07.170523Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2501.14225"},"observation_digest":"sha256:c0f7e63af6a09e48cd1ef213404c257c2ed35b7a9f7836a49f05f360b5a99d63","observation_id":"9972eedc-141b-4155-9a06-839c421d7be7","resolution":{"observed_at":"2026-08-10T15:20:07.170523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-10T14:46:51.828305Z","title":"arXiv preprint arXiv:2405.14734","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15007","last_updated":"2025-01-25T00:59:12Z","snapshot_observed_at":"2026-08-13T23:55:56.094752Z","submitted_at":"2025-01-25T00:59:12Z","title":"Controllable Protein Sequence Generation with LLM Preference Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:51.828305Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2501.15007"},"observation_digest":"sha256:606c33f229e6144f5007c452558971d1d628b9e92522c028c616c978f6929dc9","observation_id":"465f07ad-38d8-4371-99b1-cdbee1363ed9","resolution":{"observed_at":"2026-08-10T14:46:51.828305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-10T14:39:22.645558Z","title":"arXiv preprint arXiv:2405.14734","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-18T09:53:37.503710Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.645558Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:921b74e68bb76ffd9f910105306b45b26e1c29b30beabac2c476ff73a3307841","observation_id":"d7dacf60-509c-4f74-a326-58e84b29d054","resolution":{"observed_at":"2026-08-10T14:39:22.645558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-09T23:02:23.364165Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18578","last_updated":"2025-02-26T18:58:53Z","snapshot_observed_at":"2026-08-17T15:14:37.183066Z","submitted_at":"2025-01-30T18:50:25Z","title":"R.I.P.: Better Models by Survival of the Fittest Prompts","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T23:02:23.364165Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2501.18578"},"observation_digest":"sha256:e2ff33b0016d9557606a6a226ff37ced2b115aff13bdc79536b05207a3614695","observation_id":"e2c1ff15-ee4f-41cd-ab9d-1f8ae7849bfa","resolution":{"observed_at":"2026-08-09T23:02:23.364165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-09T22:20:13.758075Z","title":", Xia, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-16T14:46:55.635889Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.758075Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:6edb7630e7303e5418dbc04f0e3447bac11978b724a386a033aa51a3c5c8e623","observation_id":"458f3f4d-8e64-4e03-a712-f8cf3b0258cb","resolution":{"observed_at":"2026-08-09T22:20:13.758075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-09T19:56:28.740814Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-13T11:52:46.445681Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.740814Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:6e4ebc8eb659fb9a7ffd63326f26ba2d1b4cf6967df52112cc3a3497d79bfb41","observation_id":"27b6e860-e0be-41eb-967f-f367df79c73a","resolution":{"observed_at":"2026-08-09T19:56:28.740814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-09T18:11:28.152093Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00674","last_updated":"2025-02-02T05:23:29Z","snapshot_observed_at":"2026-08-14T04:50:30.127326Z","submitted_at":"2025-02-02T05:23:29Z","title":"Rethinking Mixture-of-Agents: Is Mixing Different Large Language Models Beneficial?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:28.152093Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.00674"},"observation_digest":"sha256:714c779d19f4fd60806ce4d0d35fcd0c0430d984039e5aa604d7f493199619b0","observation_id":"6904886a-658d-48c7-b0a1-f449ed55e4b3","resolution":{"observed_at":"2026-08-09T18:11:28.152093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":"2405.14734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-07-08T20:05:34.173711Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":"cs.CL","work_id":"09ac9a7a-d953-4f17-acda-ac268871a79c","year":2024},"citing_paper":{"arxiv_id":"2502.01237","last_updated":"2026-05-08T19:36:24Z","snapshot_observed_at":"2026-08-15T11:40:36.888485Z","submitted_at":"2025-02-03T10:54:14Z","title":"The Differences Between Direct Alignment Algorithms are a Blur","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-23T03:50:03.720389Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.01237"},"observation_digest":"sha256:5db8982b7a93f2c293c302cec049a63709f83e9f9cf52dabebb3aa0f31b9c2ac","observation_id":"3a31901d-1717-48a5-9922-8abf75f6bc12","resolution":{"observed_at":"2026-05-23T03:52:29.437601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-09T13:14:34.070762Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-16T16:34:47.536642Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.070762Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:ce1b1520370e04dd724e734796d5a3263360754682abfa22b4a2dcb8324df79c","observation_id":"5ff434a2-881c-4014-822f-0c9e403eee70","resolution":{"observed_at":"2026-08-09T13:14:34.070762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-09T11:06:14.348926Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02810","last_updated":"2025-05-26T10:07:47Z","snapshot_observed_at":"2026-08-13T03:09:48.416152Z","submitted_at":"2025-02-05T01:14:12Z","title":"Mol-LLM: Multimodal Generalist Molecular LLM with Improved Graph Utilization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T11:06:14.348926Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.02810"},"observation_digest":"sha256:4cc729e7bf608659ec3dc0b6e3f1f3c3faafdd333f5458d7c823e9be00c80475","observation_id":"f691c706-5b33-4605-8d5a-35b8db6c267b","resolution":{"observed_at":"2026-08-09T11:06:14.348926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-09T06:04:01.620696Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03095","last_updated":"2025-02-05T11:41:43Z","snapshot_observed_at":"2026-08-10T20:00:39.129261Z","submitted_at":"2025-02-05T11:41:43Z","title":"Reveal the Mystery of DPO: The Connection between DPO and RL Algorithms","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T06:04:01.620696Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.03095"},"observation_digest":"sha256:84d42d0379140b37fb7821e03e39757c1ef819e6e237df0aaeb246d596fd282a","observation_id":"6970cff7-c592-4727-9b48-150a65477d59","resolution":{"observed_at":"2026-08-09T06:04:01.620696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-09T04:52:40.587630Z","title":"Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03429","last_updated":"2025-02-05T18:21:03Z","snapshot_observed_at":"2026-08-16T11:58:59.937274Z","submitted_at":"2025-02-05T18:21:03Z","title":"On Fairness of Unified Multimodal Large Language Model for Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T04:52:40.587630Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.03429"},"observation_digest":"sha256:bde194b6b23d413e631ec8008b0fc92aa5da6ec7ed5c9b5112fac635a8605560","observation_id":"e389116f-3b2e-4729-a77e-c34c32e31f75","resolution":{"observed_at":"2026-08-09T04:52:40.587630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-09T04:08:51.741471Z","title":"Ranked list truncation for large language model-based re-ranking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03699","last_updated":"2025-07-23T21:26:26Z","snapshot_observed_at":"2026-08-17T02:42:06.612301Z","submitted_at":"2025-02-06T01:22:06Z","title":"LLM Alignment as Retriever Optimization: An Information Retrieval Perspective","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T04:08:51.741471Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.03699"},"observation_digest":"sha256:f155c5a0ba9666fcd2dce0473f6a9ace3ec6b4d1b5b20d343b1b2a89e705a744","observation_id":"bde4c4a1-91de-42ed-ac10-3695cbf60e06","resolution":{"observed_at":"2026-08-09T04:08:51.741471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-08T22:57:12.721732Z","title":"Simpo: Simple preference optimization with a reference- free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04306","last_updated":"2025-02-06T18:47:49Z","snapshot_observed_at":"2026-08-14T21:16:48.876864Z","submitted_at":"2025-02-06T18:47:49Z","title":"ScoreFlow: Mastering LLM Agent Workflows via Score-based Preference Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T22:57:12.721732Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.04306"},"observation_digest":"sha256:553d2ed042e28d3c366b907ee942a63d02781b38926cc1073683a9192897a4ed","observation_id":"afa58b2c-fcc2-4aad-b839-c1d5bb82114a","resolution":{"observed_at":"2026-08-08T22:57:12.721732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-09T06:04:10.837435Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04370","last_updated":"2025-02-05T11:03:08Z","snapshot_observed_at":"2026-08-16T11:40:24.609748Z","submitted_at":"2025-02-05T11:03:08Z","title":"DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T06:04:10.837435Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.04370"},"observation_digest":"sha256:3c2cfeab64e105d33b19e3ecbff70c530a1531026cf691bb8c19b56ee38b1798","observation_id":"b3f3a684-9bf5-43ce-957c-1282e2e0a2ad","resolution":{"observed_at":"2026-08-09T06:04:10.837435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-09T06:01:13.315930Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04371","last_updated":"2025-02-05T11:28:11Z","snapshot_observed_at":"2026-08-14T11:41:11.089540Z","submitted_at":"2025-02-05T11:28:11Z","title":"PerPO: Perceptual Preference Optimization via Discriminative Rewarding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T06:01:13.315930Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.04371"},"observation_digest":"sha256:1708eac6dcae5bba3f43cb4a5dd74eb5c3a389ec0966ee35f7a70e2fa188de72","observation_id":"62278bdc-0074-46f9-b013-fb0fbe958c65","resolution":{"observed_at":"2026-08-09T06:01:13.315930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-08T22:36:35.280241Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04498","last_updated":"2025-02-06T20:57:36Z","snapshot_observed_at":"2026-08-13T05:00:36.654030Z","submitted_at":"2025-02-06T20:57:36Z","title":"Verifiable Format Control for Large Language Model Generations","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T22:36:35.280241Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.04498"},"observation_digest":"sha256:bb8e9ac21c22c2787a29a1773251e82b1309f59a4dccc44252d8230f8393a597","observation_id":"092edd43-0811-4cc9-81c1-8e01fbf5081a","resolution":{"observed_at":"2026-08-08T22:36:35.280241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-08T22:27:11.484390Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.484390Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:d69510ce2c13537597c221f20a79b02a2fbeaef2e59d290a468d6b4b3baab58c","observation_id":"dad8a705-5d0e-4ce1-bad6-2c9cfea9a834","resolution":{"observed_at":"2026-08-08T22:27:11.484390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-08T18:10:53.406513Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-17T04:53:19.281748Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.406513Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:d4f60a8332ce37640c84afe625c41184cff6cd5e0ccf386c0f7dd27336d878f7","observation_id":"01f88fa3-c77b-44a4-9d1a-f45e326b74e3","resolution":{"observed_at":"2026-08-08T18:10:53.406513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-08T19:40:42.014455Z","title":"URL https://books","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-11T15:21:29.975453Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.014455Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:3d7d918fdae4b17966b40362f93944d2a68c906238ee2a791f87d2a48fb825d5","observation_id":"caabea31-3e40-41bf-b61e-2ab71ce38f96","resolution":{"observed_at":"2026-08-08T19:40:42.014455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-08T12:17:45.928601Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07599","last_updated":"2025-06-06T11:18:28Z","snapshot_observed_at":"2026-08-16T01:46:33.823368Z","submitted_at":"2025-02-11T14:49:44Z","title":"DPO-Shift: Shifting the Distribution of Direct Preference Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T12:17:45.928601Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.07599"},"observation_digest":"sha256:b6365eb51ad582cd849d32832f89b335e40482145561bdd13ba4ddf49bda9aa6","observation_id":"5aa3f7ec-4432-493e-98b6-60b849829c99","resolution":{"observed_at":"2026-08-08T12:17:45.928601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-16T12:02:43.525929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13828","last_updated":"2025-04-28T12:41:07Z","snapshot_observed_at":"2026-08-18T03:47:57.203659Z","submitted_at":"2025-04-18T17:55:58Z","title":"Generative AI Act II: Test Time Scaling Drives Cognition Engineering","version":3},"reference_index":231,"source":"arxiv_source","source_observed_at":"2026-08-16T12:02:43.525929Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2504.13828"},"observation_digest":"sha256:2423ef10c87c259927d48d047cade548f5191a4aee0ac558236d0b3ac4a54a14","observation_id":"153236cf-b82e-4d69-88b7-d80305e92d13","resolution":{"observed_at":"2026-08-16T12:02:43.525929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-16T11:47:11.196787Z","title":"Simpo: Simple preference optimization with a reference-free reward, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14650","last_updated":"2025-04-20T15:12:14Z","snapshot_observed_at":"2026-08-18T10:05:29.855004Z","submitted_at":"2025-04-20T15:12:14Z","title":"A Framework for Benchmarking and Aligning Task-Planning Safety in LLM-Based Embodied Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T11:47:11.196787Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2504.14650"},"observation_digest":"sha256:f64f9acfcf53d177fbc71a546152779f9b17f8f236d2823d9c8a5168069b0fc8","observation_id":"7316f5ab-76ef-45b4-a826-b3a597abcc83","resolution":{"observed_at":"2026-08-16T11:47:11.196787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-16T11:27:36.859960Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.859960Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:b50e389501bc4fef68577ababf4513c8cbddda2f66e854d680e4210fb745fc1f","observation_id":"125a8a78-1c1b-4aac-af6b-4f56387f5b13","resolution":{"observed_at":"2026-08-16T11:27:36.859960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-16T11:08:33.628621Z","title":"SimPO : Simple Preference Optimization with a Reference - Free Reward , July 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18580","last_updated":"2025-04-23T05:11:21Z","snapshot_observed_at":"2026-08-17T18:28:37.066736Z","submitted_at":"2025-04-23T05:11:21Z","title":"Parameter-Efficient Checkpoint Merging via Metrics-Weighted Averaging","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T11:08:33.628621Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2504.18580"},"observation_digest":"sha256:4c5ce2b408ae15a122f837229240efbd6cb8a0cca00d0b7ebbe17c9d214a9a52","observation_id":"a3ab10ac-f381-42a0-9f3a-b2659842781f","resolution":{"observed_at":"2026-08-16T11:08:33.628621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-16T05:32:08.009827Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20482","last_updated":"2025-04-29T07:23:22Z","snapshot_observed_at":"2026-08-18T04:14:38.874681Z","submitted_at":"2025-04-29T07:23:22Z","title":"Group Relative Knowledge Distillation: Learning from Teacher's Relational Inductive Bias","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T05:32:08.009827Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2504.20482"},"observation_digest":"sha256:4b9fdfb729093dd20e1961d79914c2db7abd2b3262022f2fc7315a28599e4bb5","observation_id":"f6f4e601-c873-47e2-aba7-6faa4dfdabbf","resolution":{"observed_at":"2026-08-16T05:32:08.009827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-15T23:22:47.084128Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04993","last_updated":"2025-05-08T06:59:06Z","snapshot_observed_at":"2026-08-17T22:14:20.253479Z","submitted_at":"2025-05-08T06:59:06Z","title":"Latent Preference Coding: Aligning Large Language Models via Discrete Latent Codes","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T23:22:47.084128Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.04993"},"observation_digest":"sha256:d8f6d21f28155ebccbda5bb597da9513c844c99d97c54299531ccbf34927a143","observation_id":"bde7a4df-48c9-47f2-b78e-fd2143ecb272","resolution":{"observed_at":"2026-08-15T23:22:47.084128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-15T23:58:38.584826Z","title":"Simpo: Simple preference optimization with a reference-free reward.arXiv preprint arXiv:2405.14734,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06273","last_updated":"2025-05-13T04:50:08Z","snapshot_observed_at":"2026-08-18T07:43:08.251993Z","submitted_at":"2025-05-06T15:09:55Z","title":"Policy-labeled Preference Learning: Is Preference Enough for RLHF?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:58:38.584826Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.06273"},"observation_digest":"sha256:a2d72e3e85b987c9188e506c63a82504af5b3c7a5d2b2b466d38a0a732036e42","observation_id":"e416e5e9-a6b0-4958-b35c-d82664df16a0","resolution":{"observed_at":"2026-08-15T23:58:38.584826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-15T22:01:30.027666Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08507","last_updated":"2025-05-13T12:37:48Z","snapshot_observed_at":"2026-08-17T14:41:54.327556Z","submitted_at":"2025-05-13T12:37:48Z","title":"InfoPO: On Mutual Information Maximization for Large Language Model Alignment","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T22:01:30.027666Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.08507"},"observation_digest":"sha256:090387caf619a51ae135793fe0b297f430f806b66a6fb6bcf3fa9212918d982e","observation_id":"dd1d3041-7ae2-49bc-8346-b91dad26bed4","resolution":{"observed_at":"2026-08-15T22:01:30.027666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-15T21:55:41.000172Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08735","last_updated":"2025-05-13T16:47:00Z","snapshot_observed_at":"2026-08-17T06:28:45.166676Z","submitted_at":"2025-05-13T16:47:00Z","title":"Preference Optimization for Combinatorial Optimization Problems","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:41.000172Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.08735"},"observation_digest":"sha256:c5fbf07775a7c7689e9ae9fc5971252199e9d89aafbfb4de09fc61c0b20a913b","observation_id":"3d20fae7-511d-4bec-9a89-981bd0db9232","resolution":{"observed_at":"2026-08-15T21:55:41.000172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-15T21:10:57.547830Z","title":"Simpo: Simple preference optimization with a reference-free reward.arXiv preprint arXiv:2405.14734, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11081","last_updated":"2025-05-16T10:12:11Z","snapshot_observed_at":"2026-08-17T20:05:05.299606Z","submitted_at":"2025-05-16T10:12:11Z","title":"ShiQ: Bringing back Bellman to LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:57.547830Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.11081"},"observation_digest":"sha256:67156b9f8481d8ea4621bc54098501c9a5abbb20b79ecf8fadc601b8440db1dc","observation_id":"ee8ee31d-38fc-4f4e-a2a0-dde7bd755e87","resolution":{"observed_at":"2026-08-15T21:10:57.547830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T14:57:29.123942Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-17T10:55:42.169363Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:29.123942Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:1c2948e18eeab6cdac9ba4213771c97e80339189e216ae1b0cd75176146c25e4","observation_id":"6756cf52-6e94-4b84-9ade-83efaeb08cc7","resolution":{"observed_at":"2026-08-07T14:57:29.123942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T14:39:51.729438Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18071","last_updated":"2025-07-07T17:38:20Z","snapshot_observed_at":"2026-08-14T13:47:22.533486Z","submitted_at":"2025-05-23T16:16:46Z","title":"Extended Inductive Reasoning for Personalized Preference Inference from Behavioral Signals","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:51.729438Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.18071"},"observation_digest":"sha256:97777dba256ace4920544fde65dcfd90ef56545f50cd3adb27742831f6b61609","observation_id":"0b3a32fe-32a4-497d-8e53-5d3eeef18190","resolution":{"observed_at":"2026-08-07T14:39:51.729438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T14:15:19.460292Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-13T21:12:31.584269Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.460292Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:56ef058d42884a4fe76241c2e84e8eee1db7bde2cc9c8bdc4ee7556c021325eb","observation_id":"6748e5cc-8e5e-46e6-8f2f-fd9d81909661","resolution":{"observed_at":"2026-08-07T14:15:19.460292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T13:51:30.846708Z","title":"SimPO : Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20809","last_updated":"2025-05-27T07:16:40Z","snapshot_observed_at":"2026-08-17T02:09:28.315305Z","submitted_at":"2025-05-27T07:16:40Z","title":"Improved Representation Steering for Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:51:30.846708Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.20809"},"observation_digest":"sha256:561d4b9e454a0a20fd67d9d7c0c1ef1b507ec7d600ecf00a82324682c7e3a0db","observation_id":"83135dab-87ed-40d9-ab41-8082ed5c4dbc","resolution":{"observed_at":"2026-08-07T13:51:30.846708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T13:45:55.878822Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-16T21:04:06.257131Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:55.878822Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:d483882cca21a22501a334fbb7daa5f123d207289fcd0f3eb4c05ded6236328f","observation_id":"351d1a80-924b-4edd-b9c1-fef3035bda62","resolution":{"observed_at":"2026-08-07T13:45:55.878822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T12:19:30.952675Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-14T12:50:25.203482Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:30.952675Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:a711303a290ed1082ae68bdeb07cbc71429a8246c6dad42f8513c184e0439ea0","observation_id":"506e6805-bec1-42ef-8741-9021d8de2142","resolution":{"observed_at":"2026-08-07T12:19:30.952675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T12:12:59.152851Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00441","last_updated":"2025-05-31T07:46:42Z","snapshot_observed_at":"2026-08-18T10:32:47.902473Z","submitted_at":"2025-05-31T07:46:42Z","title":"K-order Ranking Preference Optimization for Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.152851Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2506.00441"},"observation_digest":"sha256:7ca1783d56e78d566491443ac05ffabb671ab3b9f5f375714616254443e3de5b","observation_id":"3dd5bdc4-8a04-4b06-b302-602038d8cdcf","resolution":{"observed_at":"2026-08-07T12:12:59.152851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T10:57:42.311077Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03827","last_updated":"2025-06-04T10:57:18Z","snapshot_observed_at":"2026-08-16T07:56:25.228597Z","submitted_at":"2025-06-04T10:57:18Z","title":"Multi-objective Aligned Bidword Generation Model for E-commerce Search Advertising","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:57:42.311077Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2506.03827"},"observation_digest":"sha256:118a50d74cbf557009bd695936f7364c1c70e69e5fc9d51f1c9c6dd2fd84618b","observation_id":"6f96841a-92ea-459f-9b7d-fa100a4db63b","resolution":{"observed_at":"2026-08-07T10:57:42.311077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T10:50:52.094128Z","title":"Swaroop Mishra, Daniel Khashabi, Chitta Baral, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04463","last_updated":"2025-06-04T21:29:11Z","snapshot_observed_at":"2026-08-14T12:28:02.149123Z","submitted_at":"2025-06-04T21:29:11Z","title":"Aligning Large Language Models with Implicit Preferences from User-Generated Content","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.094128Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2506.04463"},"observation_digest":"sha256:2827006f8181f5e573bb9f50a6df14608d94212717451cc1d5319c009fa93c89","observation_id":"e1b6d9c6-e1fe-4a0a-a63f-f42a2a325baa","resolution":{"observed_at":"2026-08-07T10:50:52.094128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T10:28:48.465974Z","title":"Simpo: Simple preference optimization with a reference-free reward.arXiv preprint arXiv:2405.14734, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-16T15:12:01.896424Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:48.465974Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:c0aef5c584ac961a3113c57520000da8ec9784b04fecaab63136e44703dceed6","observation_id":"7e9011be-a790-4f63-91ec-4a4a6320fcfe","resolution":{"observed_at":"2026-08-07T10:28:48.465974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T05:40:17.949816Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T15:06:19.935029Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.949816Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:5cd6b480e20dbdef0276623a4d476f7b7a910e63a30bb666af3b328d95853df7","observation_id":"3eaad74c-b477-4f61-ad2d-2514ce7af7ab","resolution":{"observed_at":"2026-08-07T05:40:17.949816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T05:14:47.373279Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08446","last_updated":"2025-06-10T04:44:28Z","snapshot_observed_at":"2026-08-17T06:22:42.572723Z","submitted_at":"2025-06-10T04:44:28Z","title":"A Survey on Large Language Models for Mathematical Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:47.373279Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2506.08446"},"observation_digest":"sha256:f06bd30248c93fca9b23b8934e51592c3f3643a930a690866a4cf19d99418d70","observation_id":"17e0d335-3124-4d7f-94a1-32fe35b845e5","resolution":{"observed_at":"2026-08-07T05:14:47.373279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T04:52:56.039373Z","title":"arXiv preprint arXiv:2405.14734","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09428","last_updated":"2025-06-28T02:26:03Z","snapshot_observed_at":"2026-08-17T19:17:08.139647Z","submitted_at":"2025-06-11T06:23:50Z","title":"Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:52:56.039373Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2506.09428"},"observation_digest":"sha256:8dc27b4e588efac7dd01b3f556624a9def669b227dba59f42bb282271d703840","observation_id":"50ebd32b-b888-4368-9177-dd1c1602f3a5","resolution":{"observed_at":"2026-08-07T04:52:56.039373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-06T20:43:27.665291Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02173","last_updated":"2025-07-02T22:12:03Z","snapshot_observed_at":"2026-08-07T13:56:29.658636Z","submitted_at":"2025-07-02T22:12:03Z","title":"Data Diversification Methods In Alignment Enhance Math Performance In LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:27.665291Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2507.02173"},"observation_digest":"sha256:d8e24434748a505676cd27d1cf809beca209731f5fc8dbb8cd0c99f072801000","observation_id":"a5119672-470d-427a-b83d-82a4addb89ff","resolution":{"observed_at":"2026-08-06T20:43:27.665291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-06T20:00:54.261257Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04072","last_updated":"2025-07-05T15:32:41Z","snapshot_observed_at":"2026-08-17T15:54:48.461408Z","submitted_at":"2025-07-05T15:32:41Z","title":"CTR-Guided Generative Query Suggestion in Conversational Search","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:54.261257Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2507.04072"},"observation_digest":"sha256:2ca50645233ad5f3b8c6ba66ec54c379791d224df6fb1f39967f454ba7636506","observation_id":"3c2eb424-7789-4bbc-bfe9-5ac4c44c0405","resolution":{"observed_at":"2026-08-06T20:00:54.261257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-06T18:38:10.166687Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07725","last_updated":"2025-07-10T12:58:45Z","snapshot_observed_at":"2026-08-18T03:15:40.567482Z","submitted_at":"2025-07-10T12:58:45Z","title":"Not All Preferences are What You Need for Post-Training: Selective Alignment Strategy for Preference Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:38:10.166687Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2507.07725"},"observation_digest":"sha256:a81778e06990f1201f79ba421b61f28cea7f4dbc4b4966e331396830fbbd3b77","observation_id":"3fd08862-22af-4123-86d5-2c1132d1fd50","resolution":{"observed_at":"2026-08-06T18:38:10.166687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-06T18:24:50.818055Z","title":"arXiv preprint arXiv:2405.14734","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08425","last_updated":"2025-07-11T09:11:18Z","snapshot_observed_at":"2026-08-16T11:15:48.987642Z","submitted_at":"2025-07-11T09:11:18Z","title":"A Survey of Large Language Models in Discipline-specific Research: Challenges, Methods and Opportunities","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.818055Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2507.08425"},"observation_digest":"sha256:db447651242c455e78108301cc1ab31414f4f1a2a7924a3130d3d384e2afa938","observation_id":"c272cd5d-6371-4d41-b9ee-39ecfea18ff8","resolution":{"observed_at":"2026-08-06T18:24:50.818055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":"2405.14734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-07-08T20:05:34.173711Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":"cs.CL","work_id":"09ac9a7a-d953-4f17-acda-ac268871a79c","year":2024},"citing_paper":{"arxiv_id":"2507.10722","last_updated":"2026-04-10T03:29:37Z","snapshot_observed_at":"2026-08-14T05:07:46.980450Z","submitted_at":"2025-07-14T18:43:05Z","title":"Bridging Brains and Machines: A Unified Frontier in Neuroscience, Artificial Intelligence, and Neuromorphic Systems","version":2},"reference_index":148,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:33.928616Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2507.10722"},"observation_digest":"sha256:10ae09ffced049f43e64e3415dff429f412a76aa7191d3357c0807e6ecbf0962","observation_id":"42a7accf-0fdd-4f7d-904e-d23cf86670f1","resolution":{"observed_at":"2026-05-19T04:42:04.881585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-15T17:46:03.154242Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20566","last_updated":"2025-07-28T07:03:04Z","snapshot_observed_at":"2026-08-17T20:50:06.404331Z","submitted_at":"2025-07-28T07:03:04Z","title":"Unlearning of Knowledge Graph Embedding via Preference Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:03.154242Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2507.20566"},"observation_digest":"sha256:24482d80dd1fc437efcb6486957e782e5997c873b502a50cea956c34453ea3e3","observation_id":"155970b4-1ee4-40bf-8aac-aaf1bc4814e9","resolution":{"observed_at":"2026-08-15T17:46:03.154242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-15T17:55:13.881021Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21182","last_updated":"2025-07-27T02:08:21Z","snapshot_observed_at":"2026-08-18T11:02:21.632028Z","submitted_at":"2025-07-27T02:08:21Z","title":"SDD: Self-Degraded Defense against Malicious Fine-tuning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:55:13.881021Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2507.21182"},"observation_digest":"sha256:20bc47036091ccf9598152129639931ca1e23d56b14fb036bc4990bf1e482ccc","observation_id":"d0b3af2a-d5aa-4a63-8a1e-37716d4fdfa1","resolution":{"observed_at":"2026-08-15T17:55:13.881021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":"2405.14734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-07-08T20:05:34.173711Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":"cs.CL","work_id":"09ac9a7a-d953-4f17-acda-ac268871a79c","year":2024},"citing_paper":{"arxiv_id":"2508.04149","last_updated":"2026-05-16T09:55:19Z","snapshot_observed_at":"2026-08-18T01:41:11.813052Z","submitted_at":"2025-08-06T07:24:14Z","title":"Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T23:46:24.208438Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2508.04149"},"observation_digest":"sha256:c7ce98666e5ef62ed5a841421ad21e18063e7a081e117a449bc98b267921b395","observation_id":"4e249eb3-adc2-4642-ab29-e7e659477e76","resolution":{"observed_at":"2026-05-21T23:50:47.560183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-05T16:11:23.181357Z","title":"SimPO : Simple preference optimization with a reference-free reward, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18914","last_updated":"2025-08-26T10:38:18Z","snapshot_observed_at":"2026-08-14T15:05:03.736963Z","submitted_at":"2025-08-26T10:38:18Z","title":"FormaRL: Enhancing Autoformalization with no Labeled Data","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T16:11:23.181357Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2508.18914"},"observation_digest":"sha256:b32f09376108642320f228e8f6f3dad362ef411be91b3797533ae4d3f800b929","observation_id":"423725fe-c6b9-420e-8742-329ebdf318c6","resolution":{"observed_at":"2026-08-05T16:11:23.181357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-05T15:25:35.355296Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19922","last_updated":"2025-08-27T14:30:08Z","snapshot_observed_at":"2026-08-16T17:36:03.255837Z","submitted_at":"2025-08-27T14:30:08Z","title":"HEAL: A Hypothesis-Based Preference-Aware Analysis Framework","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T15:25:35.355296Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2508.19922"},"observation_digest":"sha256:c5815f1acb891647a2b87a3d5dc20a9bfd2f013c23917ffa43016d726bce5f35","observation_id":"08de6af2-252b-4bd2-ac16-6ea088802325","resolution":{"observed_at":"2026-08-05T15:25:35.355296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-05T12:27:27.432883Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-17T12:03:39.901876Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.432883Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:d4ac579f40331882c33b786ad3718f0d6443eeb9c6b67114aeb7afa3bfb18e48","observation_id":"2e92be31-7c7f-4e0c-8035-366addc3ef44","resolution":{"observed_at":"2026-08-05T12:27:27.432883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-15T16:26:28.197031Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05605","last_updated":"2025-09-06T05:38:47Z","snapshot_observed_at":"2026-08-18T01:09:45.893295Z","submitted_at":"2025-09-06T05:38:47Z","title":"Icon$^{2}$: Aligning Large Language Models Using Self-Synthetic Preference Data via Inherent Regulation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T16:26:28.197031Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2509.05605"},"observation_digest":"sha256:0feae2a3e7ae261d5dca98bc129ca0124f6decb62714f2260cde03bcb2bc20e6","observation_id":"844276d1-41a8-416a-9280-a9e2de82f034","resolution":{"observed_at":"2026-08-15T16:26:28.197031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-05T11:11:56.685115Z","title":"arXiv preprint arXiv:2405.14734","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10515","last_updated":"2025-09-03T10:20:08Z","snapshot_observed_at":"2026-08-15T02:30:25.898502Z","submitted_at":"2025-09-03T10:20:08Z","title":"Adaptive Preference Optimization with Uncertainty-aware Utility Anchor","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:56.685115Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2509.10515"},"observation_digest":"sha256:15a44f53e9516a615d713032b6c016ee9c969c12dbdd0776d9729f34c2fdbe48","observation_id":"47391bd2-a653-478f-81d3-1b46faa0368a","resolution":{"observed_at":"2026-08-05T11:11:56.685115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":"2405.14734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-07-08T20:05:34.173711Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":"cs.CL","work_id":"09ac9a7a-d953-4f17-acda-ac268871a79c","year":2024},"citing_paper":{"arxiv_id":"2509.20265","last_updated":"2026-04-29T12:32:16Z","snapshot_observed_at":"2026-08-15T04:57:38.385397Z","submitted_at":"2025-09-24T15:52:36Z","title":"Failure Modes of Maximum Entropy RLHF","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-18T14:02:11.084514Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2509.20265"},"observation_digest":"sha256:2f8683115073b763f8b5a4b31124644556ea65e74f4a7e84097223e7fef1b1d9","observation_id":"06e79e23-3c1a-47d9-94e9-dc33394d7499","resolution":{"observed_at":"2026-05-18T14:02:39.905080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-03T18:50:00.510534Z","title":"Mehryar Mohri, Afshin Rostamizadeh, and Ameet Tal- walkar","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2512.03704","last_updated":"2026-06-25T10:15:50Z","snapshot_observed_at":"2026-08-15T17:00:05.976590Z","submitted_at":"2025-12-03T11:56:53Z","title":"Overcoming State Inertia: Minimally Invasive Temporal Alignment for Evolving Contexts","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T18:50:00.510534Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2512.03704"},"observation_digest":"sha256:637365df25bebc73fdf0a88322e7c028b74d94d7da797f34b9f59039a1cf1674","observation_id":"79534ca0-fd56-4a18-bcc4-64041dc21158","resolution":{"observed_at":"2026-08-03T18:50:00.510534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-03T08:15:25.513667Z","title":"Simpo: Simple preference optimization with a reference-free reward, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17717","last_updated":"2026-06-09T20:25:14Z","snapshot_observed_at":"2026-08-17T20:18:47.174609Z","submitted_at":"2026-01-25T06:40:25Z","title":"A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data","version":3},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-08-03T08:15:25.513667Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2601.17717"},"observation_digest":"sha256:4b4939929bb56330a70800bac731390c298c3de6352ba3d6f7fd38012380950f","observation_id":"009329e7-8c10-4483-aa89-bd2d50c491fa","resolution":{"observed_at":"2026-08-03T08:15:25.513667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":"2405.14734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-07-08T20:05:34.173711Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":"cs.CL","work_id":"09ac9a7a-d953-4f17-acda-ac268871a79c","year":2024},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-11T14:36:41.657189Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:4d1fc4724ec9b0a347b546d3e40b9971da3938788777b4ffef9ba43b02dc76c4","observation_id":"cb1bff44-c5c2-4ff6-9103-d2dacdc9e0a6","resolution":{"observed_at":"2026-05-11T09:16:03.613104Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":"2405.14734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-07-08T20:05:34.173711Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":"cs.CL","work_id":"09ac9a7a-d953-4f17-acda-ac268871a79c","year":2024},"citing_paper":{"arxiv_id":"2604.17396","last_updated":"2026-04-19T11:59:58Z","snapshot_observed_at":"2026-08-17T16:23:09.072924Z","submitted_at":"2026-04-19T11:59:58Z","title":"Representation-Guided Parameter-Efficient LLM Unlearning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T06:01:46.885030Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2604.17396"},"observation_digest":"sha256:17fe8e23636cdcf5ab946121093f2616a02d82d19a065b8703971e7fbe79127f","observation_id":"77c539dc-b714-4a85-8f06-965ef7ee6cbf","resolution":{"observed_at":"2026-05-10T06:06:19.274742Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":"2405.14734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-07-08T20:05:34.173711Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":"cs.CL","work_id":"09ac9a7a-d953-4f17-acda-ac268871a79c","year":2024},"citing_paper":{"arxiv_id":"2604.25701","last_updated":"2026-06-09T18:43:22Z","snapshot_observed_at":"2026-08-14T21:47:51.128502Z","submitted_at":"2026-04-28T14:28:37Z","title":"Bayesian Rate Inference for Sequence Motif Dynamics in Systems of Reactive Nucleic Acids","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T08:44:22.449452Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2604.25701"},"observation_digest":"sha256:0dc8f650d2c537c244ba4c7dba2a398c320f375e0a67d7bd296c2793137a3492","observation_id":"250db052-d982-4bac-9648-c592bb09cc85","resolution":{"observed_at":"2026-07-01T08:45:34.414498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":"2405.14734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-07-08T20:05:34.173711Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":"cs.CL","work_id":"09ac9a7a-d953-4f17-acda-ac268871a79c","year":2024},"citing_paper":{"arxiv_id":"2604.25702","last_updated":"2026-08-02T02:11:22Z","snapshot_observed_at":"2026-08-14T20:35:04.346674Z","submitted_at":"2026-04-28T14:29:06Z","title":"Backtranslation Augmented Direct Preference Optimization for Neural Machine Translation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T16:30:11.398851Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2604.25702"},"observation_digest":"sha256:09a17e8b9845bfcdb506dcc001ee6273e0110bffa730bd936bb43c062f17da9f","observation_id":"d709202f-d817-4d29-a000-a1ef074ccb9f","resolution":{"observed_at":"2026-05-11T23:41:16.638859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-04T05:23:57.330115Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.25702","last_updated":"2026-08-02T02:11:22Z","snapshot_observed_at":"2026-08-14T20:35:04.346674Z","submitted_at":"2026-04-28T14:29:06Z","title":"Backtranslation Augmented Direct Preference Optimization for Neural Machine Translation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:57.330115Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2604.25702"},"observation_digest":"sha256:de94c1adf0c9bf0011b37d614e801dd307fef4e54ab5c6dc241beb6558b609b9","observation_id":"69cfce6b-6145-4de9-b2d8-65af09009508","resolution":{"observed_at":"2026-08-04T05:23:57.330115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.14734/citation-record","integrity":"/paper/2405.14734/integrity","json":"/paper/2405.14734/citation-record.json","paper":"/paper/2405.14734"},"outbound":[],"paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 100 inbound Pith citation observations for arXiv:2405.14734."}