{"as_of":"2026-08-07T15:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b807e1d26e9263356cf4cdaec2f63f6b04db224e819113c1aaca77b152f01501","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:40:18.045861Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:11:49.149334Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:11:01.276341Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"cited_work":{"arxiv_id":"2506.07492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07492","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d9f90db0-d891-4b4c-83ea-75d22b71b2eb","year":2025},"citing_paper":{"arxiv_id":"2604.11259","last_updated":"2026-04-13T10:12:03Z","snapshot_observed_at":"2026-08-03T00:30:16.982532Z","submitted_at":"2026-04-13T10:12:03Z","title":"Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:11:49.149334Z"},"links":{"cited_paper":"/paper/2506.07492","citing_paper":"/paper/2604.11259"},"observation_digest":"sha256:2d31a0c242ef9d88b32732b418b60d9f7a58e8ba332701d467401ac98e51a3a9","observation_id":"8bb23c37-e426-491f-85e8-4e5cf80e523b","resolution":{"observed_at":"2026-05-11T09:11:01.282186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07492/citation-record","integrity":"/paper/2506.07492/integrity","json":"/paper/2506.07492/citation-record.json","paper":"/paper/2506.07492"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:40:17.805167Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.805167Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:325678505a9207db2a946c50543423425748650bbb52501b9eed41d06c4991ff","observation_id":"814c293d-8351-4c84-a266-071dd259de96","resolution":{"observed_at":"2026-08-07T05:40:17.805167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T05:40:17.810011Z","title":"Back to basics: Revisiting REINFORCE style optimization for learning from human feedback in LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.810011Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:9dd00ec39f39b6d9d18a1375ec6390e25fc6d0a45e6bc5e1fbe4f8b4f319c003","observation_id":"7733375b-fae1-45c0-94d4-4195aa3d2497","resolution":{"observed_at":"2026-08-07T05:40:17.810011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.814798Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.814798Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:7d4979b2f2783839e5e0a4851c45338861d98a26ae22416328f075736923e479","observation_id":"28a73e90-003e-4e7b-b6da-7f358d3c3f51","resolution":{"observed_at":"2026-08-07T05:40:17.814798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-08-07T05:40:17.819727Z","title":"Direct preference optimization with an offset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.819727Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:fa4050c038c016730e3eaed9f66654d025c4a883ed204425b15c2cf560d086dc","observation_id":"587bad29-1ff8-4a50-9e75-684abf84c47f","resolution":{"observed_at":"2026-08-07T05:40:17.819727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.824269Z","title":"G., Guo, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.824269Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:1347c75aced6692abbbf31e2515285b83147998fd9450c7f8831c6dd3a213ac9","observation_id":"79c6ad72-af3f-4126-a1aa-0601e6c05547","resolution":{"observed_at":"2026-08-07T05:40:17.824269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T05:40:17.828666Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.828666Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:440ca38d96def03e4ee3e85d5f7eb53b6aa96bc82075eac4af961c6c5c5253f6","observation_id":"c395d6de-c621-4c82-81ed-498728b3de65","resolution":{"observed_at":"2026-08-07T05:40:17.828666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T05:40:17.833973Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.833973Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:aa3f31f775a6efbd2dff08beb4316d15426022e283bb7e67032dd8df93aec1db","observation_id":"946f90a8-9e91-4dea-b308-9bf73f94ebfa","resolution":{"observed_at":"2026-08-07T05:40:17.833973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.839067Z","title":"G., Bradley, H., O’Brien, K., Hallahan, E., Khan, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.839067Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:67e34066d5fd47bddb0b767f296f73dc1a416dcf79ded6950bb73a4710d69d40","observation_id":"99bb216e-2624-4f7b-be33-c84082939d0b","resolution":{"observed_at":"2026-08-07T05:40:17.839067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.967825Z","title":"and Rinaldo, A","venue":null,"work_id":"13f0e369-6ed8-4718-92ea-4dbcde4dabe6","year":2022},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.843370Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:1c1998294e0824db3a5f7837c201c64ba48acab7e2be21a5d16de7181051b537","observation_id":"c0ef421c-5e0e-41ef-a713-4ec9ce79430c","resolution":{"observed_at":"2026-08-07T05:40:18.973562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.848212Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.848212Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:1bcb993edf6a9d2501b9b37539f745c599e1e471560df0e06687b81ee3bf5924","observation_id":"a615d5e9-8a6f-43da-84cd-91beb628846a","resolution":{"observed_at":"2026-08-07T05:40:17.848212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.942092Z","title":"T., Li, Y., Lundberg, S., Nori, H., Palangi, H., Ribeiro, M","venue":null,"work_id":"e972cc87-2748-4c6a-8141-43ae423de56b","year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.853062Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:81186a07c39a1a97f00aa17f210d161bf5bbbd43a17ebc4c6f181936af7b59af","observation_id":"d0320c2d-dee5-4d5f-b887-0426e3b56aea","resolution":{"observed_at":"2026-08-07T05:40:18.946737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.927273Z","title":"A survey on evaluation of large language models","venue":null,"work_id":"258195d5-e2d2-4075-8018-7a526c9c8bee","year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.857050Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:ecd7f1b02d2ffb46bf71c9da14c41c8d3e07d405b6993cbd282b4659e1e6638e","observation_id":"f4011480-7ab6-4093-8a94-ac2d90a9758d","resolution":{"observed_at":"2026-08-07T05:40:18.932346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09760","last_updated":"2025-03-07T15:26:03Z","snapshot_observed_at":"2026-07-06T18:30:50.693663Z","submitted_at":"2024-06-14T06:57:18Z","title":"Bootstrapping Language Models with DPO Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09760","snapshot_observed_at":"2026-08-07T05:40:17.861184Z","title":"Bootstrapping language models with DPO implicit rewards","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.861184Z"},"links":{"cited_paper":"/paper/2406.09760","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:d2efdf8eee77b09c59f88f98a5a3969ac3271211814d95ec0a3b0967779b55cf","observation_id":"48ce16f0-6567-4693-b4f1-353b408a368f","resolution":{"observed_at":"2026-08-07T05:40:17.861184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.911729Z","title":"Ultrafeedback: Boosting language models with scaled ai feedback","venue":null,"work_id":"df36d7d6-614f-4b57-87f2-31472e0daf3e","year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.865832Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:2d7bf5499b23ca94c990d1a5c552688183dbca3f5e7ff22192ff49fb5cad3b30","observation_id":"7bcc5977-6d0d-40de-9a89-38f77c56e04e","resolution":{"observed_at":"2026-08-07T05:40:18.916344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.869779Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.869779Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:dd7ee7992d2b844d545dc3bc15fdb3fd4c673a8179635c5a115df5c863c0fb5e","observation_id":"23d7df53-4660-4f6d-8841-aae19e1168d8","resolution":{"observed_at":"2026-08-07T05:40:17.869779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T05:40:17.873960Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.873960Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:fa8604072f0df2b6cfaf3018dd7a3ee8f2c508c7eb4bf6ee552a8cede9fad3a5","observation_id":"b3d3c575-fa88-4367-a5b8-4c98693dcc9f","resolution":{"observed_at":"2026-08-07T05:40:17.873960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T05:40:17.878001Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.878001Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:266e1fccc87da679a7fa54dc6844b9948d8564bfb43bb79e6e5ef62c500950e8","observation_id":"c7b3bf60-134f-42c1-a96a-de45a050d49f","resolution":{"observed_at":"2026-08-07T05:40:17.878001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04626","last_updated":"2024-04-06T13:24:37Z","snapshot_observed_at":"2026-07-06T17:56:32.062035Z","submitted_at":"2024-04-06T13:24:37Z","title":"Towards Analyzing and Understanding the Limitations of DPO: A Theoretical Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04626","snapshot_observed_at":"2026-08-07T05:40:17.882471Z","title":"Towards analyzing and understanding the limitations of DPO : A theoretical perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.882471Z"},"links":{"cited_paper":"/paper/2404.04626","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:8f5ec1655ff9636f8814beecfac4832c69dffe73fb605e8605258668cbf24979","observation_id":"29c4a37d-1f34-468f-90e3-68cb338f922a","resolution":{"observed_at":"2026-08-07T05:40:17.882471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00770","last_updated":"2024-07-12T20:29:57Z","snapshot_observed_at":"2026-07-06T16:13:31.328402Z","submitted_at":"2023-09-02T00:32:55Z","title":"Bias and Fairness in Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00770","snapshot_observed_at":"2026-08-07T05:40:17.886568Z","title":"O., Rossi, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.886568Z"},"links":{"cited_paper":"/paper/2309.00770","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:bbfa4e20d199bd4d435971867e3018a1d5f5bd16d38eb53da1ed052cc6127b7f","observation_id":"9ac79af2-8955-4e80-8e72-19b881aba6d1","resolution":{"observed_at":"2026-08-07T05:40:17.886568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-07T05:40:17.890649Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.890649Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:d49fa2b2071aa74a0c43483f6ff517f57351e59f80d4cc0732abdf33b8089413","observation_id":"ee9c6377-7ddb-4e9b-8ca8-df6af4d58ad9","resolution":{"observed_at":"2026-08-07T05:40:17.890649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09656","last_updated":"2025-02-25T10:19:35Z","snapshot_observed_at":"2026-07-06T18:00:16.713949Z","submitted_at":"2024-04-15T10:44:31Z","title":"Learn Your Reference Model for Real Good Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09656","snapshot_observed_at":"2026-08-07T05:40:17.894671Z","title":"Learn your reference model for real good alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.894671Z"},"links":{"cited_paper":"/paper/2404.09656","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:404d34b7ac2cbbcda721aa82062a37ec37be64e090c457508e59822c5524802a","observation_id":"9bf454c0-d0c9-470b-99ac-b9b245bc4f18","resolution":{"observed_at":"2026-08-07T05:40:17.894671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.885448Z","title":"and Pierskalla, W","venue":null,"work_id":"5ed7e5db-3010-4f80-a909-f0fe619be947","year":1971},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.898762Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:09cc3a612749f4b0cc25ddbb22e3516a3ac3d48c6a45c4a5a387ad9ca7e1b580","observation_id":"186c1af7-8365-4919-945b-3665b82d0bcd","resolution":{"observed_at":"2026-08-07T05:40:18.890064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:40:17.902738Z","title":"Deepseek- R 1: I ncentivizing reasoning capability in LLM s via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.902738Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:85409d9215341181369466e243e00ce93ab4a48636b328bdeb40fe522b5e279b","observation_id":"69ecbe00-bcf7-4428-91ab-5fbd69ed5fa4","resolution":{"observed_at":"2026-08-07T05:40:17.902738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-07T05:40:17.906760Z","title":"Orpo: Monolithic preference optimization without reference model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.906760Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:d453a1385e44bd8e3ea4f53fc6b518e30f38b519b753431b0adc7db4259eae47","observation_id":"e897ace9-7697-498a-ba60-dd00acfaa9c8","resolution":{"observed_at":"2026-08-07T05:40:17.906760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18742","last_updated":"2024-08-06T22:33:26Z","snapshot_observed_at":"2026-07-06T17:52:05.486230Z","submitted_at":"2024-03-27T16:39:28Z","title":"Understanding the Learning Dynamics of Alignment with Human Feedback","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18742","snapshot_observed_at":"2026-08-07T05:40:17.910923Z","title":"and Li, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.910923Z"},"links":{"cited_paper":"/paper/2403.18742","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:141347132d9b0ce1e1d48f2a38a4fd0166d2d4e8f5e889b2e386075d9dd51eff","observation_id":"e1a6ffa6-1c87-438c-9b8e-5c3b6a11a067","resolution":{"observed_at":"2026-08-07T05:40:17.910923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.870677Z","title":"https://github.com/huggingface/trl/pull/1265","venue":null,"work_id":"cfa26430-10b7-421a-abd7-77b6e8ea3669","year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.915435Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:2171d465e8ce90809bf0c094795d8ff4f3405540eeecdaf9dbd1327f40eafb46","observation_id":"d6a10d37-3832-4f5e-b2e4-bf3e7bf18d1e","resolution":{"observed_at":"2026-08-07T05:40:18.875095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T05:40:17.920012Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.920012Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:35731091ed97c06b2fa50f0829f2b4bebbfe0700f0feca902c5bd29274701eca","observation_id":"65a14ff0-d858-4efd-8bd0-57f9600c6629","resolution":{"observed_at":"2026-08-07T05:40:17.920012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.856146Z","title":"Common learning constraints alter interpretations of direct preference optimization","venue":null,"work_id":"df54d471-b747-4435-bdbc-c40c92308fc3","year":2025},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.924252Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:dae971e247bea89b5a8e5bca51eb38fbd5b6ac82914cc471c08f11a05fd58f9e","observation_id":"8dba99e6-d37a-40a8-8f2b-710645e6e6eb","resolution":{"observed_at":"2026-08-07T05:40:18.860673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.928495Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.928495Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:7f94752807448f18924057ded0972bb29209aa89627d7e584b3d952c25bd35a5","observation_id":"06e98cfe-841e-411d-b3be-83c479524cec","resolution":{"observed_at":"2026-08-07T05:40:17.928495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.933007Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.933007Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:196dd87c421c72bfa81b252f812f975a6a14394649e1ccf51c3d2c26c5aef51d","observation_id":"9daa881e-8c3b-4878-b8ce-b212ac68cc8f","resolution":{"observed_at":"2026-08-07T05:40:17.933007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10584","last_updated":"2024-02-25T19:15:26Z","snapshot_observed_at":"2026-07-06T17:04:09.326801Z","submitted_at":"2023-12-17T02:14:15Z","title":"Policy Optimization in RLHF: The Impact of Out-of-preference Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10584","snapshot_observed_at":"2026-08-07T05:40:17.937230Z","title":"Policy optimization in rlhf: The impact of out-of-preference data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.937230Z"},"links":{"cited_paper":"/paper/2312.10584","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:b36bfc9b5d39e26196501d0a5bf2c46c1e778f9d57113366accd3af37ec4bd3b","observation_id":"b7c6d022-71b5-42c7-90d9-c7b5bcbd23f7","resolution":{"observed_at":"2026-08-07T05:40:17.937230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03650","last_updated":"2024-10-03T17:13:04Z","snapshot_observed_at":"2026-08-03T13:15:41.992380Z","submitted_at":"2024-09-05T16:08:19Z","title":"On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03650","snapshot_observed_at":"2026-08-07T05:40:17.941137Z","title":"On the limited generalization capability of the implicit reward model induced by direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.941137Z"},"links":{"cited_paper":"/paper/2409.03650","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:04165b3e1d87fb8971de9087f82744d17c0e587be0a5e3bc60d10a059eb7267d","observation_id":"08f0ace7-0ead-474d-aaaf-3a7fb6b1e2fe","resolution":{"observed_at":"2026-08-07T05:40:17.941137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.820046Z","title":"L., Daly, R","venue":null,"work_id":"7999335f-3688-48fb-8882-dd088a865de6","year":2011},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.945451Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:f082a8b094849ca08570b987f03fc44a685a8ee4a5fce344d0058a72d133a10c","observation_id":"9735fcff-1b7a-4138-b7d9-0ee2d8104416","resolution":{"observed_at":"2026-08-07T05:40:18.825067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T05:40:17.949816Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.949816Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:aa86a1468b6037f10dc82fa07b4dd5f8ca2d87031fe9508625eb53cbee7d85c4","observation_id":"3eaad74c-b477-4f61-ad2d-2514ce7af7ab","resolution":{"observed_at":"2026-08-07T05:40:17.949816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08114","last_updated":"2024-06-28T08:22:01Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T23:09:00Z","title":"Active Preference Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08114","snapshot_observed_at":"2026-08-07T05:40:17.953985Z","title":"Active preference learning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.953985Z"},"links":{"cited_paper":"/paper/2402.08114","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:2f9efcc9564aeebe7ab3e946dcf55d330ce13fe0bef5450b9e7fd9d18da37591","observation_id":"a4d29e7f-976f-40d7-9278-28a683cbe2cb","resolution":{"observed_at":"2026-08-07T05:40:17.953985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.958243Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.958243Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:3393b831238e0cd4d24d45a2320a89f6e93fb62fed6ffe064fcb93a8a6f2e88c","observation_id":"31a19b43-e3f6-46ee-8746-81b6e9241408","resolution":{"observed_at":"2026-08-07T05:40:17.958243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-07-31T05:05:41.080329Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-07T05:40:17.962472Z","title":"Smaug: F ixing failure modes of preference optimisation with DPO -positive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.962472Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:aaf6436c09c494de6229df7e3bacdad2014106fe5bc280603f3c1191d5c66203","observation_id":"59fc338f-5672-41ee-81f7-61e83c74674c","resolution":{"observed_at":"2026-08-07T05:40:17.962472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19159","last_updated":"2024-09-09T04:39:31Z","snapshot_observed_at":"2026-08-04T02:06:41.618052Z","submitted_at":"2024-03-28T06:03:47Z","title":"Disentangling Length from Quality in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19159","snapshot_observed_at":"2026-08-07T05:40:17.966403Z","title":"Disentangling length from quality in direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.966403Z"},"links":{"cited_paper":"/paper/2403.19159","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:eb7f02241ed724da17f7d50f27acce93c849a6823d7970b4cb0d0504125225d6","observation_id":"2444c89a-c34f-44c2-a429-af7a17a9eb79","resolution":{"observed_at":"2026-08-07T05:40:17.966403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-07T05:40:17.970581Z","title":"B., Kumar, A., Zhang, G., and Levine, S","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.970581Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:15a1641f451309931323bb4219eeef0fe1350048c150b49ef237263739b8b94e","observation_id":"491e4e82-0774-4f99-87e1-63e182a5feaa","resolution":{"observed_at":"2026-08-07T05:40:17.970581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.795590Z","title":"and Schaal, S","venue":null,"work_id":"40cbb08a-ff7a-4572-a507-0babd64997dd","year":2007},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.974749Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:6a5e98fb43af2e01140bb22415b221d00a6aba283b9b66c41a0d6f503f8a886b","observation_id":"8aa11bc4-da3e-4fd0-9bad-4b0f8063e226","resolution":{"observed_at":"2026-08-07T05:40:18.799960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.978690Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.978690Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:c3b252fab633a952f6ae590f76cd516b399586e61e8ab57576869208d2121a06","observation_id":"1b783b59-d2c2-4763-b8b5-40991e1dd7b1","resolution":{"observed_at":"2026-08-07T05:40:17.978690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01241","last_updated":"2023-03-01T01:31:17Z","snapshot_observed_at":"2026-07-06T13:59:15.998573Z","submitted_at":"2022-10-03T21:38:29Z","title":"Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01241","snapshot_observed_at":"2026-08-07T05:40:17.982800Z","title":"Is reinforcement learning (not) for natural language processing: Benchmarks, baselines, and building blocks for natural language policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.982800Z"},"links":{"cited_paper":"/paper/2210.01241","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:ba19c59c7c0173d6633a70add163be4726ec4742510cb312f407606de22d1727","observation_id":"e4315a4d-6138-4a5e-a77a-56c8f4f8748a","resolution":{"observed_at":"2026-08-07T05:40:17.982800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.770007Z","title":null,"venue":null,"work_id":"02004aaa-aa99-4656-91bd-40bc9baf6e83","year":2019},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.987548Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:148c59332ae47fc2e0226618579e67ca8b24535727dc53c714f711a87f2cf630","observation_id":"d7a20d07-a754-48c3-9370-5e3d676483f5","resolution":{"observed_at":"2026-08-07T05:40:18.774723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:40:17.991410Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.991410Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:dfe3917b20cf013ab7efb60aa1df5e8f6e48b5856b224e55f12b2c580bb82ce1","observation_id":"62dbb63e-f8b3-434a-8ba4-510035797112","resolution":{"observed_at":"2026-08-07T05:40:17.991410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T05:40:17.996101Z","title":"Deepseek M ath: P ushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.996101Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:25878f89fcf187bcfe7ed59c78399de7fe4dc8976eec40a120afc51e6766feb4","observation_id":"9f0c31c3-9de9-486f-a220-7e3369074278","resolution":{"observed_at":"2026-08-07T05:40:17.996101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.755888Z","title":"The importance of online data: U nderstanding preference fine-tuning via coverage","venue":null,"work_id":"1554cc14-edff-40b6-ba7f-a94d6ced64f4","year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.000075Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:94567ed3c7e1da942a89d089cc3f59a2db635364cd9e1dcdb78df419e274c5e6","observation_id":"1e8ed1e2-e9a0-46cb-861c-81de59126bae","resolution":{"observed_at":"2026-08-07T05:40:18.760164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.740610Z","title":"M., Lowe, R., Voss, C., Radford, A., Amodei, D., and Christiano, P","venue":null,"work_id":"2e5ced1b-07be-4924-96c4-09d5a8032247","year":2020},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.004100Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:39bf7a4f529d8e54e3f8acafb6713f40e871c080a2c3c9515389bb3b368271bc","observation_id":"bf476f93-313a-4550-9249-1b0ca218ec18","resolution":{"observed_at":"2026-08-07T05:40:18.744990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.008082Z","title":"S., and Bagnell, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.008082Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:b16d45f6d368b79a94452f35a6027b935ebffa60d12606e8f9a7109b53001f50","observation_id":"ab772d2f-269f-40f3-bd2f-4188f6b385f7","resolution":{"observed_at":"2026-08-07T05:40:18.008082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14367","last_updated":"2024-06-02T22:00:42Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:20:18Z","title":"Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14367","snapshot_observed_at":"2026-08-07T05:40:18.011912Z","title":"Preference fine-tuning of LLM s should leverage suboptimal, on-policy data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.011912Z"},"links":{"cited_paper":"/paper/2404.14367","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:711b90eeeb9354c87269fc2047fcb0b93cc5bec94fa7a5be762dcee3dff815e5","observation_id":"c06bc6f8-2862-4405-a46a-971305cb837d","resolution":{"observed_at":"2026-08-07T05:40:18.011912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-07T05:40:18.016343Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.016343Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:e900a13da014a8221aaa43e1f30ec1ed52118e651a7c9dace4cbe33b334600e5","observation_id":"6bf9cade-a35f-49df-802a-f4f1d1c79197","resolution":{"observed_at":"2026-08-07T05:40:18.016343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.723355Z","title":"Beyond reverse KL : Generalizing direct preference optimization with diverse divergence constraints","venue":null,"work_id":"7f100fe6-4845-4f83-8313-6352f32b917a","year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.020516Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:15e249c0fe32f2a0eae81520755b074e17c5ad0c9c3e4f7f888e616481945a67","observation_id":"1b95adbf-7431-45c7-ada4-c04e01e142f6","resolution":{"observed_at":"2026-08-07T05:40:18.729750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11839","last_updated":"2024-10-07T17:59:42Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:58Z","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11839","snapshot_observed_at":"2026-08-07T05:40:18.024969Z","title":"Y., Xu, N., Zhang, S., Poon, H., and Chen, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.024969Z"},"links":{"cited_paper":"/paper/2406.11839","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:98306c7728906f9a1ed07b1e5a62a5207ec63ffd2882e931d8aceb0e06290914","observation_id":"88349501-5533-413c-8a10-33c1c19c004b","resolution":{"observed_at":"2026-08-07T05:40:18.024969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-07-06T18:01:05.698046Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-07T05:40:18.028816Z","title":"Is DPO superior to PPO for LLM alignment? A comprehensive study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.028816Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:c5cbfafb952d71df3b59d3e894edb95a14b65b8853e447ef21cb4eaa8719e180","observation_id":"a7cab4d7-a511-4c0c-860c-3f7a5215f708","resolution":{"observed_at":"2026-08-07T05:40:18.028816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T05:40:18.033007Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.033007Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:08acff5921e9f2f251c1ec20d9cf52cef5d58d11053f15d8fedb538f2d2d3169","observation_id":"3613ae8d-bd79-4c5b-9de9-0ce589cb6c87","resolution":{"observed_at":"2026-08-07T05:40:18.033007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T05:40:18.036861Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.036861Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:6bff64b0777ae4e1a406c571f00d037a29b295940c38c6418c4aefbc745a32c2","observation_id":"96a4e02e-511b-44ed-9d04-e4057629f929","resolution":{"observed_at":"2026-08-07T05:40:18.036861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T05:40:18.041204Z","title":"M., Stiennon, N., Wu, J., Brown, T","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.041204Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:8306d1d60ad5d587b0d293df8511f434ccc3ec71c5ff8d2aa48d003a27a43f4e","observation_id":"05aafb46-278e-4a2c-b53c-2bf326be5b86","resolution":{"observed_at":"2026-08-07T05:40:18.041204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.045861Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.045861Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:3b4e7d4894a7281ef3e9c33fd7888265507852a20b2db320c7f1932cf98a7d01","observation_id":"bc3da6ce-ceed-4082-a2d3-b4792f7fe476","resolution":{"observed_at":"2026-08-07T05:40:18.045861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2506.07492."}