{"as_of":"2026-08-08T00:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:80b51a052cfc5325850f55bb3433b59bc969875592932487c23c07bd25eb66b9","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:14:45.567616Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:01:59.503415Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T14:02:39.828118Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"cited_work":{"arxiv_id":"2506.08712","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08712","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ee9b25ff-896e-468b-a14e-fbf846513ad7","year":2025},"citing_paper":{"arxiv_id":"2509.20265","last_updated":"2026-04-29T12:32:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T15:52:36Z","title":"Failure Modes of Maximum Entropy RLHF","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-18T14:02:11.084514Z"},"links":{"cited_paper":"/paper/2506.08712","citing_paper":"/paper/2509.20265"},"observation_digest":"sha256:38817afc61d7b972a956476d222726e8cdf1f7a62fa073edef2b86485d69aefe","observation_id":"71ed9b45-e61e-4f44-81eb-d7947419bbf3","resolution":{"observed_at":"2026-05-18T14:02:39.830504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08712","snapshot_observed_at":"2026-08-02T10:01:59.503415Z","title":"S., Yoon, E., Hasegawa-Johnson, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16240","last_updated":"2026-06-26T03:03:15Z","snapshot_observed_at":"2026-08-08T00:34:09.048494Z","submitted_at":"2026-06-26T03:03:15Z","title":"Normalized Rewards for Preference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T10:01:59.503415Z"},"links":{"cited_paper":"/paper/2506.08712","citing_paper":"/paper/2607.16240"},"observation_digest":"sha256:0f1a47cdf220cceeb9bd7be56f22c7c293e74bbeff619e80dc0e313c144f1f29","observation_id":"bf7f5771-d720-4a92-87dc-47e4c6c247e1","resolution":{"observed_at":"2026-08-02T10:01:59.503415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08712/citation-record","integrity":"/paper/2506.08712/integrity","json":"/paper/2506.08712/citation-record.json","paper":"/paper/2506.08712"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.441337Z","title":"Explaining individual predictions when features are dependent: More accurate approximations to shapley values","venue":null,"work_id":"b2e75de7-b20c-4adb-a288-129af7337788","year":2021},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.625861Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:789035fbdb5542ca9c0ba62f427b5ba79dcd2bf99dcfd6c12285f554e51a0a67","observation_id":"1792dcec-7e4b-485d-aab6-2652c6154666","resolution":{"observed_at":"2026-08-07T05:14:47.444061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:41.672739Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.672739Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:46edd88f547c2d36d201baf594284aaf0d80a48b7dde937d04e970f4fc48b3d3","observation_id":"98329f87-3bfb-457c-ba45-3f3c6e1eacf2","resolution":{"observed_at":"2026-08-07T05:14:41.672739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.428455Z","title":"Mitigating reward over-optimization in direct alignment algorithms with adaptive importance sampling, 2025","venue":null,"work_id":"9d062d37-95d9-4849-8ede-af8a155c3d1a","year":2025},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.768753Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:579d40e831850767861c78591375d7f1e9a8093bf64d2147aebec24bd81e0a69","observation_id":"425b234e-dc88-4f52-914a-71c22079b1b3","resolution":{"observed_at":"2026-08-07T05:14:47.431146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.420847Z","title":"G., Guo, Z","venue":null,"work_id":"1dd06541-2831-4589-8479-1c600bf43ffa","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.913775Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:afb1736fb573c552fe677c8cd3fc428404c1d50640f2b03c758eb9af444b344c","observation_id":"1638c1d0-5da9-4405-87c8-ac49348bd144","resolution":{"observed_at":"2026-08-07T05:14:47.423282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:42.023438Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.023438Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:8cfc2485b8f64b349421efbc3f737109dfea79c8de6bd9ddfce30c9bb6f77c1e","observation_id":"24dd7f57-28c4-4fe8-9074-5489596df715","resolution":{"observed_at":"2026-08-07T05:14:42.023438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:42.135215Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.135215Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:c8f60aaf5189a8546d3e7decdc9d3ac0a655f8bdf2303be07047ce7dca593b31","observation_id":"fceb882e-572d-44f2-beca-7305daa69a4c","resolution":{"observed_at":"2026-08-07T05:14:42.135215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.413141Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":"dc62e87b-5dac-4e97-81ce-c374e1b21516","year":2017},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.210513Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:5d21b43633e6ec78ea5f0a73acf2a54830098b81c18238f3cbc5590db4f70835","observation_id":"eeb05f53-2f33-4bc0-b3c9-4eb5bc98e9c0","resolution":{"observed_at":"2026-08-07T05:14:47.415696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.405338Z","title":"Ultrafeedback: Boosting language models with high-quality feedback, 2023","venue":null,"work_id":"d2a629d8-6b5f-4a86-9923-796fad9d1628","year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.296984Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:597043b4572b277750c6582d0e66500aae7be5225306bd4ed61ad53ca2220966","observation_id":"95b809b0-5d62-4004-b9d9-101bc6a66065","resolution":{"observed_at":"2026-08-07T05:14:47.408306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:42.398724Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.398724Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:22ed40c4310e2ad977d897cfae97157490333773f501835509a1674f9a764c65","observation_id":"7e194a62-4662-4361-ba68-22a6d3f5ea1d","resolution":{"observed_at":"2026-08-07T05:14:42.398724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T05:14:42.513413Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.513413Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:12cb606d20ea7d459b990a579c77d71f03056f6790d7251f846c36fc0d709a9b","observation_id":"45141898-afe8-484c-8e62-c08716403b3e","resolution":{"observed_at":"2026-08-07T05:14:42.513413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T05:14:42.597895Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.597895Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:a96b2192770cefc608a2d2255d409e763dc1f8b6eb455d9db00c25c893abd53a","observation_id":"da680899-0219-4152-ad23-3e93ca90f203","resolution":{"observed_at":"2026-08-07T05:14:42.597895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:42.724379Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.724379Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:f21ba22cbeb5893b74471d839ce362dab3de6847e277a8aa1cee98843fefda6f","observation_id":"31236e31-6e00-4b39-85ac-7f5232678988","resolution":{"observed_at":"2026-08-07T05:14:42.724379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.392845Z","title":"Beyond imitation: Leveraging fine-grained quality signals for alignment","venue":null,"work_id":"06f6d863-e2cc-4cb7-ae37-4327ad151ac6","year":null},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.807169Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:b088a1aab94fd838ef35ffc72d35e8355be31a9fd6491746f79635660694e832","observation_id":"cda1935b-ddae-4a4b-8f78-97fbe109079d","resolution":{"observed_at":"2026-08-07T05:14:47.395535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.384504Z","title":"A probabilistic earley parser as a psycholinguistic model","venue":null,"work_id":"98df7326-3e2a-4286-a643-004832b46d0b","year":2001},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.938224Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:86bbebde2f99f8d00d8a5c944b964345d46dd029166a9cbdbb08aa6e26e0e7ea","observation_id":"a463a060-2d3c-49a0-b719-d5e49148b80e","resolution":{"observed_at":"2026-08-07T05:14:47.387379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.376686Z","title":"Reference-free monolithic preference optimization with odds ratio","venue":null,"work_id":"60824744-8455-4589-b5d3-c3af4c0710cd","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.033275Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:b5d38d83955e0318cace5832a46f57446d3223116daa00a5282bca03eb2aeddb","observation_id":"4bfa7d60-0423-4c83-aebd-ddfe0126531f","resolution":{"observed_at":"2026-08-07T05:14:47.379614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.368739Z","title":"and Levy, R","venue":null,"work_id":"d823ec1e-ba5a-48d4-9c1a-b5aa2cf36b25","year":2006},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.126624Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:eb9eb4d0322e23b6aeab134ff5086a2c6e53c42475a8d7f3245e57618ebfe8fe","observation_id":"0350f2ed-d3ce-4d3c-830c-19bf1471817b","resolution":{"observed_at":"2026-08-07T05:14:47.371360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T05:14:43.201027Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.201027Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:875a8d3c33ee52464221169ff158735808f9dbcc6d6c2b7d2ab26b4fe1b8ae1e","observation_id":"cc52e0c3-8bb3-4d94-a507-dffcc102d1e6","resolution":{"observed_at":"2026-08-07T05:14:43.201027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-07T05:14:43.248348Z","title":"Step-dpo: Step-wise preference optimization for long-chain reasoning of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.248348Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:90d0e0e2d24cb91355d886bf268facc2c85eb84c295a51640a3cd29c578f0c04","observation_id":"d19fd706-3403-47a2-ad12-cb865ce56a1b","resolution":{"observed_at":"2026-08-07T05:14:43.248348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.360434Z","title":"E., and Stoica, I","venue":null,"work_id":"d97ccf77-3352-4f97-a675-01b4081edc39","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.330957Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:68a91566137a6514078ec0c480b5bad90b63b458a2be23ca2f91307ab47ce725","observation_id":"20b7bea3-d90f-4df8-87b0-84308a90de37","resolution":{"observed_at":"2026-08-07T05:14:47.363481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.352975Z","title":null,"venue":null,"work_id":"481e8932-93e2-41ba-ba61-5872ad52e384","year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.419011Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:98589899e986ba947c53aa6d22eb79c3e0a512f446473543f63381e480763bc1","observation_id":"4e3df7f6-7a62-4f25-8a5d-58e625bfe14f","resolution":{"observed_at":"2026-08-07T05:14:47.355563Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.344773Z","title":"Not all tokens are what you need for pretraining","venue":null,"work_id":"5afbbd46-cae8-4c22-a07f-d099e213bd09","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.489684Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:489718167fabea10230124cbf5aa36de74b13c0d1ee30c58dcc5df378ff96695","observation_id":"ebe34097-d2cb-4aaa-8b22-31ada1e6919a","resolution":{"observed_at":"2026-08-07T05:14:47.347856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.337340Z","title":"Provably mitigating overoptimization in RLHF : Your SFT loss is implicitly an adversarial regularizer","venue":null,"work_id":"caff17c6-79aa-457f-b220-f19c0fee7998","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.553587Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:0f3215ba7ed79f75efec753d0a111f0d2fdd470137448b17d39c15a0fc09e862","observation_id":"35ed17eb-b8c4-4dc6-a9fe-754b7d2fe017","resolution":{"observed_at":"2026-08-07T05:14:47.340004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:43.624256Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.624256Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:cb4d93546497d90ef42ea75ee68e8fb4359e61278dc5c32261210764932d9ca6","observation_id":"c436c405-a559-4406-a993-cd241f3d01e9","resolution":{"observed_at":"2026-08-07T05:14:43.624256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.324266Z","title":null,"venue":null,"work_id":"367468d3-594b-43c9-93a9-de48ec332950","year":2017},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.698453Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:b34ec99d4bfe40092b4d71234dbb93bbc830d19113be1d6b9480b234ee7ba2af","observation_id":"1adf573f-560b-4750-9223-cce8d4ca61cf","resolution":{"observed_at":"2026-08-07T05:14:47.326955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.315376Z","title":"Sim PO : Simple preference optimization with a reference-free reward","venue":null,"work_id":"980af936-0ff2-4dba-bc15-1e47efc3a3be","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.768830Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:008e78cfaeb8d1a2223559b8472a42eeca828fe47d604e8c4f337561bbc272f6","observation_id":"00841d81-e6b7-49be-92af-ad2c92ce077d","resolution":{"observed_at":"2026-08-07T05:14:47.318519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:43.851661Z","title":"and Frank, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.851661Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:2e9497719f599041c90efe6aced8c66e9a8a9979d41da7e7a635c374daae3621","observation_id":"0be6bca5-b5ca-4bc2-8d9a-e9b77595f50f","resolution":{"observed_at":"2026-08-07T05:14:43.851661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.302718Z","title":"F., Leike, J., and Lowe, R","venue":null,"work_id":"cb02bc91-81c9-40be-bcfb-2770e3489514","year":2022},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.920632Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:8c556b63152114d5091e29d44528f579938d83aaefb88bfa86df70cdd365199e","observation_id":"c3e0bd5a-75e2-468e-b903-a10285da3a45","resolution":{"observed_at":"2026-08-07T05:14:47.309553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.206590Z","title":null,"venue":null,"work_id":"12b438b0-7f85-421a-83fe-8aa540a804f4","year":2017},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.027094Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:19a32cc0640140b7d09187b49c1af06e07b19a62ef0d47c47c51351e11b2c02c","observation_id":"2ee4273c-88b4-4a4d-9b2c-3d9c1bf7385f","resolution":{"observed_at":"2026-08-07T05:14:47.262125Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19159","last_updated":"2024-09-09T04:39:31Z","snapshot_observed_at":"2026-08-04T02:06:41.618052Z","submitted_at":"2024-03-28T06:03:47Z","title":"Disentangling Length from Quality in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19159","snapshot_observed_at":"2026-08-07T05:14:44.113845Z","title":"Disentangling length from quality in direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.113845Z"},"links":{"cited_paper":"/paper/2403.19159","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:8725c5fef58c34c52270f7a4086b174147ff07033da108d174ff7f19496d8b1b","observation_id":"51e5e0f4-f6c6-48d5-9ce1-3c8eade8b949","resolution":{"observed_at":"2026-08-07T05:14:44.113845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.873819Z","title":"B., Finn, C., and Niekum, S","venue":null,"work_id":"0b495698-e333-4c92-800d-c580d8fee2fe","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.195859Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:f6b807d2aa5919154f28d85421d53221be64d7962fdaf1993b9be1aa673dfa47","observation_id":"99509864-b239-4a70-b17e-fc59fcc97449","resolution":{"observed_at":"2026-08-07T05:14:47.059754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.709918Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":"447f1f12-1de3-463a-bb3f-3b7bbc4bdc88","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.285480Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:121d0523d139c1778bd76775cc8938f5985600d86376233f710671dc975655e5","observation_id":"97ba12ec-4d95-47d8-8976-42f0e7f567b6","resolution":{"observed_at":"2026-08-07T05:14:46.766693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.626253Z","title":null,"venue":null,"work_id":"762c14a2-54b0-4027-9685-23fc605cab94","year":1953},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.371677Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:cf07407e43f08f3b42ab787e74d77022bc50f4147753344feda7c58a26447d58","observation_id":"84fcbaca-6bd8-4148-bf89-5d8863154608","resolution":{"observed_at":"2026-08-07T05:14:46.666687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:44.448597Z","title":"S., and Martin, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.448597Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:438edd95a51438c9ffd80f57be7f905c253870c5fa8d2cdcddbfaf048d4357ec","observation_id":"58b40bde-26e0-4200-923a-e26b358609f2","resolution":{"observed_at":"2026-08-07T05:14:44.448597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:44.525429Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.525429Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:f13715f4847d001c605afcb42cbbf6a0585c709660413fcf0bfa7c979748a94c","observation_id":"4cbce2f8-8b15-43d9-93b5-5f33853423d1","resolution":{"observed_at":"2026-08-07T05:14:44.525429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:44.606004Z","title":"Trl: Transformer reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.606004Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:514f3a3bca4f33180245edd7d065bd1fc5d1eadb4aa6505c2ac4fd00f4c40da2","observation_id":"db5ae8f2-5af7-4907-8de6-8a392005d2f9","resolution":{"observed_at":"2026-08-07T05:14:44.606004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.500403Z","title":"V., Murray, K., and Kim, Y","venue":null,"work_id":"dbc2309f-80a6-4ff7-8f5e-3678246bacc1","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.660895Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:35d45cced757e27ed0429198ea6e0b9a49b6a755f21321605a16a8f75d1fb6ee","observation_id":"5991f4c3-c998-4191-811e-7aca3019706c","resolution":{"observed_at":"2026-08-07T05:14:46.544726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:44.737682Z","title":"Selective preference optimization via token-level reward function estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.737682Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:902b2e800c5e8680f3d1d88c0648d2a5c84d934c95e8029125c91a61d02fa9f9","observation_id":"8ad94440-41a3-4cd0-9335-cea3803121d6","resolution":{"observed_at":"2026-08-07T05:14:44.737682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.384617Z","title":"S., Hasegawa-Johnson, M","venue":null,"work_id":"c41a7796-3cd0-419f-87b8-9ecb5b8211df","year":null},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.802381Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:68f90c877a360878b970f18560d6e7f3231f00ed2e8e0feb6ea7be8dfe5b8903","observation_id":"34656020-91f9-4927-a40e-e1992ba9a49a","resolution":{"observed_at":"2026-08-07T05:14:46.416795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:44.866870Z","title":"S., Eom, S., Han, G., Nam, D., Jo, D., On, K.-W., Hasegawa-Johnson, M., Kim, S., and Yoo, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.866870Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:63a272142242a57cf99032e3198abc8d25e780fd2214a4d79fa90eadc83dad0e","observation_id":"d628485e-9912-4853-92ab-417c060d13ae","resolution":{"observed_at":"2026-08-07T05:14:44.866870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02472","last_updated":"2024-01-18T07:27:09Z","snapshot_observed_at":"2026-07-06T14:58:44.419522Z","submitted_at":"2023-03-04T18:06:36Z","title":"ESD: Expected Squared Difference as a Tuning-Free Trainable Calibration Measure","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02472","snapshot_observed_at":"2026-08-07T05:14:44.934080Z","title":"S., Tee, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.934080Z"},"links":{"cited_paper":"/paper/2303.02472","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:7a5459e4ed9cea2f6b13f043ffdb0c4265e1e1ab7b3542014ceedc1586090351","observation_id":"683d2268-77fb-4ccf-95d4-895c8b07727f","resolution":{"observed_at":"2026-08-07T05:14:44.934080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14119","last_updated":"2024-03-31T13:36:54Z","snapshot_observed_at":"2026-08-06T08:53:00.100346Z","submitted_at":"2024-03-21T04:08:29Z","title":"C-TPT: Calibrated Test-Time Prompt Tuning for Vision-Language Models via Text Feature Dispersion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14119","snapshot_observed_at":"2026-08-07T05:14:45.017306Z","title":"S., Yoon, E., Tee, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.017306Z"},"links":{"cited_paper":"/paper/2403.14119","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:6c9b8ceb5d7fa37c88e40e1f3c78be0457abce18e28d8b63478b101b3576b845","observation_id":"a63adae7-2697-41d5-b8ca-70c8752b2ccf","resolution":{"observed_at":"2026-08-07T05:14:45.017306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:45.080901Z","title":"S., Kim, J., and Yoo, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.080901Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:8cd0e36d1a9ea1cf02a8eedcb7db541cd32f69f79166a9b17c15f486ca57c797","observation_id":"af5f835a-0a5b-41ae-ad1d-c0f68a006d57","resolution":{"observed_at":"2026-08-07T05:14:45.080901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.249737Z","title":"Tpc: Test-time procrustes calibration for diffusion-based human image animation","venue":null,"work_id":"3a2549f0-6a41-4cf3-a79f-2f2980778ec4","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.170101Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:71e8d4e19d6933eab8f7dced063b46543efc8d1dc0e524291aecf43011e582cc","observation_id":"77f05230-c189-4624-9aff-b930a294cd2c","resolution":{"observed_at":"2026-08-07T05:14:46.318669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.161622Z","title":"RRHF : Rank responses to align language models with human feedback","venue":null,"work_id":"012db0b5-a75c-4ba4-86b7-0633fa000236","year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.244056Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:6e48167fb5add85da0699e4dab1fef7cbdf0693d5fdf9ee5731c42b2741873dd","observation_id":"bba0a0e7-f868-48a1-bac1-32d45411538f","resolution":{"observed_at":"2026-08-07T05:14:46.199167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.029243Z","title":"Token-level direct preference optimization","venue":null,"work_id":"b3fa195f-41c9-482f-b6d1-979c4a751c2d","year":null},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.277916Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:dd6e95ad545dc0a74e85d7c71e4b958351fb797b1bd1d5f98845fcb6597ae8ec","observation_id":"1eeb1d21-fd0d-487f-a370-57350e86ea35","resolution":{"observed_at":"2026-08-07T05:14:46.081029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T05:14:45.342641Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.342641Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:09a832ab2254dc6a9b234d7e198615a560e8880056898ae0fb7d770f8f0f331e","observation_id":"1dc57259-667c-4d60-b5b1-f7b8a9949c6b","resolution":{"observed_at":"2026-08-07T05:14:45.342641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:45.422180Z","title":"P., Zhang, H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.422180Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:60d8024ff5e5131fad05707d1a9248e31ea07a785bfb6dd5d3df0885ff9a5c9f","observation_id":"9e796a6b-07b7-440a-873a-5c8207e6972e","resolution":{"observed_at":"2026-08-07T05:14:45.422180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02685","last_updated":"2024-12-03T18:56:07Z","snapshot_observed_at":"2026-08-07T16:08:13.893412Z","submitted_at":"2024-12-03T18:56:07Z","title":"T-REG: Preference Optimization with Token-Level Reward Regularization","version":1},"cited_work":{"arxiv_id":"2412.02685","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02685","snapshot_observed_at":"2026-08-07T05:14:45.698229Z","title":"T-REG: Preference Optimization with Token-Level Reward Regularization","venue":"cs.CL","work_id":"a668d5e0-b145-4899-b23c-50e0fb2ea912","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.496001Z"},"links":{"cited_paper":"/paper/2412.02685","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:93d4cac7048351384bf961f3d49fe72f7b92ec468676dc3f9f816909bf9ece65","observation_id":"2cb49ef8-9c9b-4f85-9bb5-73958cbf26a9","resolution":{"observed_at":"2026-08-07T05:14:45.733451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:45.567616Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.567616Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:12f2e138feb3918959fa04aff1c3e94b469a2b47c1780e3200d9c6c1ad77f731","observation_id":"a0194a21-5383-4b36-b536-83db9bb9b377","resolution":{"observed_at":"2026-08-07T05:14:45.567616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T05:01:30.879360Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 2 inbound Pith citation observations for arXiv:2506.08712."}