{"as_of":"2026-08-07T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e86921d54925db5b3e869844afc8b27efce5f5c702d6d85df04d6a1b7dbbccbc","coverage":[{"denominator":249,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T14:10:49.634358Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.06036/citation-record","integrity":"/paper/2605.06036/integrity","json":"/paper/2605.06036/citation-record.json","paper":"/paper/2605.06036"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instance-dependent label-noise learning with manifold-regularized transition matrix estimation","venue":null,"work_id":"46347d99-c4bc-4d87-ad15-89a1dc8c7c98","year":2022},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:c8a251ff802226d8555128a2f432c49d74fdc395dd21d30f9a3dabf5c64c125c","observation_id":"ef82d082-58f7-46aa-b844-715c66e05766","resolution":{"observed_at":"2026-05-26T11:47:16.752084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Class-dependent label-noise learning with cycle-consistency regularization","venue":null,"work_id":"363fea3f-a43e-4dbd-afbb-50cc28299fe4","year":2022},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:f3017ffacded7cfc560fbe307afd04beb19681637eb8211449d63c0710930f07","observation_id":"716b047e-b429-4f28-98f4-31adf64942d9","resolution":{"observed_at":"2026-05-26T11:47:16.741408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Joint distribution optimal transportation for domain adaptation","venue":null,"work_id":"ce7c2b08-0766-4aa7-916c-79eb71efb12f","year":2017},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:7ca46fd34e5e1765fb8cc2f22ba7df59e170ef7215ad18cf46ae644cfbeac9da","observation_id":"d9940485-070f-4aa2-bed8-d87a54cd8fda","resolution":{"observed_at":"2026-05-26T11:47:16.760077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unbalanced minibatch optimal transport; applications to domain adaptation","venue":null,"work_id":"e5f5bb10-1ef8-4a68-be9e-d5acb9bf31c9","year":2021},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:4b919817e1199cb87a5cf57356bfea0ee12878206f7a15ddd2de4026eb18f560","observation_id":"85b27b5b-19ee-4a38-9ea4-7a0dc05c3aa1","resolution":{"observed_at":"2026-05-26T11:47:40.443247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on llm-as-a-judge","venue":null,"work_id":"20f9336f-de0f-4831-a326-90199f73ca18","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:3faadd9fb32a3bcc6ed838de8bcc09bea93ef9402faf19801308c82daa904bf7","observation_id":"fa7553cc-59d8-43ab-8147-44c1e1aa482d","resolution":{"observed_at":"2026-05-26T11:47:40.304146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning","venue":null,"work_id":"820c27ba-e073-4db5-8550-cdfd7fe170e2","year":2025},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:f81b6bd60badb985575fc2847b49ce670094cf59b3b79ad60b993f781001ce32","observation_id":"c2d6b223-8d44-44e6-be33-6b0fbc8fd9de","resolution":{"observed_at":"2026-05-26T11:47:40.363637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Co-teaching: Robust training of deep neural networks with extremely noisy labels","venue":null,"work_id":"f5279b6a-a8b3-442c-bc0b-2bc6befc6027","year":2018},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:8ba07fcc2afbcd37e74d4a59c3c8d50b32bd0c9f2f25834694124e012710c6bc","observation_id":"0193d076-c9a8-4df1-a938-47b981dee321","resolution":{"observed_at":"2026-05-26T11:47:40.300802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Co-teaching: Robust training of deep neural networks with extremely noisy labels","venue":null,"work_id":"397374c1-bcb7-43be-8a84-8667aec69cec","year":2018},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:0d99218635e13eb20d0f21f0784a66b2582b3a7b1d25a359100ecb58a7031a84","observation_id":"0db68485-3333-4ae0-8f9f-debff866412f","resolution":{"observed_at":"2026-05-26T11:47:40.561685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on the role of crowds in combating online misinformation: Annotators, evaluators, and creators","venue":null,"work_id":"b1f77c8d-c4e9-46a2-9715-3f7cf806bf32","year":2025},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:554b07a90eaddfa32b185fbc4590c1322968e83f80f9d944758db53c725a8254","observation_id":"30c19581-d20c-474f-901e-13588a611e06","resolution":{"observed_at":"2026-05-26T11:47:40.347194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T04:05:56.158513Z","title":"A., Zhou, J., Wang, K., Li, B., et al","venue":null,"work_id":"6554b355-24d7-48f5-b512-ae9bd3f676e8","year":2025},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:d2bc51ab9083781d85d10a0104a01ec078e41ab764e3cbfd3145be1f2b4c07f8","observation_id":"25492405-b697-45e2-b27a-2c3799a2250f","resolution":{"observed_at":"2026-05-26T11:47:40.576992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d8f5d7b4-bb45-4f6a-92e5-8f1d61d30d9a","year":2015},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:4d5870b749d409e6a26285b0c5d8634f71c2fd12b1c0d2c5d32984fed9b19bb6","observation_id":"021cd081-7240-4594-9111-c850c04da875","resolution":{"observed_at":"2026-05-26T11:47:40.287270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instance-dependent label distribution estimation for learning with label noise","venue":null,"work_id":"5e838da2-7850-4943-9e2b-5946e8d65770","year":2025},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:94913574d12ffe7e03fb922f0e8bb46d4aea113df09fc89810e26f08f5f283ac","observation_id":"932e336c-b758-4072-ac7f-e85e7e504dbc","resolution":{"observed_at":"2026-05-26T11:47:40.241869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning the latent causal structure for modeling label noise","venue":null,"work_id":"0db0c242-3af4-4cbc-82f3-785ec01fd91b","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:4548b11d30f5f099327835be625a73bf99b9ba1b0c87b80024e1f265fe154cbd","observation_id":"14365cfe-8f18-4d6b-92cb-2cd7cc8861cb","resolution":{"observed_at":"2026-05-26T11:47:40.342816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Curvature-balanced feature manifold learning for long-tailed classification","venue":null,"work_id":"239e3ed9-4bb7-40d2-9f18-d27d82931a62","year":2023},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:70d9ff5f38e7fcd71721d3ff788a8bdf9c001bdd2409dacf1458d0f5e8ecb2af","observation_id":"f96cd13e-6039-4355-90e4-705aa9cc11a5","resolution":{"observed_at":"2026-05-26T11:47:40.398151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inform: Mitigating reward hacking in rlhf via information-theoretic reward modeling","venue":null,"work_id":"5c61dfd6-407c-415e-b6cd-78ea325b8cfa","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:71d6ce087df19eb3d390512fb062fdd3f79a590b2ad8435b873eaac6b4c3ee6c","observation_id":"70140c73-b50f-4cb7-ad90-98526e58a6b2","resolution":{"observed_at":"2026-05-26T11:47:40.263732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Confident learning: Estimating uncertainty in dataset labels","venue":null,"work_id":"18e3c1f0-8ed5-4f07-ac03-304a66da7556","year":2021},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:1f42409748cf610ffd08fa16ac1dde41be8c691e972e836a2072fd5bc052e42f","observation_id":"f3fc44e2-fba2-4481-ae1e-4045ff79a575","resolution":{"observed_at":"2026-05-26T11:47:40.508583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"439ae0c7-6212-4a61-b8ac-4f0416cb6d32","year":2022},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:bffa3c3558ec9d266d888ab171e6a0a8a4c796cf0520b7a2e520bda841e690cd","observation_id":"5bb3f878-5a10-4039-92e8-749572f89f0a","resolution":{"observed_at":"2026-05-26T11:47:40.323448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making deep neural networks robust to label noise: A loss correction approach","venue":null,"work_id":"26d73125-62e3-442d-82c0-25c5295db1d6","year":1944},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:fc7200f1ce2731e975d75a96855b0fc1eef4fea16824a3459855c9313ade5629","observation_id":"27480ec9-280c-4101-b943-684f319a9ba6","resolution":{"observed_at":"2026-05-26T11:47:40.512604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:fedc4b9d862fc0a210d46378f806460e45f99935cadd8a337ee41d4e0ce0cc6d","observation_id":"82495d38-5e57-4ed7-9e81-8bf9fc70735b","resolution":{"observed_at":"2026-05-11T18:46:07.391607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9f7aed64-6362-4175-97c8-d071231ceff3","year":1948},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:f174c34a99c47415335febb49e294bc40f797dc2f1eea44456dfc07bcffb085b","observation_id":"90cbcea2-1e7a-42f7-b75a-5a895857fa30","resolution":{"observed_at":"2026-05-26T11:47:40.566431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"do anything now","venue":null,"work_id":"292328d3-8c07-4a64-91d8-875a60bd712d","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:e30a894ca0ec76cb99a023bd632e5876514e30eec62812160c52aa0aaa9c6c16","observation_id":"6d8d33a4-81de-4ad1-9a89-ae6c4222addb","resolution":{"observed_at":"2026-05-26T11:47:40.420826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Defining and characterizing reward gaming","venue":null,"work_id":"217b48bb-1d30-4fdc-8200-0511018f5312","year":2022},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:824817da2502b146f009a59ec162fb8933c907fd8920ef81be335856a658d655","observation_id":"49b62e6f-fb1c-46fa-8eba-7434a6eb8367","resolution":{"observed_at":"2026-05-26T11:47:40.479808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning from noisy labels with deep neural networks: A survey","venue":null,"work_id":"b47246ca-8fb0-41c5-9ac1-e8dbefe90e72","year":2022},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:ed278865c4d82cf433ab8b67bf70b6ea22a204040eed9a7e90d4fe34206fa414","observation_id":"ef53027c-9cae-418d-a0b4-faa0060be3ad","resolution":{"observed_at":"2026-05-26T11:47:40.457995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimal transport for treatment effect estimation","venue":null,"work_id":"3c3b8383-5f75-4d6c-af0e-7d94879e2baf","year":2023},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:18b7bb66e304e3a45ccac68f9bc70453cc5deb9fcd41cd1cc1a5082a5fb01e65","observation_id":"690463d6-b488-4dcb-9c89-913e6026e1eb","resolution":{"observed_at":"2026-05-26T11:47:40.380462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unbiased recommender learning from implicit feedback via weakly supervised learning","venue":null,"work_id":"dcdc9e81-2a20-4035-afb2-b13db1e03fe2","year":2025},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:9dd521078d3cb5ef3822397a7fce4bc9d8359f376e0eb43e0cd787b47317a5da","observation_id":"bf09b776-103a-48e0-a424-24f1a5736e8d","resolution":{"observed_at":"2026-05-26T11:47:40.551737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimal transport for time series imputation","venue":null,"work_id":"c7f4dca8-c216-48fa-83ca-dc04372cafc4","year":2025},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:4a40ce7c5e4e3949e78f475e34ee1f76eeac9dea6c6532e2922e63a738e91575","observation_id":"fa9b7335-b909-4624-a50e-1e7858217daf","resolution":{"observed_at":"2026-05-26T11:47:40.547992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"\\ epsilon\\ -softmax: Approximating one-hot vectors for mitigating label noise","venue":null,"work_id":"271173f3-4711-40bb-bfdc-5dd1e614aa00","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:b370583078dbcef3ea80fd87d56e821555297ed49cd6df8ecbd8dd6a3f35200a","observation_id":"1cde68ed-2483-4110-a0c7-045269745308","resolution":{"observed_at":"2026-05-26T11:47:40.427914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"N., Egert, D., Delalleau, O., Scowcroft, J., Kant, N., Swope, A., et al","venue":null,"work_id":"11896582-5fd3-4914-85a2-a0d6f064eb87","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:222d4d34160a5130bc0a034fb2c07ae5b55416840fdc2baceb796e9345aaaa1a","observation_id":"39429f42-4a47-4f38-bcef-e245d0a08f5d","resolution":{"observed_at":"2026-05-26T11:47:40.504367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To smooth or not? when label smoothing meets noisy labels","venue":null,"work_id":"876757c7-97a9-4de1-b871-59b9f383b57d","year":2022},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:ac9c09c3dcf7db69b963b44432a3d6c63e41ab0fcf6aa71f63dc0c9538f6ad2b","observation_id":"a8c1ba81-177c-49cb-bdd6-607068a1a0f9","resolution":{"observed_at":"2026-05-26T11:47:16.835954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisiting consistency regularization for deep partial label learning","venue":null,"work_id":"ccafb06f-dc4b-40c6-873c-a411fab5165f","year":2022},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:8fc2babd524c0bc891a4f4edda995a6214e0c26dbc18f9f608d3cd12445e6d3c","observation_id":"69762179-59c2-44c4-aa1c-274b792453c2","resolution":{"observed_at":"2026-05-26T11:47:16.820569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust early-learning: Hindering the memorization of noisy labels","venue":null,"work_id":"a0a7880e-3991-4d05-b064-94124fe9b703","year":2021},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:e6a9898026ff3f3271d001a307b90b800e98134d5daa02f64cceec088cb8ddac","observation_id":"5cc417ea-5eab-4237-8d06-971eb3b09cbc","resolution":{"observed_at":"2026-05-26T11:47:16.995766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sample selection with uncertainty of losses for learning with noisy labels","venue":null,"work_id":"11642918-273a-4358-9b48-4ed151eaa544","year":2022},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:cfcb36d6c8776e623a9067e12ab421e94cac6d308e5010c3f36b93a64e73aa99","observation_id":"12a8bc5e-ccbc-4779-a551-60bf578c2a5e","resolution":{"observed_at":"2026-05-26T11:47:17.079037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A holistic view of label noise transition matrix in deep learning and beyond","venue":null,"work_id":"a7534cde-46c3-4c4a-97a4-20a8a9c108a2","year":2022},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:3d950b7a3b0f721dd1ab44dfac2f0f6b1f9467b0a593ecdf8d5e587c8cf0d033","observation_id":"c3983a88-8982-4078-8051-652613b7ad61","resolution":{"observed_at":"2026-05-26T11:47:17.037225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Early stopping against label noise without validation data","venue":null,"work_id":"6acbe8e0-0d8f-4aea-a6b9-afc713cc45dc","year":2025},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:1744adbf83dfc9649c08f1e1857ceb60df40256864e3671005d1c46e9356417d","observation_id":"783f012d-6b18-4a92-8536-3b8929c8f932","resolution":{"observed_at":"2026-05-26T11:47:17.044968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Badlabel: A robust perspective on evaluating and enhancing label-noise learning","venue":null,"work_id":"7e881e6b-3415-4531-b963-070121a81e0a","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:c94ea3f3009c967e2bdc378d1f8de206023db499175f485acea57e19f7529c1e","observation_id":"16433f45-961f-42f4-b125-9730340138a5","resolution":{"observed_at":"2026-05-26T11:47:17.032882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clusterability as an alternative to anchor points when learning with noisy labels","venue":null,"work_id":"d7e41cc4-0efd-49c6-933a-f6160e6dc2c1","year":2021},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:8416ff6e921efb376b96460060dda498b343022be78d831068ead6938c16caed","observation_id":"de4d29f7-75a9-468d-a2ab-ff6d8f22b04b","resolution":{"observed_at":"2026-05-26T11:47:17.041392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , volume=","venue":null,"work_id":"5ce33f13-92d0-4250-aeb5-175c399e1a03","year":2025},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:196dfa5ee9c0dfe1eba05f063afc9eb8997dd69a49128d10fceff77bde7b815d","observation_id":"53f47d05-e2f2-4e73-966f-85055a989313","resolution":{"observed_at":"2026-05-26T11:47:17.020582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , volume=","venue":null,"work_id":"3a0a6c90-5f67-4094-8776-eace8d3c630b","year":2025},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:cb491d582e5b592ed0fcd95c10dc93b5723117ce1808e5e137fdedce106c4e70","observation_id":"f28e22e7-ff85-4ad2-a729-de1ef19df9f3","resolution":{"observed_at":"2026-05-26T11:47:16.934697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"78e20d72-fb62-4c07-bcb5-77a82f1076e5","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:3e53b02a99f0427b5da0e34515af2dc63e7d2446ddfb5d9b9b1e9d5a3cfd9cbb","observation_id":"876ad7d0-f689-4f6b-815d-73c5704924b7","resolution":{"observed_at":"2026-05-26T11:47:17.068338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b1ee3ce7-54b8-4139-b0ca-26eb9c3d980f","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:fe7a14e21ed9c3d0795f9cb7fe22170871883c27c6370f91cdd952d5ae168ece","observation_id":"59e0a848-ebff-4328-855d-83f98cbf8f54","resolution":{"observed_at":"2026-05-26T11:47:16.950527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , volume =","venue":null,"work_id":"4a09c82d-c18f-4ac7-a926-b8019e34e76f","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:459b385c1aa12cd47063e284fc4921ecca0cbfbb22d579cbee648cf7b868fd46","observation_id":"79abf030-071d-4de9-978e-8cd025634896","resolution":{"observed_at":"2026-05-26T11:47:16.972309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7870ad9e-5a11-437b-977d-23a65c9e1061","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:27d131b1fb5a1deb661fa1e45310821d323f0e7b543e6d086c8e18db0451cdef","observation_id":"b6c70328-35b6-43a5-aea3-cc3c3e7a4195","resolution":{"observed_at":"2026-05-26T11:47:16.976070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2e9a6033-f894-4ae7-b7e2-ffcc2757fa6f","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:394b233cffe5f38cc4c2ae09990c8c4d88e4160b25e6e9bb015bdc5edbf64283","observation_id":"e46c5483-f351-4285-9392-70fef11326d1","resolution":{"observed_at":"2026-05-26T11:47:17.103969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"703ff4b5-9a31-48d7-b177-fe9a30bdb163","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:163ba85ea8d737344fda23dec654517ca36a6d0db301cc7259186d05a0aa9493","observation_id":"32aedf39-c492-4b91-b197-4587d01e4309","resolution":{"observed_at":"2026-05-26T11:47:16.912462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c6746b2d-8926-4c5e-8e3d-1e41dd7a5460","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:8726e7c25f65a8e09422a738e5c2e2f6acc60e071ae7ce95c4b3ec0b99499c1d","observation_id":"981581d7-5542-4c51-a231-b57e494e19ae","resolution":{"observed_at":"2026-05-26T11:47:16.919744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"60a057d0-b5a4-41a3-b406-2f0714f78845","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:947544111250e4e3c9ea52be79497e1bc22c2a11f38d0c549fd5c7499f45d5f4","observation_id":"c4ff76c9-e5d6-4f05-a3cb-095620561e63","resolution":{"observed_at":"2026-05-26T11:47:16.905874Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"86af3f40-b5df-4dee-87a0-dd7a9ec749ce","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:e93fffbcf207c2cb763d87f3462e83080df67d321b4a08c5dab78210ef7ca283","observation_id":"d103fea3-f0ec-4d0e-8d0f-ba2cce922ea6","resolution":{"observed_at":"2026-05-26T11:47:17.024823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e3697c0a-6fe3-496d-8767-53a65828f42a","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:70c4ee8360be23a803c5fad4e1c6dfef16a31bbe5cce64e18229006721369e81","observation_id":"ec5677df-382f-4025-af09-07db5eb60e86","resolution":{"observed_at":"2026-05-26T11:47:17.075650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , volume=","venue":null,"work_id":"5e30e3da-030b-4a1d-8be0-70c01c0a4911","year":2025},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:b3744ef309d82df96a4287f3f6457c5191188d4c853ac47835c3469c309a616e","observation_id":"de23f289-1db9-4e8f-9d24-cd61459859c0","resolution":{"observed_at":"2026-05-26T11:47:16.846998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8226bfcd-ab58-4047-898b-f069765e0c4e","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:8e06709df27e355f0f24c82089909a488ce3514168661461a4f7648b6c4f1cde","observation_id":"8b480ca6-1e0b-4786-821c-2a73c0d39e50","resolution":{"observed_at":"2026-05-26T11:47:16.999153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a5b66c89-d76c-4c34-bd22-f499f88e72b2","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:fd40dffed7e15098f8a0b132efa7721b84ac947ce8d7e6c1e2afb97dbe0a1dff","observation_id":"21bda3ce-05d4-4c99-bdd8-e161e2010b4e","resolution":{"observed_at":"2026-05-26T11:47:40.402972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"17c266e7-36c4-4622-9ced-2417aa6a6aee","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:e96fa73c86f369e3a342082394be16948f49e00ba51e0bdc26e7a2711de54e69","observation_id":"1ea72eb2-198b-4579-9d35-82d122b9a4e7","resolution":{"observed_at":"2026-05-26T11:47:40.417024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ba3e0f82-e16b-4e66-b8b7-34164ee59deb","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:7aed14c22992de033eab7ff16e91ab4067524f086031782bd75c012334e34fc5","observation_id":"4979835e-57db-4a3a-8ef5-54182139fb42","resolution":{"observed_at":"2026-05-26T11:47:40.337443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , volume =","venue":null,"work_id":"d8564c29-14fc-4b35-931b-aaeabc30b271","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:9330b74ece9174d4aede323b00167e729ab74a93843b66ace174d8b2a035e7e7","observation_id":"1d84dee6-411c-4169-a503-c4bd1d1c856d","resolution":{"observed_at":"2026-05-26T11:47:40.253024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , volume =","venue":null,"work_id":"5c7c6390-b753-4668-9709-0501e354bab2","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:5e19a133ff58603187a6240bd5d6f866b959a7817c8786f2bc49a5393a9d900c","observation_id":"a984db0a-ca60-4e7b-83f7-c55e87ffe28d","resolution":{"observed_at":"2026-05-26T11:47:17.028450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c35b078f-756a-4fc1-ba32-00a95f606d1b","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:9280e8a1e404317c7e4942db7f8489ac2ff19fd7ac61bf8ccacd12a97e8c3138","observation_id":"c7c2f511-4439-475d-b261-a51e536cf7a7","resolution":{"observed_at":"2026-05-26T11:47:17.002258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2de47584-93bd-486d-a2db-a490bdfdad6c","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:8a25a9dbec19ee70b34b34495482a30d0f331086419019073a667a26f70e16d5","observation_id":"de5cd398-977a-4010-a6ee-137bb4bb6002","resolution":{"observed_at":"2026-05-26T11:47:16.916183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"366af20c-8d8f-4fca-bc03-d794e74ac35c","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:6468c5da2891c810c15b11237c6cd99dd5a95aafd7e73b04a9309be1ba147ea3","observation_id":"df470820-0467-42c0-97d2-d6763ce943e3","resolution":{"observed_at":"2026-05-26T11:47:16.843374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"10d6d16a-cc47-44cb-8889-f09477b6a5ad","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:6d19ccba43dbc3f7c8895edf3ae7d10da0a017b3fd5aacee2caa2c29233577d3","observation_id":"ced60ec1-238b-4339-adfa-26a29ed93847","resolution":{"observed_at":"2026-05-26T11:47:16.789951Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , volume =","venue":null,"work_id":"050cfafb-e50a-43ef-a5c3-454bd542f6e1","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:f7169a877ab654d3be27b75efdc3afd95c86ad5c304a41097458b8cab844549c","observation_id":"885f2bf2-4fa3-4c96-a345-b5c29f4e65d8","resolution":{"observed_at":"2026-05-26T11:47:16.793362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bc17215e-a80a-4687-8939-5b6b5ca5e8d8","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:836777ea1859c1e052bb97fed7fc43e65b1513393757eecc14120398b3004cec","observation_id":"ca53b5cf-d86f-4616-af00-01da32764afc","resolution":{"observed_at":"2026-05-26T11:47:16.801333Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , pages =","venue":null,"work_id":"4aa3239e-f153-48c2-8177-4b4d4027ac0f","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:373239bc9213d97e1a736e42f903419ca7f693642e66e3a3b77f6fe5e01ad16d","observation_id":"d5c42960-7e74-441d-9c8b-be4bb808475b","resolution":{"observed_at":"2026-05-26T11:47:17.284773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kingma and Jimmy Ba , title =","venue":null,"work_id":"db8f9fb3-ac8b-428f-83fa-b794997c2208","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:638250c98127cb3e27b4d476592091f93f4076ed40d8503b535c9603b7e43a05","observation_id":"c41fb3ac-6c2a-4a85-bf64-4592d62dccbb","resolution":{"observed_at":"2026-05-26T11:47:16.778525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"909ee6c0-5e2f-47a8-9fee-bc9ecd994ede","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:aa64ec40e5c2c52c8f85f26905e859574d1ba43c3d64c60fd38b814a5a4866c9","observation_id":"530ee2fa-0f4a-49a9-b39b-870cde83f9be","resolution":{"observed_at":"2026-05-26T11:47:16.782508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"570714a0-7868-4ed1-b693-c7bc39f44783","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:aa9eaa3b413d8f44e1dc1965cf8f790118b91e9287e1911e866a98c5fad6bd8e","observation_id":"5d80be32-47ee-40ed-bae9-2b705de689ed","resolution":{"observed_at":"2026-05-26T11:47:16.773768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nature , volume=","venue":null,"work_id":"33b98a5e-042b-4b8c-81f8-8eadc01f73c3","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:1563857e20385e1452cb1a250ad2e859340e3839118fc41d8dfd0b4d0dc13619","observation_id":"997b70e7-9f1c-4fdb-b3d5-23cd2570227c","resolution":{"observed_at":"2026-05-26T11:47:16.786286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:58c781be4271cfeb1cebcf754a2cc5c1dfc3f5599a0388177b3be97fa6dbe70f","observation_id":"93fcd148-4025-4e2a-83b1-17e84581e232","resolution":{"observed_at":"2026-05-11T18:46:07.329885Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:92675429ace426564e2556746cb1ad7643ff6dae9f2a63fe4ce889eac844f657","observation_id":"10086121-81b0-47ef-8ffa-25a83d342615","resolution":{"observed_at":"2026-05-11T18:46:07.424698Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:56:26.096579Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"c25e8154-fab2-455c-8a26-56e40aed5d2b","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:33689a00fb15c0fa32132d3bd456ca0ea11f2f3fef6f05a3f5d8b985e117791f","observation_id":"265ee2aa-1c2e-42f2-9cf6-894082911c35","resolution":{"observed_at":"2026-05-26T11:47:16.797496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2024 , pages=","venue":null,"work_id":"4bde67ef-b58e-4ca3-91de-5c189d6d465c","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:fd07d05b98921dd0eb533ac54e960fb7b7232bbde1cd21fcd8659aa1692eba24","observation_id":"58f48342-85da-445e-b09a-cfcf4d9189fc","resolution":{"observed_at":"2026-05-26T11:47:17.245235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T02:41:49.959691Z","title":"the method of paired comparisons , author=","venue":null,"work_id":"3f0bd3dc-4705-465d-9a05-c65ef60b0f76","year":1952},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:4d852afb8fb3067ae768909d28634be318d4887209eeec45a52a01dc1fe0d017","observation_id":"cf5240ce-a3fa-4e6d-a578-5f239f4acd22","resolution":{"observed_at":"2026-05-26T11:47:16.770042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Findings of the Association for Computational Linguistics: NAACL 2025 , pages=","venue":null,"work_id":"075f0c74-42a4-41b9-9ec4-44f0c8238352","year":2025},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:576e717d34154cbcc9a9221ff3d5302879235c2603563df351d5d32fbfb1272a","observation_id":"b236a05c-aaf0-44c6-a886-9d3f4a75ab98","resolution":{"observed_at":"2026-05-26T11:47:17.241753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:46:40.613945Z","title":"Computational Linguistics , volume=","venue":null,"work_id":"86a252c7-14e3-42b9-8021-ba7fcc65fcd1","year":2024},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:d8d96419d3ab069a8e2ece41d3df26f5d1e17c84e3d04a13046425769db20ab1","observation_id":"b8e3034a-293c-491e-9efc-181407af9ed7","resolution":{"observed_at":"2026-05-26T11:47:17.115256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"95b1f2be-0cc6-480d-ac0b-f52ac9a19092","year":2025},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:94540c9519be4590a4d9a5bb01ce6ce021e07872b727b4106a62a6101142f0b2","observation_id":"875546cd-120b-48d0-aa20-7094924affae","resolution":{"observed_at":"2026-05-26T11:47:17.009004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24709","last_updated":"2025-05-30T15:30:43Z","snapshot_observed_at":"2026-08-07T12:12:53.183544Z","submitted_at":"2025-05-30T15:30:43Z","title":"On Symmetric Losses for Robust Policy Optimization with Noisy Preferences","version":1},"cited_work":{"arxiv_id":"2505.24709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24709","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.24709 , year=","venue":null,"work_id":"2b0e87ba-8ca4-4f87-911b-bff05cfb72a3","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"cited_paper":"/paper/2505.24709","citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:cfa2d9c52633d12e60de3ca7655e964a24839cd60c22b884cee3df486f8b4980","observation_id":"01e7331f-40a8-43a3-a27d-8fcf94a6b084","resolution":{"observed_at":"2026-05-11T18:46:07.420959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:e7c02d688576f63d04a950f512383844cc1c27ce811b9083237b4656427a8913","observation_id":"b33c64fe-ac10-45f0-abb1-ea8d20dfa0e4","resolution":{"observed_at":"2026-05-11T18:46:07.360705Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:c1de72696a57735f3b01f4e8f736652493c6f173a59555a854009b0c0bc27fe3","observation_id":"850af893-dc20-46c2-bfee-0c26745db923","resolution":{"observed_at":"2026-05-11T18:46:07.445597Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , booktitle = P_SIGKDD, pages =","venue":null,"work_id":"f0e39b98-6880-4cca-9dc9-4aaa7d527ad0","year":2022},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:1c52314223d27cb486979da160608cbac37616b0d53a0ea5ddf1cd5948fc2472","observation_id":"b4b307cf-904f-412e-a100-7bf343200fc5","resolution":{"observed_at":"2026-05-26T11:47:40.492434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9304e75e-4ac0-43ad-89c9-8ad4aec26048","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:16b2021f9e51f4aa1aad21e67b1628fed7aee6961ae3b64b710abf827d143a30","observation_id":"c682db53-2fb0-4aa5-bf5c-067eaef1a12d","resolution":{"observed_at":"2026-05-26T11:47:40.436242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dual Unbiased Recommender Learning for Implicit Feedback , booktitle = P_SIGIR, pages =","venue":null,"work_id":"762bc122-bb22-4649-9d90-e680dd207dc3","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:4caa9515fc486bf7b7bea2d0e2030906ff52822a8e33a3bd5186c168db4d09d7","observation_id":"1593ee18-bf81-477e-ba92-8118dffdd86e","resolution":{"observed_at":"2026-05-26T11:47:40.587194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Biometrics , volume=","venue":null,"work_id":"f37bdc4e-3ac0-40c4-9b79-1e9dacf4e1b3","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:5a4b717bf048dcbe891a2969744015a04ee83aa6bb9b9117d55499d00b1a4f4a","observation_id":"68a97bcd-0bea-4214-aaa0-64865a7bf2ff","resolution":{"observed_at":"2026-05-26T11:47:40.376395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1ebc09bf-1398-4d98-be78-49477d42c3f4","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:3df5fddc3d385f162bcec01019c3ea5c771c63c1e12737a1f77bf5cb25d8a5cd","observation_id":"4afdef64-8907-4922-8dc8-15781f082b87","resolution":{"observed_at":"2026-05-26T11:47:40.282754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"36fb3914-b407-4707-907b-9613ddb24bea","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:cf892c1dad8cdb1c8378e2ba67d323620e8d6eea4bb14c19aac046bc4f6a491b","observation_id":"14c56590-710b-4ad2-ae6a-2b01cd5b2673","resolution":{"observed_at":"2026-05-26T11:47:17.082483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale Causal Approaches to Debiasing Post-click Conversion Rate Estimation with Multi-task Learning , booktitle = P_WWW, pages =","venue":null,"work_id":"f3191830-e77e-4e4e-b72c-44751f5a321e","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:d6e755455aa3c1333986ad9aee04bd0d145c561cbcac458c63841fb360a0a4e6","observation_id":"2cbfb064-bedc-46c7-a750-c93b800b8d6f","resolution":{"observed_at":"2026-05-26T11:47:16.968950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RecSys , pages=","venue":null,"work_id":"d72a5270-3216-4934-9ec1-ccd296139f47","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:e910288edfa2f501d7ff9264353daf72835d3515d6bbbb964041b295573c9fb3","observation_id":"22cfa253-3592-42dc-ae5a-140b58eeb0b0","resolution":{"observed_at":"2026-05-26T11:47:40.431850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8fe8d658-3379-4304-bb67-cf8563c184b6","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:6b80dbe64487e3e19df14a57bac59f91165f1743114355ed743b4e6692675c75","observation_id":"d495223b-6a5d-4fbf-b844-86cc87ce830a","resolution":{"observed_at":"2026-05-26T11:47:40.367637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"55514a67-7d72-49f5-b49f-bb716c65d342","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:4530601b0db9d4f6941865cfc840a7b660ef7f952681f4b38e0c33bc38bdb647","observation_id":"4c92cdf5-f1d8-4bfd-a115-4c749e7b8d18","resolution":{"observed_at":"2026-05-26T11:47:40.248102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c2f419bc-4070-4ee0-a1f1-e7899ba06ca6","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:c50d8a7bb9a52d8c01491a188246bf1e8f969358163b286b7982fa6cde9ec3b2","observation_id":"6b602341-38e8-4cbd-a027-c2cabad07e39","resolution":{"observed_at":"2026-05-26T11:47:40.277712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , publisher=","venue":null,"work_id":"754f7480-8d35-454a-b1a3-90afe25ccc41","year":2023},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:42f34abe9b6cbd2a164c1c671cc9367508b51e03c7c0af5b6d0f05c324c72bcd","observation_id":"ab3d96d1-338a-4c7b-aa64-8047afd8ba4e","resolution":{"observed_at":"2026-05-26T11:47:40.296616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3289c4cc-b4c3-4937-90d5-9eb9abc41d4d","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:01768d7aeffd1b0337766d5f4d15b2382f2576438e22fb37858ee829a0e7fca6","observation_id":"e820ee61-d843-4990-bc28-6cd3a957430f","resolution":{"observed_at":"2026-05-26T11:47:16.938622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c81bf6db-7e0a-4a17-946e-bb8ae9976d73","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:9d393b7230ccb331bf5f1a4999056edc75f970cc6d674498909c69b627fb09bd","observation_id":"1f6ad4a0-e004-4427-9019-92461382c008","resolution":{"observed_at":"2026-05-26T11:47:17.061445Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"105affaf-cfd1-411c-8893-89d1bc1aff02","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:58a03488aaba959a33d6037cbd4870922d80de55f90ab0c45a69c30c7f37de60","observation_id":"bf91c744-9ee1-4645-9f1b-f7eebb817706","resolution":{"observed_at":"2026-05-26T11:47:17.048166Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Concentration of Fractional Distances , journal = IEEE_J_KDE, volume =","venue":null,"work_id":"d5bbd1a7-d777-4b51-8219-6aa8dc32cffe","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:c6cb3159ef03e677ad8d90860b37114773b39ada385bc70b087eb29b6248dc12","observation_id":"f31651d2-8230-4b9a-8c8b-11df6a179d4a","resolution":{"observed_at":"2026-05-26T11:47:17.064922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2b746c75-04e7-45a3-a102-f23009d7918c","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:51d2921ea7bbcfb6135cd72b3feda4a427deda422d237d5bcbe2fbcf1ae91a10","observation_id":"0cd2fef9-8e84-44bd-a839-7e0515aa5d42","resolution":{"observed_at":"2026-05-26T11:47:17.016520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a5051fbd-9e31-4769-8e9b-306751ff7ddc","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:a634e107f5b64dc32fea9c7e11a2badc4b257c79b0f498b2baae525df04363ee","observation_id":"bdc6b8ff-f544-4ea5-b92a-a4b44641636c","resolution":{"observed_at":"2026-05-26T11:47:17.058187Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6b4ce115-ea32-4c42-8d0e-a2dd6fca5503","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:1fdb0525a094a04ed6ea04e55b1748e6f2d126899f53f2fb4a96e471704fe785","observation_id":"fe671794-9456-4e09-91ab-c41efaa69850","resolution":{"observed_at":"2026-05-26T11:47:16.809079Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5e415f1b-f753-432f-8f98-67d6dc321fcc","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:0e36bf939a529bea52749d4d0795dc44564efe05b24bc061a5fc5728680ca032","observation_id":"b671b698-dfd6-4bf0-bfeb-3b0a2b687e9e","resolution":{"observed_at":"2026-05-26T11:47:17.051561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a4fc43cb-2004-4ace-b8d3-9d27c4f6db27","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:24a1e6acd14f47bf708328776d26481ad31bbf730f873eeb44f424337dc2ae6d","observation_id":"72d1cd9c-e24f-43dc-882a-31827d55030c","resolution":{"observed_at":"2026-05-26T11:47:16.805567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d29ebc3b-7849-48ed-b98e-908be692aeb9","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:30fd80028de6118c0f4c38f7cfc0d37b55ee8ff432efbda01c776a6a205049ed","observation_id":"c2e12d26-f13d-455b-96b9-b49484f24b87","resolution":{"observed_at":"2026-05-26T11:47:16.812489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"597f789e-95bc-4815-8219-ab076f75ea4c","year":null},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:a994c573caf0b6e38593f3e0010249888e32e3023c0b188ac8d00e3da6aa861b","observation_id":"3cc521be-a8ee-49d3-8ccf-8c301ea96dd8","resolution":{"observed_at":"2026-05-26T11:47:17.217756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":38,"verified_exact":2,"verified_fuzzy":56},"total_outbound_references":249},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 249 outbound references and 0 inbound Pith citation observations for arXiv:2605.06036."}