{"as_of":"2026-08-10T14:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d92683506fb0dad2df6404c649159d27b1b93c33612fdcd887addfd3ff70cc9b","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:00:54.425668Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09796/citation-record","integrity":"/paper/2607.09796/integrity","json":"/paper/2607.09796/citation-record.json","paper":"/paper/2607.09796"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-02T08:00:52.929767Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:52.929767Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:d998c8d06009c936eaf5cabd298a3bd0b7098f261f7beaf604aa1967c93a235f","observation_id":"7aca230d-8b15-4f5a-8928-d91711e92c18","resolution":{"observed_at":"2026-08-02T08:00:52.929767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T08:00:53.098419Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:53.098419Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:ff927c93e8c7f5e88ec08430a1b91988b4a95e6dfab947948f9a5db50d1ea9d2","observation_id":"1a0931fc-8648-49c2-bad9-328f5bbd7111","resolution":{"observed_at":"2026-08-02T08:00:53.098419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:53.238696Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:53.238696Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:0095e14994b13b9b80ca63942689b1ad242506ec56caf51edd27b0fdf8aeee8b","observation_id":"d6a7a2cb-4043-4ed9-aa98-12b48798f493","resolution":{"observed_at":"2026-08-02T08:00:53.238696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:53.346910Z","title":"A survey of reinforcement learning from human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:53.346910Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:d17f7fb459682fff855f7f754ccf1715fbe91fd2727fda4276b70306044f8602","observation_id":"5e268142-58db-4f38-89e9-6a650eb1b834","resolution":{"observed_at":"2026-08-02T08:00:53.346910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04964","last_updated":"2023-07-18T08:44:47Z","snapshot_observed_at":"2026-08-07T18:08:01.409989Z","submitted_at":"2023-07-11T01:55:24Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04964","snapshot_observed_at":"2026-08-02T08:00:53.466595Z","title":"Secrets of rlhf in large language models part i: Ppo,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:53.466595Z"},"links":{"cited_paper":"/paper/2307.04964","citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:d1bd637493e0b0bf70eb9b75fb3c1588e03b522fa9535335791075184c56d95b","observation_id":"6feb314c-d597-4fd9-8763-ced9bfa9ad1f","resolution":{"observed_at":"2026-08-02T08:00:53.466595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:53.611286Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:53.611286Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:8d2d7de7f37565d7cc7a1b78e4970c0dac7ad2d5b7726207d1f1f5bd53837883","observation_id":"64701f37-1a06-4123-a031-7220fee115eb","resolution":{"observed_at":"2026-08-02T08:00:53.611286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09824","last_updated":"2024-04-15T14:21:53Z","snapshot_observed_at":"2026-08-10T03:27:00.084983Z","submitted_at":"2024-04-15T14:21:53Z","title":"Impact of Preference Noise on the Alignment Performance of Generative Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09824","snapshot_observed_at":"2026-08-02T08:00:53.707181Z","title":"Impact of preference noise on the alignment performance of generative language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:53.707181Z"},"links":{"cited_paper":"/paper/2404.09824","citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:1f571a9fe72f8dd8d0444766d5bf2626d9035a5f473f5e7320d84d51c572e3a4","observation_id":"1c693273-2509-4423-9d5e-862d0b850da2","resolution":{"observed_at":"2026-08-02T08:00:53.707181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-08-09T19:07:54.536460Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-02T08:00:53.827430Z","title":"Secrets of rlhf in large language models part ii: Reward modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:53.827430Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:62a7da074fa50d78a295f8dacee72b187a3f4435633244087b4b2342de4e22cf","observation_id":"e433b4e7-168e-4078-ad68-e57a0bc95423","resolution":{"observed_at":"2026-08-02T08:00:53.827430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00409","last_updated":"2024-04-12T01:09:37Z","snapshot_observed_at":"2026-08-10T03:27:36.910323Z","submitted_at":"2024-03-01T09:55:18Z","title":"Provably Robust DPO: Aligning Language Models with Noisy Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00409","snapshot_observed_at":"2026-08-02T08:00:53.937134Z","title":"Provably robust dpo: Aligning language models with noisy feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:53.937134Z"},"links":{"cited_paper":"/paper/2403.00409","citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:d16fd50a99bf098542bc29508ff6d40d5f84056caf24ba5aa25b1739ffa98d74","observation_id":"1b17ee32-4086-4ec1-9545-b8151cf549fd","resolution":{"observed_at":"2026-08-02T08:00:53.937134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.064001Z","title":"Towards robust alignment of language models: Distributionally robustifying direct preference optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.064001Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:f38b5e188fc6f39e2c114580bc8dc2f2357f4bb1e5ab98db3f7488151f91ef0a","observation_id":"4e99f1f6-b98c-4fe3-8fe9-a275580ba303","resolution":{"observed_at":"2026-08-02T08:00:54.064001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.204718Z","title":"Robust reinforcement learning from corrupted human feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.204718Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:656a5058bbc1900bb62505de71576f29821b8302c04879a2ec11e14a7a0459ea","observation_id":"9bfffeca-879a-4ce5-987d-5e401230e430","resolution":{"observed_at":"2026-08-02T08:00:54.204718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.319006Z","title":"A note on dpo with noisy preferences & relationship to ipo,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.319006Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:7ad3c5ef7614ac270b3bafac74921b1d951c3168fadc8371aba91cfbf1b02497","observation_id":"24330402-b1e9-4ada-af0b-05a23c50799b","resolution":{"observed_at":"2026-08-02T08:00:54.319006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04102","last_updated":"2024-05-28T17:11:53Z","snapshot_observed_at":"2026-07-06T17:56:06.438303Z","submitted_at":"2024-04-05T13:58:51Z","title":"ROPO: Robust Preference Optimization for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04102","snapshot_observed_at":"2026-08-02T08:00:54.368024Z","title":"ROPO: Robust preference optimization for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.368024Z"},"links":{"cited_paper":"/paper/2404.04102","citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:9d4f87875c59eb9a84b05130eda44815ee50dcc6a6f8884519ca4c967e192475","observation_id":"9a574ca6-d7a3-4e5f-bc54-0d9dc4331c41","resolution":{"observed_at":"2026-08-02T08:00:54.368024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.371530Z","title":"Perplexity-aware correction for robust alignment with noisy preferences,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.371530Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:d8ce02f21717dd02107a73b6ddaf61cdbedce76253c395e8e57dbd18f0d507fb","observation_id":"2a84b421-1a3c-47c9-9f76-6ddf37922a2d","resolution":{"observed_at":"2026-08-02T08:00:54.371530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.374380Z","title":"Aligner, diagnose thyself: A meta-learning paradigm for fusing intrinsic feedback in preference alignment,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.374380Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:60c257bb99c518bc268d557d7b91b81677b7d2b6d228a6deaa773901f04f2b21","observation_id":"6131fc92-033a-4ffc-af97-82464ebfa606","resolution":{"observed_at":"2026-08-02T08:00:54.374380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.377966Z","title":"Learning temporally-aware sample weights for preference optimization,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.377966Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:f029b01f004dd087613bdb179b895ea81956cbb3290decd46a4d57beaa34854c","observation_id":"12468e06-1ead-4f76-834d-9dbfcbc601d5","resolution":{"observed_at":"2026-08-02T08:00:54.377966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.380640Z","title":"Meta-weight-net: Learning an explicit mapping for sample weighting,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.380640Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:cb1c641a51a219b4bf163fa8e5391f8ea2bcf66d97f66c9f2b44664f724d6576","observation_id":"867bda2a-2d7a-4956-84b6-2d520fd69edc","resolution":{"observed_at":"2026-08-02T08:00:54.380640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.383153Z","title":"Cmw-net: Learning a class-aware sample weighting mapping for robust deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.383153Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:d1d796bc6ad4b8f83abcfffa77df2f4591f79db30f972826db459ac51e6501f5","observation_id":"09f56aa2-2e47-4c81-9486-cef2e2406fc9","resolution":{"observed_at":"2026-08-02T08:00:54.383153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.386256Z","title":"Dac-mr: Data augmentation consistency based meta-regularization for meta-learning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.386256Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:7b25ef84ade3fde0b90196d9ffa968f18712f93d7198409c6b6381bc2f3bb2ab","observation_id":"944ba94d-a6d1-4127-a2d7-d5b1b51d9308","resolution":{"observed_at":"2026-08-02T08:00:54.386256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.389235Z","title":"Bilevel programming for hyperparameter optimization and meta-learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.389235Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:9af93aed09b736826f162c46b57834ecba9269fd2a97481342c8e7ded1645ab6","observation_id":"e54f54bc-abb5-49f7-9340-d067e27b5c9a","resolution":{"observed_at":"2026-08-02T08:00:54.389235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.393237Z","title":"Meta-learning in neural networks: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.393237Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:1fb5534dc2f490cd02a39585100b7a9fecff870c8989cc4bba1f0f16d93170f1","observation_id":"6829e37a-d62d-4338-9069-924b7e20d4f8","resolution":{"observed_at":"2026-08-02T08:00:54.393237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.396304Z","title":"Improving neural machine translation models with monolingual data,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.396304Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:879a7cf23dc096bb05a215a25e89ec8fa3d2cc37e8180806ea1ea115353a9c70","observation_id":"93461d67-6541-4611-8948-589b1419b7fa","resolution":{"observed_at":"2026-08-02T08:00:54.396304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.398908Z","title":"Understanding back-translation at scale,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.398908Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:daf36648bc0f50b8454158cc2821a33163cfd943aaba63d454d24785c60d1606","observation_id":"b77ca1b1-9b02-4675-9cb2-8ecdb49a7f81","resolution":{"observed_at":"2026-08-02T08:00:54.398908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.401991Z","title":"Unsupervised data augmentation for consistency training,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.401991Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:d6e952493bce92f17081c66d5f20c788590ef1427a42c90b9834e2fcb69571f8","observation_id":"d9ef1c31-0341-4615-84b2-eb930e444f25","resolution":{"observed_at":"2026-08-02T08:00:54.401991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.404468Z","title":"Rank analysis of incomplete block designs: I. the method of paired comparisons,","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.404468Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:6dd60e54a4ab97ecb23b09239db87b31d891bc0f73c1130ae99564e2aefdf2ce","observation_id":"b9922247-f610-4e3c-9b37-bdaa976a14ee","resolution":{"observed_at":"2026-08-02T08:00:54.404468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.407720Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.407720Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:d6b57db490849a79354ffaf6a40524892d8be080e62ecdc9195148e708bb7b88","observation_id":"c6c7c75a-964f-4be3-98db-7ccacb9aa456","resolution":{"observed_at":"2026-08-02T08:00:54.407720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.410589Z","title":"Tl; dr: Mining reddit to learn automatic summarization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.410589Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:db1049a9e7cbcb90e1650d98d1126fc7af351c7fd5f4697b909723865dac2334","observation_id":"69eaef8e-5ec0-4b85-b9dd-0535ea09c5e3","resolution":{"observed_at":"2026-08-02T08:00:54.410589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-02T08:00:54.413435Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.413435Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:502ff1c80be40fb31e19313950782bf231c084eebbf1dd9d67dbfec04be8c16a","observation_id":"28c48aa1-3b33-49a3-93a6-c07352f24529","resolution":{"observed_at":"2026-08-02T08:00:54.413435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.416890Z","title":"Learning to summarize with human feedback,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.416890Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:d3616770135046e81cd24f80beba7992ea68e79448bea083807dd7e8d49f94bf","observation_id":"b20846d6-bb5a-4e7f-8202-ecf8b0d0850a","resolution":{"observed_at":"2026-08-02T08:00:54.416890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-02T08:00:54.419591Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.419591Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:1f5d41b46f3eeb5e0b17c5df73bc727136bb71a87a0b0e5343773be4b42b8fca","observation_id":"d7307662-d974-4d78-bb32-98f06ff4217d","resolution":{"observed_at":"2026-08-02T08:00:54.419591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.422687Z","title":"A general theoretical paradigm to understand learning from human preferences,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.422687Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:be78a996743431e4a1764239ecd152e2e41676eea842ed83ff295eb5ffef96f0","observation_id":"690b7681-8411-4997-85af-d1a2fd2b624a","resolution":{"observed_at":"2026-08-02T08:00:54.422687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:00:54.425668Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:54.425668Z"},"links":{"citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:7d792f9c89288a0394f9562bedc7e23585dbf6e6681810cf664d61ef05a8164c","observation_id":"e02291f2-64ac-44a1-af3f-272077dedac7","resolution":{"observed_at":"2026-08-02T08:00:54.425668Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T19:08:22.057789Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2607.09796."}