Pith. sign in

Paper Citation Record · LEDGER

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels

As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2607.09796.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.09796 v2

Coverage vector

measured 32 of 32 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-02T08:00:54.425668Z

measured 32 of 32 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

32 of 32 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved31
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7aca230d-8b15-4f5a-8928-d91711e92c18 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:52.929767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:52.929767Z digest=sha256:d998c8d06009c936eaf5cabd298a3bd0b7098f261f7beaf604aa1967c93a235f

Observation 1a0931fc-8648-49c2-bad9-328f5bbd7111 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Gemini: A Family of Highly Capable Multimodal Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:53.098419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:53.098419Z digest=sha256:ff927c93e8c7f5e88ec08430a1b91988b4a95e6dfab947948f9a5db50d1ea9d2

Observation d6a7a2cb-4043-4ed9-aa98-12b48798f493 · outbound

This paper cites Training language models to follow instructions with human feedback,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Training language models to follow instructions with human feedback,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:53.238696Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:53.238696Z digest=sha256:0095e14994b13b9b80ca63942689b1ad242506ec56caf51edd27b0fdf8aeee8b

Observation 5e268142-58db-4f38-89e9-6a650eb1b834 · outbound

This paper cites A survey of reinforcement learning from human feedback,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels A survey of reinforcement learning from human feedback,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:53.346910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:53.346910Z digest=sha256:d17f7fb459682fff855f7f754ccf1715fbe91fd2727fda4276b70306044f8602

Observation 6feb314c-d597-4fd9-8763-ced9bfa9ad1f · outbound

This paper cites Secrets of RLHF in Large Language Models Part I: PPO.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Secrets of RLHF in Large Language Models Part I: PPO

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:53.466595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:53.466595Z digest=sha256:d1bd637493e0b0bf70eb9b75fb3c1588e03b522fa9535335791075184c56d95b

Observation 64701f37-1a06-4123-a031-7220fee115eb · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Direct preference optimization: Your language model is secretly a reward model,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:53.611286Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:53.611286Z digest=sha256:8d2d7de7f37565d7cc7a1b78e4970c0dac7ad2d5b7726207d1f1f5bd53837883

Observation 1c693273-2509-4423-9d5e-862d0b850da2 · outbound

This paper cites Impact of Preference Noise on the Alignment Performance of Generative Language Models.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Impact of Preference Noise on the Alignment Performance of Generative Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:53.707181Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:53.707181Z digest=sha256:1f571a9fe72f8dd8d0444766d5bf2626d9035a5f473f5e7320d84d51c572e3a4

Observation e433b4e7-168e-4078-ad68-e57a0bc95423 · outbound

This paper cites Secrets of RLHF in Large Language Models Part II: Reward Modeling.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Secrets of RLHF in Large Language Models Part II: Reward Modeling

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:53.827430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:53.827430Z digest=sha256:62a7da074fa50d78a295f8dacee72b187a3f4435633244087b4b2342de4e22cf

Observation 1b17ee32-4086-4ec1-9545-b8151cf549fd · outbound

This paper cites Provably Robust DPO: Aligning Language Models with Noisy Feedback.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Provably Robust DPO: Aligning Language Models with Noisy Feedback

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:53.937134Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:53.937134Z digest=sha256:d16fd50a99bf098542bc29508ff6d40d5f84056caf24ba5aa25b1739ffa98d74

Observation 4e99f1f6-b98c-4fe3-8fe9-a275580ba303 · outbound

This paper cites Towards robust alignment of language models: Distributionally robustifying direct preference optimization,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Towards robust alignment of language models: Distributionally robustifying direct preference optimization,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.064001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.064001Z digest=sha256:f38b5e188fc6f39e2c114580bc8dc2f2357f4bb1e5ab98db3f7488151f91ef0a

Observation 9bfffeca-879a-4ce5-987d-5e401230e430 · outbound

This paper cites Robust reinforcement learning from corrupted human feedback,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Robust reinforcement learning from corrupted human feedback,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.204718Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.204718Z digest=sha256:656a5058bbc1900bb62505de71576f29821b8302c04879a2ec11e14a7a0459ea

Observation 24330402-b1e9-4ada-af0b-05a23c50799b · outbound

This paper cites A note on dpo with noisy preferences & relationship to ipo,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels A note on dpo with noisy preferences & relationship to ipo,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.319006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.319006Z digest=sha256:7ad3c5ef7614ac270b3bafac74921b1d951c3168fadc8371aba91cfbf1b02497

Observation 9a574ca6-d7a3-4e5f-bc54-0d9dc4331c41 · outbound

This paper cites ROPO: Robust Preference Optimization for Large Language Models.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels ROPO: Robust Preference Optimization for Large Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.368024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.368024Z digest=sha256:9d4f87875c59eb9a84b05130eda44815ee50dcc6a6f8884519ca4c967e192475

Observation 2a84b421-1a3c-47c9-9f76-6ddf37922a2d · outbound

This paper cites Perplexity-aware correction for robust alignment with noisy preferences,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Perplexity-aware correction for robust alignment with noisy preferences,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.371530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.371530Z digest=sha256:d8ce02f21717dd02107a73b6ddaf61cdbedce76253c395e8e57dbd18f0d507fb

Observation 6131fc92-033a-4ffc-af97-82464ebfa606 · outbound

This paper cites Aligner, diagnose thyself: A meta-learning paradigm for fusing intrinsic feedback in preference alignment,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Aligner, diagnose thyself: A meta-learning paradigm for fusing intrinsic feedback in preference alignment,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.374380Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.374380Z digest=sha256:60c257bb99c518bc268d557d7b91b81677b7d2b6d228a6deaa773901f04f2b21

Observation 12468e06-1ead-4f76-834d-9dbfcbc601d5 · outbound

This paper cites Learning temporally-aware sample weights for preference optimization,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Learning temporally-aware sample weights for preference optimization,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.377966Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.377966Z digest=sha256:f029b01f004dd087613bdb179b895ea81956cbb3290decd46a4d57beaa34854c

Observation 867bda2a-2d7a-4956-84b6-2d520fd69edc · outbound

This paper cites Meta-weight-net: Learning an explicit mapping for sample weighting,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Meta-weight-net: Learning an explicit mapping for sample weighting,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.380640Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.380640Z digest=sha256:cb1c641a51a219b4bf163fa8e5391f8ea2bcf66d97f66c9f2b44664f724d6576

Observation 09f56aa2-2e47-4c81-9486-cef2e2406fc9 · outbound

This paper cites Cmw-net: Learning a class-aware sample weighting mapping for robust deep learning,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Cmw-net: Learning a class-aware sample weighting mapping for robust deep learning,

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.383153Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.383153Z digest=sha256:d1d796bc6ad4b8f83abcfffa77df2f4591f79db30f972826db459ac51e6501f5

Observation 944ba94d-a6d1-4127-a2d7-d5b1b51d9308 · outbound

This paper cites Dac-mr: Data augmentation consistency based meta-regularization for meta-learning,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Dac-mr: Data augmentation consistency based meta-regularization for meta-learning,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.386256Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.386256Z digest=sha256:7b25ef84ade3fde0b90196d9ffa968f18712f93d7198409c6b6381bc2f3bb2ab

Observation e54f54bc-abb5-49f7-9340-d067e27b5c9a · outbound

This paper cites Bilevel programming for hyperparameter optimization and meta-learning,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Bilevel programming for hyperparameter optimization and meta-learning,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.389235Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.389235Z digest=sha256:9af93aed09b736826f162c46b57834ecba9269fd2a97481342c8e7ded1645ab6

Observation 6829e37a-d62d-4338-9069-924b7e20d4f8 · outbound

This paper cites Meta-learning in neural networks: A survey,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Meta-learning in neural networks: A survey,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.393237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.393237Z digest=sha256:1fb5534dc2f490cd02a39585100b7a9fecff870c8989cc4bba1f0f16d93170f1

Observation 93461d67-6541-4611-8948-589b1419b7fa · outbound

This paper cites Improving neural machine translation models with monolingual data,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Improving neural machine translation models with monolingual data,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.396304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.396304Z digest=sha256:879a7cf23dc096bb05a215a25e89ec8fa3d2cc37e8180806ea1ea115353a9c70

Observation b77ca1b1-9b02-4675-9cb2-8ecdb49a7f81 · outbound

This paper cites Understanding back-translation at scale,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Understanding back-translation at scale,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.398908Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.398908Z digest=sha256:daf36648bc0f50b8454158cc2821a33163cfd943aaba63d454d24785c60d1606

Observation d9ef1c31-0341-4615-84b2-eb930e444f25 · outbound

This paper cites Unsupervised data augmentation for consistency training,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Unsupervised data augmentation for consistency training,

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.401991Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.401991Z digest=sha256:d6e952493bce92f17081c66d5f20c788590ef1427a42c90b9834e2fcb69571f8

Observation b9922247-f610-4e3c-9b37-bdaa976a14ee · outbound

This paper cites Rank analysis of incomplete block designs: I. the method of paired comparisons,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Rank analysis of incomplete block designs: I. the method of paired comparisons,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.404468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.404468Z digest=sha256:6dd60e54a4ab97ecb23b09239db87b31d891bc0f73c1130ae99564e2aefdf2ce

Observation c6c7c75a-964f-4be3-98db-7ccacb9aa456 · outbound

This paper cites Lora: Low-rank adaptation of large language models,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Lora: Low-rank adaptation of large language models,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.407720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.407720Z digest=sha256:d6b57db490849a79354ffaf6a40524892d8be080e62ecdc9195148e708bb7b88

Observation 69eaef8e-5ec0-4b85-b9dd-0535ea09c5e3 · outbound

This paper cites Tl; dr: Mining reddit to learn automatic summarization,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Tl; dr: Mining reddit to learn automatic summarization,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.410589Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.410589Z digest=sha256:db1049a9e7cbcb90e1650d98d1126fc7af351c7fd5f4697b909723865dac2334

Observation 28c48aa1-3b33-49a3-93a6-c07352f24529 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.413435Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.413435Z digest=sha256:502ff1c80be40fb31e19313950782bf231c084eebbf1dd9d67dbfec04be8c16a

Observation b20846d6-bb5a-4e7f-8202-ecf8b0d0850a · outbound

This paper cites Learning to summarize with human feedback,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Learning to summarize with human feedback,

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.416890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.416890Z digest=sha256:d3616770135046e81cd24f80beba7992ea68e79448bea083807dd7e8d49f94bf

Observation d7307662-d974-4d78-bb32-98f06ff4217d · outbound

This paper cites OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.419591Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.419591Z digest=sha256:1f5d41b46f3eeb5e0b17c5df73bc727136bb71a87a0b0e5343773be4b42b8fca

Observation 690b7681-8411-4997-85af-d1a2fd2b624a · outbound

This paper cites A general theoretical paradigm to understand learning from human preferences,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels A general theoretical paradigm to understand learning from human preferences,

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-02T08:00:54.422687Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.422687Z digest=sha256:be78a996743431e4a1764239ecd152e2e41676eea842ed83ff295eb5ffef96f0

Observation e02291f2-64ac-44a1-af3f-272077dedac7 · outbound

This paper cites Judging llm-as-a-judge with mt-bench and chatbot arena,.

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels Judging llm-as-a-judge with mt-bench and chatbot arena,

Reference 32

Resolution
malformed identifier
no resolver link, observed 2026-08-02T08:00:54.425668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:00:54.425668Z digest=sha256:7d792f9c89288a0394f9562bedc7e23585dbf6e6681810cf664d61ef05a8164c

Pith citing papers

No inbound Pith citation observations are available.