Pith. sign in

Paper Citation Record · LEDGER

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future

As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2508.06026.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.06026 v1

Coverage vector

measured 45 of 45 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T23:06:49.755721Z

measured 46 of 46 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-10T13:58:53.430492Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-10T14:00:28.509134Z

Reference resolution

45 of 45 outbound references displayed

  • verified exact4
  • verified fuzzy4
  • unresolved37
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 6e2097c0-2f18-4025-83f8-884c8e571991 · outbound

This paper cites Y.; Rajbhandari, S.; Awan, A.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Y.; Rajbhandari, S.; Awan, A

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:06:50.761472Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.265162Z digest=sha256:3b7ddb9264cb6bd2a48fd7bc06e5aabe47b3bf2be024d24fc2f682f3482146b0

Observation 3acfe968-e085-46da-a75d-1714196f7471 · outbound

This paper cites PaLM 2 Technical Report.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future PaLM 2 Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.384616Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.384616Z digest=sha256:c3af2372ba0dea0046fcf5fa0c4d70b0530766d95378faef6c1cf59456e3a330

Observation 5fee6bf4-7908-49a4-9541-4fcfcb5529af · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.499308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.499308Z digest=sha256:f591f645d7cc939305e8c581eb12cbe0a4402d3b8e1ad4362a5b9a3d37c43301

Observation bbfa7b49-95de-4eed-9f27-e478b0537b14 · outbound

This paper cites D.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; et al.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future D.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; et al

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.550152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.550152Z digest=sha256:c538d51620f29e033b75c223363cf5ae4e6d5fe8bb3d7ee42b479bd8049ab3ee

Observation d71f2658-3540-4f16-be15-29d0564b1ef0 · outbound

This paper cites Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.556074Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.556074Z digest=sha256:65702cb1cf6f4afeb7f817799f21b24e07468cc4112474b5c82194c0a807db14

Observation c3546670-28f0-428a-a813-b2636864ef32 · outbound

This paper cites PaLM: Scaling Language Modeling with Pathways.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future PaLM: Scaling Language Modeling with Pathways

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.561919Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.561919Z digest=sha256:ac42b163d658d59506642d20662503215c2c3fd56fdf3d23cec9d25e078f6574

Observation 17403456-8f5d-45bb-b58a-84c21c0c5e2d · outbound

This paper cites UltraFeedback: Boosting Language Models with Scaled AI Feedback.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future UltraFeedback: Boosting Language Models with Scaled AI Feedback

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.568769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.568769Z digest=sha256:925413b328d67a4ea0072d950d80203b1d919a09f73509b329193fd8d5766e1d

Observation 999e88b1-31ff-4cfb-a966-595b267ba0bc · outbound

This paper cites D.; and Chatzoglou, P.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future D.; and Chatzoglou, P

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:06:50.729693Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.574803Z digest=sha256:cfacfe017918668493eb67524bec2b7170d40a480f1e747df67a24291627701f

Observation c99e57b6-dc00-4d09-b4a1-c0c4d0d6ae38 · outbound

This paper cites Self-Improvement in Language Models: The Sharpening Mechanism.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Self-Improvement in Language Models: The Sharpening Mechanism

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.580054Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.580054Z digest=sha256:457112c1f73d602fcc910fbd4b9092b7b34cf46686db1db8561c6436f9764acf

Observation a32b81c5-329a-439f-92a4-83d5b77c13e4 · outbound

This paper cites Large Language Models Can Self-Improve.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Large Language Models Can Self-Improve

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.586132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.586132Z digest=sha256:48e1e7680149ab1950644ee19f1dba6e5519565bca92f2efc0a663f3c7432009

Observation 4f747ef8-1b49-4793-a342-84c2e7d649cb · outbound

This paper cites Mistral 7B.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Mistral 7B

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.591455Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.591455Z digest=sha256:8602e714afe14cabe6cd53e5f8fb14df284aadbead859eaa5873541fe9fd0494

Observation 31ba34a6-ad6a-4d61-9c6c-372f29c13ac3 · outbound

This paper cites Understanding the Effects of RLHF on LLM Generalisation and Diversity.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Understanding the Effects of RLHF on LLM Generalisation and Diversity

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.596674Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.596674Z digest=sha256:201fd385bad66d5622d193a07296cabf30fd25e6184cbc1b695876beca20d017

Observation 66377ed1-f64a-4ec4-8053-682d072536f6 · outbound

This paper cites o pf, A.; Kilcher, Y.; Von R \.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future o pf, A.; Kilcher, Y.; Von R \

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:06:50.713051Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.601469Z digest=sha256:aacac7217bb5da781f9b4a2a375020fff58fc4a5b3e2a9f289941cba4af5ce8c

Observation 292e2e37-2247-4dfa-a57e-561bb553f050 · outbound

This paper cites H.; Gonzalez, J.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future H.; Gonzalez, J

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:06:50.697208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.606111Z digest=sha256:8776221730bc073f675c961b25502ca22e684238f7af8cbd3ecace8d02df1064

Observation 8b83f706-b805-4cad-9357-506fc9a9a37f · outbound

This paper cites Diverse Preference Optimization.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Diverse Preference Optimization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.610348Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.610348Z digest=sha256:2c2943613cc726cd590c2d237a2767011b704c097e803e6237371730b1845fa7

Observation a12c86bd-478d-4814-947b-c2d2814803e3 · outbound

This paper cites Generative Judge for Evaluating Alignment.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Generative Judge for Evaluating Alignment

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.615131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.615131Z digest=sha256:69230cce522adda0e238648e07f73c4a69103ea05a611e4f92970cd842c22f32

Observation 2e30402c-ed2e-40f9-9e2c-01d45a429b1c · outbound

This paper cites From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.619937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.619937Z digest=sha256:2a0bd4434cf83d0f59f4b1d877d39db508186b7968f0bd7dfeb311fda0f3c575

Observation 57b48448-a52a-4f71-b12e-4937390791ac · outbound

This paper cites Self-Alignment with Instruction Backtranslation.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Self-Alignment with Instruction Backtranslation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.624787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.624787Z digest=sha256:49786b45916558bd88a9e8e553c928882f7c181988556c555cc59a3a3da034a3

Observation 9ef6c809-ae6b-413c-b9af-9d701bc46b00 · outbound

This paper cites an unresolved cited work.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Unresolved cited work

Reference 19

Resolution
unresolved
raw_fallback, observed 2026-08-05T23:06:50.680334Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.630133Z digest=sha256:16ccb2936d99483cb14dddd143a31a24e1391d37fc1ac3b1803b31b91b8fd3b7

Observation 27ce3375-f590-421a-ae23-8a0be3fc2df3 · outbound

This paper cites Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.634866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.634866Z digest=sha256:ff0479aff047ab5ae0b8331c43224d370bfb03594f1223003d975b6f6e4bd800

Observation ac02ce60-fad8-4221-a813-a20db1a9a42d · outbound

This paper cites From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-08-05T23:06:50.259087Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.639546Z digest=sha256:615932d9e548d59777deb9cf4c5fbc46268535d3fb9c30e55ec26ddaa7cdac21

Observation 092382b6-2b8c-42d5-9650-e3796259d9ac · outbound

This paper cites Statistical Rejection Sampling Improves Preference Optimization.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Statistical Rejection Sampling Improves Preference Optimization

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.645169Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.645169Z digest=sha256:56af900cbe4ba2c396d1760e11eef9c826d600b69d73372a8acc85aa0a4f66fa

Observation 8d08cd5a-6a5d-4a26-b6d3-1e817c31283b · outbound

This paper cites an unresolved cited work.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.649837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.649837Z digest=sha256:0aab80b87dec25019b6c5184dc5d6c62a31a60840ff4e3764d4944a2620d6406

Observation 27153f03-a1cb-4a4b-aeea-4333db13b026 · outbound

This paper cites an unresolved cited work.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Unresolved cited work

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.654847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.654847Z digest=sha256:3363427fbe337a7215864d8b1f8697a38c34ba10afeca73d104eb84d56d88909

Observation 4a4b7da3-019c-4df1-8e25-37eb52b1eecd · outbound

This paper cites an unresolved cited work.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-05T23:06:50.641870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.659754Z digest=sha256:e5bd2a82f3dd96bc5434f834ca4c1accb2764cba02af5f492d9787ec196f0a47

Observation c7bb6c53-4d80-4d3f-9489-cb20d2990fa9 · outbound

This paper cites D.; Ermon, S.; and Finn, C.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future D.; Ermon, S.; and Finn, C

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.665152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.665152Z digest=sha256:f7ae2656ddc28a5fb40d1f077e90e336ee28d134495c062ae68579b0e69d5227

Observation 972df6f0-fd7c-42db-bcdb-8dd0c67eac67 · outbound

This paper cites D.; and Arora, S.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future D.; and Arora, S

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.669976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.669976Z digest=sha256:167087f167ecb9bb007156ba65bae17323ed738a86eb981ce22039bf750beffe

Observation cef979ca-8cf6-4927-9d87-3c4045b782f1 · outbound

This paper cites an unresolved cited work.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Unresolved cited work

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.674585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.674585Z digest=sha256:4fd7546529ae7d1d405edaf3414ad5bba5dd46cbce60c2c5c0bac16c239e74b8

Observation 1dd4722a-e41b-4475-af7e-ca396a61768c · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future LLaMA: Open and Efficient Foundation Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.678965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.678965Z digest=sha256:9b815ed90cfcda62de64767ffa067161057289c905fb9f4870b4362bf8c0cf63

Observation ca0106e4-d14d-464d-8503-afc5bcdd59eb · outbound

This paper cites an unresolved cited work.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Unresolved cited work

Reference 30

Resolution
unresolved
raw_fallback, observed 2026-08-05T23:06:50.600958Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.683965Z digest=sha256:856c5eae9c09154d4ea13dbe76a7cbb8ad9c1d39095949cc1b3a6892dcfa1488

Observation 19a68efa-94f5-40ea-a1fb-beae266ab74a · outbound

This paper cites CREAM: Consistency Regularized Self-Rewarding Language Models.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future CREAM: Consistency Regularized Self-Rewarding Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.688537Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.688537Z digest=sha256:ebeff7261cae4ce0fd2f37183b1bcc834f6ff8a03806e954a7cc23a781c63f81

Observation e60045f1-012f-4a39-93aa-e7081a442b2c · outbound

This paper cites Enabling Language Models to Implicitly Learn Self-Improvement.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Enabling Language Models to Implicitly Learn Self-Improvement

Reference 32

Resolution
verified exact
local_arxiv, observed 2026-08-05T23:06:50.013159Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.693409Z digest=sha256:06380def603ec6c3a5a9b2f89318a05d22514b756b6fc633918ce1b6265f8993

Observation 71b2bf67-f471-482f-ba00-5427082fa2ee · outbound

This paper cites Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.698152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.698152Z digest=sha256:c1b5cddc84f0030399b8cc5a138e65565d4ca04868de547fd9d69f490c3f9995

Observation 2dbbf387-75a1-4980-98ba-75c7278a89f1 · outbound

This paper cites Qwen2.5 Technical Report.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Qwen2.5 Technical Report

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.702813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.702813Z digest=sha256:6d24e6b68fd856ce0795e1981a802921b820cc4b9b67dfd5307d23c8b62e75f1

Observation 5f206878-43d7-44dd-b0a8-1b6e50f83983 · outbound

This paper cites Teaching Language Models to Self-Improve through Interactive Demonstrations.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Teaching Language Models to Self-Improve through Interactive Demonstrations

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-08-05T23:06:49.952745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.707883Z digest=sha256:8cd329183c6d7404765a6d3a82143b071dd4223f29e1beeeede0b163b1674e03

Observation 596f078d-45fb-46bf-a7ad-bcc89012defb · outbound

This paper cites Self-Rewarding Language Models.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Self-Rewarding Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.712423Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.712423Z digest=sha256:cf114122a025f2bf066168742ade6839666b0d309322e89883fd57cd6843ac4f

Observation 3111235b-0f77-4cf0-8a98-0f23c4a51f66 · outbound

This paper cites GLM-130B: An Open Bilingual Pre-trained Model.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future GLM-130B: An Open Bilingual Pre-trained Model

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.717415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.717415Z digest=sha256:c9426f5911f46eddee54b80acf0908a3308caf16200a723f89de9afc1533ea37

Observation a92bd15e-a55f-47c6-9899-d9fa0b7ae95a · outbound

This paper cites Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values

Reference 38

Resolution
verified exact
local_arxiv, observed 2026-08-05T23:06:49.887791Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.722299Z digest=sha256:6fed47fc9f26074a6cb797a0b907c56060ff2b40b5618660bfc10bda8ecbd08d

Observation cefe01cc-2bf6-412e-9050-1c1a2d005fcc · outbound

This paper cites Process-based Self-Rewarding Language Models.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Process-based Self-Rewarding Language Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.727005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.727005Z digest=sha256:0206d67a148792d8a09ea1b9fb6ecf98a7703c33c4258cf24ceab2dc10734fdf

Observation 15701eec-a68a-4602-bb80-7ceeb2824b31 · outbound

This paper cites Language Models are Universal Embedders.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Language Models are Universal Embedders

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.731775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.731775Z digest=sha256:523ff96b3485846870a5e93d11402d42aff81d98e5b574eeb5b83152ffd70173

Observation db368bf3-22c8-401f-b634-de41099e2368 · outbound

This paper cites Forcing Diffuse Distributions out of Language Models.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Forcing Diffuse Distributions out of Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.736635Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.736635Z digest=sha256:7d03228d9213ede2e89178f9b8bbf3c2dd8b31c2227cb9720a8f89d55d0da48e

Observation 2ee15eaf-15d6-45bf-9c0d-29fae194ec06 · outbound

This paper cites an unresolved cited work.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Unresolved cited work

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.741440Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.741440Z digest=sha256:0f4b48564977fefcbbbbee1edfcbd397723fad828c5ffbb542206ca676302611

Observation 18db4afd-80b6-4da9-b0f4-c8e5b09750d9 · outbound

This paper cites Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.746071Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.746071Z digest=sha256:8ff13c58883c299bc7a59b892b8a9e2b1fca0949c205db29e4fd78ebf2f696be

Observation eb64a4ed-7654-425f-94c7-47c635f5722a · outbound

This paper cites , " * write output.state after.block = add.period write newline.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future , " * write output.state after.block = add.period write newline

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.750641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.750641Z digest=sha256:2d52d3c10843b5a0e3ddd856c2bae192927444163a03ba490159a65bc54cca9f

Observation 6f03bad6-0778-437a-8257-e1538fe59399 · outbound

This paper cites write newline.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future write newline

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.755721Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.755721Z digest=sha256:6ad999fc2e1f0f9446483a7f52e91b6274491573b1dcb717e3bea8248a4577ab

Pith citing papers

Observation be78f0cd-54ad-4ce9-9b6a-dfeb43182ab9 · inbound

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges cites this paper.

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future

Reference 165

Resolution
verified exact
arxiv_id, observed 2026-05-10T14:00:28.511587Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-10T13:58:53.430492Z digest=sha256:8626ea32d15ca2d50d277373652b33617cf099ba8e030e7a01b55f5d3d050f71