{"as_of":"2026-08-09T10:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa716ba3fddb325c366313e4d32e4ef093ebf02a2fa3bd091f52dc5b64cee021","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:06:49.755721Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T13:58:53.430492Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T14:00:28.509134Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"cited_work":{"arxiv_id":"2508.06026","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06026","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal self-rewarding language models: Decoupling chosen-rejected via past-future","venue":null,"work_id":"ac5c7972-f5b3-42df-9432-4c5f4586e010","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":165,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2508.06026","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:8626ea32d15ca2d50d277373652b33617cf099ba8e030e7a01b55f5d3d050f71","observation_id":"be78f0cd-54ad-4ce9-9b6a-dfeb43182ab9","resolution":{"observed_at":"2026-05-10T14:00:28.511587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.06026/citation-record","integrity":"/paper/2508.06026/integrity","json":"/paper/2508.06026/citation-record.json","paper":"/paper/2508.06026"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:50.755699Z","title":"Y.; Rajbhandari, S.; Awan, A","venue":null,"work_id":"b36c4805-e040-4dc3-93a3-66bf049d01cd","year":2022},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.265162Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:3b7ddb9264cb6bd2a48fd7bc06e5aabe47b3bf2be024d24fc2f682f3482146b0","observation_id":"6e2097c0-2f18-4025-83f8-884c8e571991","resolution":{"observed_at":"2026-08-05T23:06:50.761472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-05T23:06:49.384616Z","title":"M.; Firat, O.; Johnson, M.; Lepikhin, D.; Passos, A.; Shakeri, S.; Taropa, E.; Bailey, P.; Chen, Z.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.384616Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:c3af2372ba0dea0046fcf5fa0c4d70b0530766d95378faef6c1cf59456e3a330","observation_id":"3acfe968-e085-46da-a75d-1714196f7471","resolution":{"observed_at":"2026-08-05T23:06:49.384616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T23:06:49.499308Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.499308Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:f591f645d7cc939305e8c581eb12cbe0a4402d3b8e1ad4362a5b9a3d37c43301","observation_id":"5fee6bf4-7908-49a4-9541-4fcfcb5529af","resolution":{"observed_at":"2026-08-05T23:06:49.499308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:49.550152Z","title":"D.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.550152Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:c538d51620f29e033b75c223363cf5ae4e6d5fe8bb3d7ee42b479bd8049ab3ee","observation_id":"bbfa7b49-95de-4eed-9f27-e478b0537b14","resolution":{"observed_at":"2026-08-05T23:06:49.550152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-05T23:06:49.556074Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.556074Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:65702cb1cf6f4afeb7f817799f21b24e07468cc4112474b5c82194c0a807db14","observation_id":"d71f2658-3540-4f16-be15-29d0564b1ef0","resolution":{"observed_at":"2026-08-05T23:06:49.556074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-05T23:06:49.561919Z","title":"W.; Sutton, C.; Gehrmann, S.; et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.561919Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:ac42b163d658d59506642d20662503215c2c3fd56fdf3d23cec9d25e078f6574","observation_id":"c3546670-28f0-428a-a813-b2636864ef32","resolution":{"observed_at":"2026-08-05T23:06:49.561919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-05T23:06:49.568769Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.568769Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:925413b328d67a4ea0072d950d80203b1d919a09f73509b329193fd8d5766e1d","observation_id":"17403456-8f5d-45bb-b58a-84c21c0c5e2d","resolution":{"observed_at":"2026-08-05T23:06:49.568769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:50.724744Z","title":"D.; and Chatzoglou, P","venue":null,"work_id":"d4867b45-a364-4ede-a440-2319cc3ed1ee","year":2014},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.574803Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:cfacfe017918668493eb67524bec2b7170d40a480f1e747df67a24291627701f","observation_id":"999e88b1-31ff-4cfb-a966-595b267ba0bc","resolution":{"observed_at":"2026-08-05T23:06:50.729693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-08T15:09:24.533531Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-08-05T23:06:49.580054Z","title":"J.; Rohatgi, D.; Zhang, C.; Simchowitz, M.; Ash, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.580054Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:457112c1f73d602fcc910fbd4b9092b7b34cf46686db1db8561c6436f9764acf","observation_id":"c99e57b6-dc00-4d09-b4a1-c0c4d0d6ae38","resolution":{"observed_at":"2026-08-05T23:06:49.580054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11610","last_updated":"2022-10-25T17:45:17Z","snapshot_observed_at":"2026-08-09T02:27:34.152063Z","submitted_at":"2022-10-20T21:53:54Z","title":"Large Language Models Can Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11610","snapshot_observed_at":"2026-08-05T23:06:49.586132Z","title":"S.; Hou, L.; Wu, Y.; Wang, X.; Yu, H.; and Han, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.586132Z"},"links":{"cited_paper":"/paper/2210.11610","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:48e1e7680149ab1950644ee19f1dba6e5519565bca92f2efc0a663f3c7432009","observation_id":"a32b81c5-329a-439f-92a4-83d5b77c13e4","resolution":{"observed_at":"2026-08-05T23:06:49.586132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T23:06:49.591455Z","title":"Q.; Sablayrolles, A.; Mensch, A.; Bamford, C.; Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.591455Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:8602e714afe14cabe6cd53e5f8fb14df284aadbead859eaa5873541fe9fd0494","observation_id":"4f747ef8-1b49-4793-a342-84c2e7d649cb","resolution":{"observed_at":"2026-08-05T23:06:49.591455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06452","last_updated":"2024-02-19T14:39:07Z","snapshot_observed_at":"2026-07-29T18:39:02.141391Z","submitted_at":"2023-10-10T09:25:44Z","title":"Understanding the Effects of RLHF on LLM Generalisation and Diversity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06452","snapshot_observed_at":"2026-08-05T23:06:49.596674Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.596674Z"},"links":{"cited_paper":"/paper/2310.06452","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:201fd385bad66d5622d193a07296cabf30fd25e6184cbc1b695876beca20d017","observation_id":"31ba34a6-ad6a-4d61-9c6c-372f29c13ac3","resolution":{"observed_at":"2026-08-05T23:06:49.596674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:50.708499Z","title":"o pf, A.; Kilcher, Y.; Von R \\","venue":null,"work_id":"f9c08ef8-7aba-465f-acdf-82b512a15479","year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.601469Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:aacac7217bb5da781f9b4a2a375020fff58fc4a5b3e2a9f289941cba4af5ce8c","observation_id":"66377ed1-f64a-4ec4-8053-682d072536f6","resolution":{"observed_at":"2026-08-05T23:06:50.713051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:50.692152Z","title":"H.; Gonzalez, J","venue":null,"work_id":"5f0ae6de-f6b4-40f2-87ee-22db7a0f44db","year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.606111Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:8776221730bc073f675c961b25502ca22e684238f7af8cbd3ecace8d02df1064","observation_id":"292e2e37-2247-4dfa-a57e-561bb553f050","resolution":{"observed_at":"2026-08-05T23:06:50.697208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18101","last_updated":"2025-05-22T17:50:19Z","snapshot_observed_at":"2026-08-06T14:13:54.538396Z","submitted_at":"2025-01-30T02:47:41Z","title":"Diverse Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18101","snapshot_observed_at":"2026-08-05T23:06:49.610348Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.610348Z"},"links":{"cited_paper":"/paper/2501.18101","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:2c2943613cc726cd590c2d237a2767011b704c097e803e6237371730b1845fa7","observation_id":"8b83f706-b805-4cad-9357-506fc9a9a37f","resolution":{"observed_at":"2026-08-05T23:06:49.610348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05470","last_updated":"2023-12-07T08:48:36Z","snapshot_observed_at":"2026-08-06T02:25:36.517255Z","submitted_at":"2023-10-09T07:27:15Z","title":"Generative Judge for Evaluating Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05470","snapshot_observed_at":"2026-08-05T23:06:49.615131Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.615131Z"},"links":{"cited_paper":"/paper/2310.05470","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:69230cce522adda0e238648e07f73c4a69103ea05a611e4f92970cd842c22f32","observation_id":"a12c86bd-478d-4814-947b-c2d2814803e3","resolution":{"observed_at":"2026-08-05T23:06:49.615131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T23:06:49.619937Z","title":"E.; and Stoica, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.619937Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:2a0bd4434cf83d0f59f4b1d877d39db508186b7968f0bd7dfeb311fda0f3c575","observation_id":"2e30402c-ed2e-40f9-9e2c-01d45a429b1c","resolution":{"observed_at":"2026-08-05T23:06:49.619937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06259","last_updated":"2024-03-12T05:22:46Z","snapshot_observed_at":"2026-07-06T16:05:23.421896Z","submitted_at":"2023-08-11T17:47:54Z","title":"Self-Alignment with Instruction Backtranslation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06259","snapshot_observed_at":"2026-08-05T23:06:49.624787Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.624787Z"},"links":{"cited_paper":"/paper/2308.06259","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:49786b45916558bd88a9e8e553c928882f7c181988556c555cc59a3a3da034a3","observation_id":"57b48448-a52a-4f71-b12e-4937390791ac","resolution":{"observed_at":"2026-08-05T23:06:49.624787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:50.675753Z","title":null,"venue":null,"work_id":"e0fb0da1-cf20-48e4-8cfb-4844256d9b3d","year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.630133Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:16ccb2936d99483cb14dddd143a31a24e1391d37fc1ac3b1803b31b91b8fd3b7","observation_id":"9ef6c809-ae6b-413c-b9af-9d701bc46b00","resolution":{"observed_at":"2026-08-05T23:06:50.680334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12895","last_updated":"2025-01-22T14:15:46Z","snapshot_observed_at":"2026-07-06T20:24:27.525217Z","submitted_at":"2025-01-22T14:15:46Z","title":"Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12895","snapshot_observed_at":"2026-08-05T23:06:49.634866Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.634866Z"},"links":{"cited_paper":"/paper/2501.12895","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:ff0479aff047ab5ae0b8331c43224d370bfb03594f1223003d975b6f6e4bd800","observation_id":"27ce3375-f590-421a-ae23-8a0be3fc2df3","resolution":{"observed_at":"2026-08-05T23:06:49.634866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11877","last_updated":"2025-01-21T04:11:59Z","snapshot_observed_at":"2026-07-06T20:23:40.374376Z","submitted_at":"2025-01-21T04:11:59Z","title":"From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2501.11877","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11877","snapshot_observed_at":"2026-08-05T23:06:50.253288Z","title":"From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning","venue":"cs.CL","work_id":"66f41e98-5ff7-41a5-9d28-bfad88b3519b","year":2025},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.639546Z"},"links":{"cited_paper":"/paper/2501.11877","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:615932d9e548d59777deb9cf4c5fbc46268535d3fb9c30e55ec26ddaa7cdac21","observation_id":"ac02ce60-fad8-4221-a813-a20db1a9a42d","resolution":{"observed_at":"2026-08-05T23:06:50.259087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-07-31T03:53:01.450978Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-05T23:06:49.645169Z","title":"J.; and Liu, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.645169Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:56af900cbe4ba2c396d1760e11eef9c826d600b69d73372a8acc85aa0a4f66fa","observation_id":"092382b6-2b8c-42d5-9650-e3796259d9ac","resolution":{"observed_at":"2026-08-05T23:06:49.645169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:49.649837Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.649837Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:0aab80b87dec25019b6c5184dc5d6c62a31a60840ff4e3764d4944a2620d6406","observation_id":"8d08cd5a-6a5d-4a26-b6d3-1e817c31283b","resolution":{"observed_at":"2026-08-05T23:06:49.649837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:49.654847Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.654847Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:3363427fbe337a7215864d8b1f8697a38c34ba10afeca73d104eb84d56d88909","observation_id":"27153f03-a1cb-4a4b-aeea-4333db13b026","resolution":{"observed_at":"2026-08-05T23:06:49.654847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:50.637016Z","title":null,"venue":null,"work_id":"e9daf777-41a3-46c2-b1ff-1f0ea9efd996","year":2024},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.659754Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:e5bd2a82f3dd96bc5434f834ca4c1accb2764cba02af5f492d9787ec196f0a47","observation_id":"4a4b7da3-019c-4df1-8e25-37eb52b1eecd","resolution":{"observed_at":"2026-08-05T23:06:50.641870Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:49.665152Z","title":"D.; Ermon, S.; and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.665152Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:f7ae2656ddc28a5fb40d1f077e90e336ee28d134495c062ae68579b0e69d5227","observation_id":"c7bb6c53-4d80-4d3f-9489-cb20d2990fa9","resolution":{"observed_at":"2026-08-05T23:06:49.665152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:49.669976Z","title":"D.; and Arora, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.669976Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:167087f167ecb9bb007156ba65bae17323ed738a86eb981ce22039bf750beffe","observation_id":"972df6f0-fd7c-42db-bcdb-8dd0c67eac67","resolution":{"observed_at":"2026-08-05T23:06:49.669976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:49.674585Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.674585Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:4fd7546529ae7d1d405edaf3414ad5bba5dd46cbce60c2c5c0bac16c239e74b8","observation_id":"cef979ca-8cf6-4927-9d87-3c4045b782f1","resolution":{"observed_at":"2026-08-05T23:06:49.674585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T23:06:49.678965Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.678965Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:9b815ed90cfcda62de64767ffa067161057289c905fb9f4870b4362bf8c0cf63","observation_id":"1dd4722a-e41b-4475-af7e-ca396a61768c","resolution":{"observed_at":"2026-08-05T23:06:49.678965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:50.596049Z","title":null,"venue":null,"work_id":"80abbfa8-662a-4431-96a5-5b28be392693","year":2024},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.683965Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:856c5eae9c09154d4ea13dbe76a7cbb8ad9c1d39095949cc1b3a6892dcfa1488","observation_id":"ca0106e4-d14d-464d-8503-afc5bcdd59eb","resolution":{"observed_at":"2026-08-05T23:06:50.600958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12735","last_updated":"2025-04-26T15:42:47Z","snapshot_observed_at":"2026-07-06T19:34:41.712266Z","submitted_at":"2024-10-16T16:51:01Z","title":"CREAM: Consistency Regularized Self-Rewarding Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12735","snapshot_observed_at":"2026-08-05T23:06:49.688537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.688537Z"},"links":{"cited_paper":"/paper/2410.12735","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:ebeff7261cae4ce0fd2f37183b1bcc834f6ff8a03806e954a7cc23a781c63f81","observation_id":"19a68efa-94f5-40ea-a1fb-beae266ab74a","resolution":{"observed_at":"2026-08-05T23:06:49.688537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00898","last_updated":"2024-09-12T22:09:25Z","snapshot_observed_at":"2026-07-06T16:26:17.772056Z","submitted_at":"2023-10-02T04:29:40Z","title":"Enabling Language Models to Implicitly Learn Self-Improvement","version":4},"cited_work":{"arxiv_id":"2310.00898","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.00898","snapshot_observed_at":"2026-08-05T23:06:50.008244Z","title":"Enabling Language Models to Implicitly Learn Self-Improvement","venue":"cs.CL","work_id":"8a07dca6-71c3-4f55-8d6c-40eaad617228","year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.693409Z"},"links":{"cited_paper":"/paper/2310.00898","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:06380def603ec6c3a5a9b2f89318a05d22514b756b6fc633918ce1b6265f8993","observation_id":"e60045f1-012f-4a39-93aa-e7081a442b2c","resolution":{"observed_at":"2026-08-05T23:06:50.013159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-07-06T18:53:00.965448Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-05T23:06:49.698152Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.698152Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:c1b5cddc84f0030399b8cc5a138e65565d4ca04868de547fd9d69f490c3f9995","observation_id":"71b2bf67-f471-482f-ba00-5427082fa2ee","resolution":{"observed_at":"2026-08-05T23:06:49.698152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T23:06:49.702813Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.702813Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:6d24e6b68fd856ce0795e1981a802921b820cc4b9b67dfd5307d23c8b62e75f1","observation_id":"2dbbf387-75a1-4980-98ba-75c7278a89f1","resolution":{"observed_at":"2026-08-05T23:06:49.702813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13522","last_updated":"2024-03-31T18:12:16Z","snapshot_observed_at":"2026-08-05T05:44:42.259024Z","submitted_at":"2023-10-20T14:11:04Z","title":"Teaching Language Models to Self-Improve through Interactive Demonstrations","version":2},"cited_work":{"arxiv_id":"2310.13522","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.13522","snapshot_observed_at":"2026-08-05T23:06:49.947240Z","title":"Teaching Language Models to Self-Improve through Interactive Demonstrations","venue":"cs.CL","work_id":"029b70dc-3165-4f90-94d8-7bf97c670ec8","year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.707883Z"},"links":{"cited_paper":"/paper/2310.13522","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:8cd329183c6d7404765a6d3a82143b071dd4223f29e1beeeede0b163b1674e03","observation_id":"5f206878-43d7-44dd-b0a8-1b6e50f83983","resolution":{"observed_at":"2026-08-05T23:06:49.952745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T23:06:49.712423Z","title":"Y.; Cho , K.; Li , X.; Sukhbaatar , S.; Xu , J.; and Weston , J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.712423Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:cf114122a025f2bf066168742ade6839666b0d309322e89883fd57cd6843ac4f","observation_id":"596f078d-45fb-46bf-a7ad-bcc89012defb","resolution":{"observed_at":"2026-08-05T23:06:49.712423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02414","last_updated":"2023-10-25T05:22:43Z","snapshot_observed_at":"2026-08-02T04:26:53.194797Z","submitted_at":"2022-10-05T17:34:44Z","title":"GLM-130B: An Open Bilingual Pre-trained Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02414","snapshot_observed_at":"2026-08-05T23:06:49.717415Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.717415Z"},"links":{"cited_paper":"/paper/2210.02414","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:c9426f5911f46eddee54b80acf0908a3308caf16200a723f89de9afc1533ea37","observation_id":"3111235b-0f77-4cf0-8a98-0f23c4a51f66","resolution":{"observed_at":"2026-08-05T23:06:49.717415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13723","last_updated":"2025-02-19T13:51:05Z","snapshot_observed_at":"2026-08-07T18:04:58.145307Z","submitted_at":"2025-02-19T13:51:05Z","title":"Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values","version":1},"cited_work":{"arxiv_id":"2502.13723","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.13723","snapshot_observed_at":"2026-08-05T23:06:49.879378Z","title":"Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values","venue":"cs.CL","work_id":"b974315d-b4ea-4c85-82a5-1668938bff10","year":2025},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.722299Z"},"links":{"cited_paper":"/paper/2502.13723","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:6fed47fc9f26074a6cb797a0b907c56060ff2b40b5618660bfc10bda8ecbd08d","observation_id":"a92bd15e-a55f-47c6-9899-d9fa0b7ae95a","resolution":{"observed_at":"2026-08-05T23:06:49.887791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03746","last_updated":"2025-03-05T18:58:44Z","snapshot_observed_at":"2026-08-07T17:26:48.410599Z","submitted_at":"2025-03-05T18:58:44Z","title":"Process-based Self-Rewarding Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03746","snapshot_observed_at":"2026-08-05T23:06:49.727005Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.727005Z"},"links":{"cited_paper":"/paper/2503.03746","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:0206d67a148792d8a09ea1b9fb6ecf98a7703c33c4258cf24ceab2dc10734fdf","observation_id":"cefe01cc-2bf6-412e-9050-1c1a2d005fcc","resolution":{"observed_at":"2026-08-05T23:06:49.727005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08232","last_updated":"2025-05-22T08:54:14Z","snapshot_observed_at":"2026-08-08T23:23:06.869489Z","submitted_at":"2023-10-12T11:25:46Z","title":"Language Models are Universal Embedders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08232","snapshot_observed_at":"2026-08-05T23:06:49.731775Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.731775Z"},"links":{"cited_paper":"/paper/2310.08232","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:523ff96b3485846870a5e93d11402d42aff81d98e5b574eeb5b83152ffd70173","observation_id":"15701eec-a68a-4602-bb80-7ceeb2824b31","resolution":{"observed_at":"2026-08-05T23:06:49.731775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10859","last_updated":"2024-08-07T21:57:20Z","snapshot_observed_at":"2026-07-06T18:01:10.003838Z","submitted_at":"2024-04-16T19:17:23Z","title":"Forcing Diffuse Distributions out of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10859","snapshot_observed_at":"2026-08-05T23:06:49.736635Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.736635Z"},"links":{"cited_paper":"/paper/2404.10859","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:7d03228d9213ede2e89178f9b8bbf3c2dd8b31c2227cb9720a8f89d55d0da48e","observation_id":"db368bf3-22c8-401f-b634-de41099e2368","resolution":{"observed_at":"2026-08-05T23:06:49.736635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:49.741440Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.741440Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:0f4b48564977fefcbbbbee1edfcbd397723fad828c5ffbb542206ca676302611","observation_id":"2ee15eaf-15d6-45bf-9c0d-29fae194ec06","resolution":{"observed_at":"2026-08-05T23:06:49.741440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-09T00:20:18.332726Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08922","snapshot_observed_at":"2026-08-05T23:06:49.746071Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.746071Z"},"links":{"cited_paper":"/paper/2502.08922","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:8ff13c58883c299bc7a59b892b8a9e2b1fca0949c205db29e4fd78ebf2f696be","observation_id":"18db4afd-80b6-4da9-b0f4-c8e5b09750d9","resolution":{"observed_at":"2026-08-05T23:06:49.746071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:49.750641Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.750641Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:2d52d3c10843b5a0e3ddd856c2bae192927444163a03ba490159a65bc54cca9f","observation_id":"eb64a4ed-7654-425f-94c7-47c635f5722a","resolution":{"observed_at":"2026-08-05T23:06:49.750641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:06:49.755721Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.755721Z"},"links":{"citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:6ad999fc2e1f0f9446483a7f52e91b6274491573b1dcb717e3bea8248a4577ab","observation_id":"6f03bad6-0778-437a-8257-e1538fe59399","resolution":{"observed_at":"2026-08-05T23:06:49.755721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":4,"verified_fuzzy":4},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2508.06026."}