{"as_of":"2026-08-14T12:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f802cd65b101e15de0b4045f324af27a4c4f070bc8dad2ac283ca9fe9a164cd1","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T14:05:37.120262Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T07:26:46.105050Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-29T07:33:14.104597Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"cited_work":{"arxiv_id":"2601.21484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.21484","snapshot_observed_at":"2026-06-29T07:33:14.104597Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","venue":"cs.LG","work_id":"949d8fbd-f29b-41d8-b117-8e1e5d9a0ef9","year":2026},"citing_paper":{"arxiv_id":"2605.19444","last_updated":"2026-05-27T03:12:51Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:58:44Z","title":"Detecting and Mitigating the Correct-Answer Extinction Window in Test-Time Reinforcement Learning with Majority Voting","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-20T07:20:50.835826Z"},"links":{"cited_paper":"/paper/2601.21484","citing_paper":"/paper/2605.19444"},"observation_digest":"sha256:d2aa32828987b31f433b7b585ca6324f8130884cbb593fa2624ae6fbf51da7c4","observation_id":"9361fab5-b076-4d63-8fa7-e8edc2a4ba2e","resolution":{"observed_at":"2026-05-20T07:23:06.921587Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"cited_work":{"arxiv_id":"2601.21484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.21484","snapshot_observed_at":"2026-06-29T07:33:14.104597Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","venue":"cs.LG","work_id":"949d8fbd-f29b-41d8-b117-8e1e5d9a0ef9","year":2026},"citing_paper":{"arxiv_id":"2605.29734","last_updated":"2026-05-28T10:29:01Z","snapshot_observed_at":"2026-08-13T21:38:35.154772Z","submitted_at":"2026-05-28T10:29:01Z","title":"HTAM: Hierarchical Transition-Attended Memory for Operator Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-29T07:26:46.105050Z"},"links":{"cited_paper":"/paper/2601.21484","citing_paper":"/paper/2605.29734"},"observation_digest":"sha256:483dd8a8a2a5a22ea539d1956d490b641084a00b551e6ca604d4114c88f95bf8","observation_id":"b0475f41-f8d4-4fcb-9dbb-8a32d296b39a","resolution":{"observed_at":"2026-06-29T07:33:14.105842Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.21484/citation-record","integrity":"/paper/2601.21484/integrity","json":"/paper/2601.21484/citation-record.json","paper":"/paper/2601.21484"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:0e11e7659a19f44aff7479712bb50966c245399ee849c235dfa5d6b5c20e0527","observation_id":"ef8e1f2d-2d33-4bf8-9154-c4357321ca13","resolution":{"observed_at":"2026-05-21T14:10:13.494087Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2204.05862","doi":"10.1016/j.respol.2005.01.014","metadata_source":"pith","pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","venue":"cs.CL","work_id":"a1f2574b-a899-4713-be60-c87ba332656c","year":2022},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:e920b34d5daf1854485dd2a496fededed056d2b1a83d532585e68d935f448ed2","observation_id":"7e031410-7850-43bb-a61a-57e5111c4ca8","resolution":{"observed_at":"2026-05-21T14:10:13.537044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":"2307.15217","doi":"10.48550/arxiv.2307.15217","metadata_source":"pith","pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","venue":"cs.AI","work_id":"73fe40c4-d27f-4883-a2f1-52ea228f44fd","year":2023},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:c84d0d89427610966ff20f5d806e110a4d40bcedd8879f8b715662caf29045aa","observation_id":"114285a7-d4c2-4d75-b1a5-181c265bfa08","resolution":{"observed_at":"2026-05-21T14:10:13.449970Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:49:19.412323+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:49:19.412323+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level verifier- guided hybrid test-time scaling for large language models","venue":null,"work_id":"52ab7d67-61de-4318-bed3-ebe2199e0dc9","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:aefad36da3ab211061bb694096d9911d11d800cb39c0401ed4e05b6bf0ea48bb","observation_id":"3729bb81-31cf-4524-b97c-e89ea17c170d","resolution":{"observed_at":"2026-05-21T14:10:13.943440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:6e2c4e636fb426cadbad7c384cf2fbf9d353cb50828bbb420394493a8e6964aa","observation_id":"9faa33c2-721a-448b-aa35-0800432d54c1","resolution":{"observed_at":"2026-05-21T14:10:13.470562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.15287","doi":"10.48550/arxiv.2412.15287","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Inference-aware fine-tuning for best-of-n sampling in large language models","venue":"arXiv (Cornell University)","work_id":"827ca722-7f31-4433-8fa9-e3b1596372cb","year":2024},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:7ab00cafd37376ff89ff8a735d1ab915a9bdeeeb394043d7552dd71e1c27570c","observation_id":"50e3e2fd-8e02-47ce-9143-e9da9eba0189","resolution":{"observed_at":"2026-05-21T14:10:13.481343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:c55ac089f3411b582aa8bb6f70cb0a2e7b4a9f95ee83a9cf6c48182143c58afe","observation_id":"387f31dc-d891-4a83-8207-eed2c09e3c6f","resolution":{"observed_at":"2026-05-21T14:10:13.446956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08390","last_updated":"2026-08-06T22:52:14Z","snapshot_observed_at":"2026-08-13T22:18:55.748799Z","submitted_at":"2025-07-11T08:00:47Z","title":"Inference-Time Scaling of Diffusion Language Models via Trajectory Refinement","version":5},"cited_work":{"arxiv_id":"2507.08390","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.08390","snapshot_observed_at":"2026-07-03T13:48:21.273527Z","title":"Inference-Time Scaling of Diffusion Language Models via Trajectory Refinement","venue":"cs.LG","work_id":"9c59910b-3e7a-46e0-9039-0ef35ba0f2ad","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2507.08390","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:a2fa2ba8916b1443a33866930251a90fcd91301f5c6adc5772c7138c2a32d8b4","observation_id":"a45c89ce-0c7c-4762-a974-7bb75bbb874c","resolution":{"observed_at":"2026-05-21T14:10:13.437124Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T21:06:34.823682Z","title":"On grpo collapse in search-r1: The lazy likelihood- displacement death spiral","venue":null,"work_id":"ccf2c4a4-1d0c-436f-a160-0001f11cc060","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:d33fd78f674722ff3091270fb93fe100bda747fef4784d3580522b5f1708203e","observation_id":"4ea25cbc-3cc5-4549-bef9-331d6a9e9558","resolution":{"observed_at":"2026-05-21T14:10:13.527496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:9307a4b2a72f15075d343605beed54311c5c095a08f32bd0e6b5da7c9b0d807d","observation_id":"4c092ba1-561c-46a3-a115-ae396192aaa4","resolution":{"observed_at":"2026-05-21T14:10:13.456057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1260860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:47:14.558044Z","title":"He, B., Yin, L., Zhen, H.-L., Liu, S., Wu, H., Zhang, X., Yuan, M., and Ma, C","venue":null,"work_id":"e7e9d443-273d-4722-8ec7-59adb893de0e","year":2024},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:0becba2b0f0fc71702029240112a6ce415aac718d132696e0099f8e48bf7a681","observation_id":"ca713a13-d20d-4186-a2a2-7bc2a3e542b1","resolution":{"observed_at":"2026-05-21T14:10:13.485186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00934","last_updated":"2024-04-03T17:04:06Z","snapshot_observed_at":"2026-08-13T23:14:48.058836Z","submitted_at":"2024-04-01T05:39:36Z","title":"ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback","version":2},"cited_work":{"arxiv_id":"2404.00934","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00934","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatglm- rlhf: Practices of aligning large language models with human feedback","venue":null,"work_id":"c9ced531-0d1d-4eb8-88f5-be15e8d55087","year":2024},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2404.00934","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:e21c5abf6a1ed158d1880ccada71942dc2ed7e4a21cea5a5f0df9a00d8c72672","observation_id":"6f5bf541-14e5-4ffd-8b3e-1a5725aef206","resolution":{"observed_at":"2026-05-21T14:10:13.533374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21467","doi":"10.48550/arxiv.2505.21467","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Seo, J.-s., Zhang, Z., and Gupta, U","venue":"arXiv (Cornell University)","work_id":"2fbfcd17-7a6b-4979-912b-deca632607b1","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:711c2d8eb54fd8e64ef04177320c070b4b635128e2721188e086e8348f9adb26","observation_id":"05dca34f-b046-4843-bb3b-4f77cd29b5e4","resolution":{"observed_at":"2026-05-21T14:10:13.460621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00432","last_updated":"2025-10-20T14:27:09Z","snapshot_observed_at":"2026-08-13T07:07:37.346433Z","submitted_at":"2025-07-01T05:23:05Z","title":"Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2507.00432","doi":"10.48550/arxiv.2507.00432","metadata_source":"pith","pith_arxiv_id":"2507.00432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning","venue":"cs.AI","work_id":"5d347bac-2a53-443b-b727-d4ed3ea9be1a","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2507.00432","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:81d4cb08f22b0200893675e2c99a1013bb8856415c5f5238cc920a0c52ab09ce","observation_id":"45178250-d860-4872-b3a2-fa959dc34ecf","resolution":{"observed_at":"2026-05-21T14:10:13.542812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":"2207.05221","doi":"10.1145/3618260.3649777","metadata_source":"pith","pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models (Mostly) Know What They Know","venue":"cs.CL","work_id":"8ca58a10-da41-4f70-baae-7e449512e345","year":2022},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:d3daf211f48de08cce77cebd1f9e1db0636aeb253225a67b749962d072b639ae","observation_id":"38315df3-a3e1-41cc-8d71-5e74fb1602f8","resolution":{"observed_at":"2026-05-21T14:10:13.575828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:53:13.382372+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:53:13.382372+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.18581","doi":"10.48550/arxiv.2502.18581","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable best-of-n selection for large language models via self-certainty.arXiv preprint arXiv:2502.18581","venue":"ArXiv.org","work_id":"c6eaf770-5086-4709-9b9f-b31eba94d3bc","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:09b85378524ad38fff84f4bb13c866f3435d4398c9f951eed9cca82946fb0868","observation_id":"58f156b8-f32d-4ad5-8501-24ad5c9d98dd","resolution":{"observed_at":"2026-05-21T14:10:13.552143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T22:21:04.566957+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T22:21:04.566957+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14901","last_updated":"2025-10-16T17:18:11Z","snapshot_observed_at":"2026-08-04T14:57:11.439686Z","submitted_at":"2025-10-16T17:18:11Z","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","version":1},"cited_work":{"arxiv_id":"2510.14901","doi":"10.48550/arxiv.2510.14901","metadata_source":"pith","pith_arxiv_id":"2510.14901","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","venue":"cs.LG","work_id":"56a35230-70da-4209-8bd7-899023fabb1b","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2510.14901","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:01c06f2b77b27f6aae72d464b605eda377af527ca6fba21700b27a6e173ab5a6","observation_id":"6359aaa2-1066-43cc-b494-f3c027ab0c01","resolution":{"observed_at":"2026-05-21T14:10:13.477944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09664","last_updated":"2023-04-15T12:55:45Z","snapshot_observed_at":"2026-07-06T14:53:27.667483Z","submitted_at":"2023-02-19T20:10:07Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","version":3},"cited_work":{"arxiv_id":"2302.09664","doi":"10.48550/arxiv.2302.09664","metadata_source":"pith","pith_arxiv_id":"2302.09664","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","venue":"cs.CL","work_id":"d66d411b-c2c1-4cd6-8a6b-9fac872fa257","year":2023},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2302.09664","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:066d54c4cc5ce92d9095af86c17d3941300c3baf72fdb1ee27ebc2e6a7635d06","observation_id":"6b2e9ac0-d626-4e05-bbdc-582c1c2cc4d7","resolution":{"observed_at":"2026-05-21T14:10:13.474054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21321","last_updated":"2025-03-24T09:34:38Z","snapshot_observed_at":"2026-08-09T09:18:08.427943Z","submitted_at":"2025-02-28T18:59:54Z","title":"LLM Post-Training: A Deep Dive into Reasoning Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.21321","doi":"10.48550/arxiv.2502.21321","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.21321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoRR , volume =","venue":"ArXiv.org","work_id":"4c10bffb-560d-4de2-9f8e-b3290faa7d18","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2502.21321","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:3f3fd334ea2d81d848ae7c2b46cc3a9b1001668cb4c58ea784b19f917c08510a","observation_id":"6aaa1066-340d-4cc3-9fdd-a6052b819ec2","resolution":{"observed_at":"2026-05-21T14:10:13.580164Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01840","last_updated":"2025-04-23T07:08:17Z","snapshot_observed_at":"2026-08-13T11:30:48.832931Z","submitted_at":"2025-03-03T18:59:04Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","version":3},"cited_work":{"arxiv_id":"2503.01840","doi":"10.48550/arxiv.2503.01840","metadata_source":"pith","pith_arxiv_id":"2503.01840","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","venue":"cs.CL","work_id":"323c1b68-aec5-4444-944f-155a771bd8c6","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2503.01840","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:94dfe7d45e046fd7b7ea3444954c8a8cc7665d51324574a8cae75d04c2945bcd","observation_id":"5b05f9b4-3f8a-4611-bd4c-4c92da5f2043","resolution":{"observed_at":"2026-05-21T14:10:13.467310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.16403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards a theoretical understanding to the generalization of rlhf","venue":null,"work_id":"2c1afac2-a7ce-416c-b5e9-9f3a3a3bb4f2","year":null},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:6bdf4eeb13ae7c8f6bb079584db6fef89c9e448c8580a491a2d19dc1d0a9d87d","observation_id":"3e1d58b8-e6ce-4fcb-bdc9-a3c5ca538821","resolution":{"observed_at":"2026-05-21T14:10:13.522043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-08-12T08:24:59.243273Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:96348a3f4f009763bf7b3e1d66bda99ca83a545b615668af5565f92947a8dcfc","observation_id":"f0c8d3af-fff1-4936-9936-13fb9537a5c6","resolution":{"observed_at":"2026-05-21T14:10:13.433825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":"2112.09332","doi":"10.48550/arxiv.2112.09332","metadata_source":"pith","pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebGPT: Browser-assisted question-answering with human feedback","venue":"cs.CL","work_id":"e25ef3e1-4848-4cb9-bf28-67a420591165","year":2021},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:e2a52895feaa3d64e5db7543f25bd82d72005afb41ea38285be2b702f66bd562","observation_id":"fc4de321-91a3-40a4-b09d-f67609b6292e","resolution":{"observed_at":"2026-05-21T14:10:13.464048Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":"2502.09992","doi":"10.48550/arxiv.2502.09992","metadata_source":"pith","pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Diffusion Models","venue":"cs.CL","work_id":"cce0f4b3-ed4d-4375-b84d-3f01316016c1","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:a13a4f008b07d74a934d5ed85a3d4e60e61bd3bcdd7e1c6a28942c46007e735a","observation_id":"afe8b470-0139-40f1-8199-7a358ef12e1d","resolution":{"observed_at":"2026-05-21T14:10:13.566324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":"2305.18290","doi":"10.48550/arxiv.2305.18290","metadata_source":"pith","pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","venue":"cs.LG","work_id":"62105b61-411f-46e5-970a-bd322c6adbbc","year":2023},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:c6d4a6824e8f083be2f6c1b224b901e958eb5bda4fecd538007edbd37b3f384b","observation_id":"c8c0a958-b130-4195-8d7c-afeb86cbdf46","resolution":{"observed_at":"2026-05-21T14:10:13.443897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.462363+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.462363+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:72ebf238fc740381fa16878983b575b765f58480281f3c548a62f7010e11cb02","observation_id":"bd461575-c5ef-4c14-b844-3b19f37026e0","resolution":{"observed_at":"2026-05-21T14:10:13.488106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T04:19:34.001123Z","title":"Can large reasoning models self-train?","venue":null,"work_id":"676b6b60-dcea-400f-9a21-469309587fd2","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:66ab2876404caffa549022b8ab616d108a3eac5d775234b7255a7d6ca108fcdd","observation_id":"b24ce457-a6d1-4ff7-8ec1-c86db7239192","resolution":{"observed_at":"2026-05-21T14:10:13.561469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:d0692d0e5acbae5575bfa7b582e7ddd3a71eabb48341030f42225a3f70843d25","observation_id":"56619bfe-1c99-44fa-8045-5d20715d702d","resolution":{"observed_at":"2026-05-21T14:10:13.516942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:84798d74a6bbce02d5b874e062cce0f3a88590a8a33ac923844b8df098e25aa2","observation_id":"f9f81cf2-6ed0-41d9-bb4c-9a639d9be577","resolution":{"observed_at":"2026-05-21T14:10:13.569876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06848","last_updated":"2025-07-18T17:52:45Z","snapshot_observed_at":"2026-08-12T10:32:17.333056Z","submitted_at":"2025-01-12T15:34:24Z","title":"A General Framework for Inference-time Scaling and Steering of Diffusion Models","version":5},"cited_work":{"arxiv_id":"2501.06848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06848","snapshot_observed_at":"2026-07-04T13:09:50.123415Z","title":"A general framework for inference-time scaling and steering of diffusion models","venue":null,"work_id":"9ff11c8a-d659-4c6c-9262-d48f515ace17","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2501.06848","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:64ddc5e485c6f5b7cc7ebcfa4e8877de0f2e28c45d937325049e4dd09e3d0138","observation_id":"d3b769b0-f82e-4df6-ad2b-bd496be1b478","resolution":{"observed_at":"2026-05-21T14:10:13.499261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03095","last_updated":"2025-02-05T11:41:43Z","snapshot_observed_at":"2026-08-10T20:00:39.129261Z","submitted_at":"2025-02-05T11:41:43Z","title":"Reveal the Mystery of DPO: The Connection between DPO and RL Algorithms","version":1},"cited_work":{"arxiv_id":"2502.03095","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03095","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reveal the mystery of dpo: The connection between dpo and rl algorithms","venue":null,"work_id":"16d4f451-c454-4362-8297-0dc5d0185b34","year":null},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2502.03095","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:9b9ee02b88345d089801704f87f12e4b409971319dc1d17192243d7a15e8b71a","observation_id":"9e3224b3-69c0-4c35-b52f-3aa3bb9f6bac","resolution":{"observed_at":"2026-05-21T14:10:13.548018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:8c037f2c6e783fe8d6ab6a688acfb3b984ed6a38209b1010b3bb4e5bfa12eeaa","observation_id":"2f636823-3802-4b33-bad4-320f77a7a7d2","resolution":{"observed_at":"2026-05-21T14:10:13.506735Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15194","last_updated":"2024-02-28T09:21:46Z","snapshot_observed_at":"2026-08-13T04:12:17.261671Z","submitted_at":"2024-02-23T08:54:42Z","title":"Fine-Tuning of Continuous-Time Diffusion Models as Entropy-Regularized Control","version":2},"cited_work":{"arxiv_id":"2402.15194","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15194","snapshot_observed_at":"2026-07-08T06:14:38.555744Z","title":"Fine- tuning of continuous-time diffusion models as entropy-regularized control","venue":"cs.LG","work_id":"cab1ecfb-d2c4-4240-8a75-c53b3659f86f","year":2024},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2402.15194","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:13b6653066d90de3aecba47fc02b012ee193b8ec145bc5c5f1bec7fb31907825","observation_id":"6173065f-af2e-4d9c-9c8f-e4c4a21d425b","resolution":{"observed_at":"2026-05-21T14:10:13.556700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:47c2fc1f7fce0dd160344ec91e5d4532a51a9773bc527012a7a519493db5ac15","observation_id":"ea60f26c-e0a8-4a16-8ee2-505577de2822","resolution":{"observed_at":"2026-05-21T14:10:13.427068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":"22a66094-504f-406a-8d06-e27338b1c868","year":2020},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:6354536ee7d56ce61b09e525a9a1d073224453922548c4d8ef175bbebfaffd64","observation_id":"a977a383-cd55-4062-b03f-c10eebb8a2c8","resolution":{"observed_at":"2026-05-21T14:10:13.936639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22618","last_updated":"2025-07-03T04:51:05Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:39:15Z","title":"Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding","version":3},"cited_work":{"arxiv_id":"2505.22618","doi":"10.48550/arxiv.2505.22618","metadata_source":"pith","pith_arxiv_id":"2505.22618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding","venue":"cs.CL","work_id":"9f6c2a70-9830-48ae-b181-6b5b1cbfae97","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2505.22618","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:6dda1c675d639042c09190d9c07eb9a4c4e8228245f1b2f5a19e644443edcca2","observation_id":"976f0292-ec29-485f-8f4c-9e73d25be15e","resolution":{"observed_at":"2026-05-21T14:10:13.430330Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T17:53:19.96554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T17:53:19.96554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:1e8be6aa4e83bad5b79260a0f16dae1c83f34fd0024c72b341d7edc2e2b20e44","observation_id":"5cefdcf1-46e6-4933-96f5-79e65ee335e7","resolution":{"observed_at":"2026-05-21T14:10:13.453187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-08-11T13:17:40.816545Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":"2503.24235","doi":"10.48550/arxiv.2503.24235","metadata_source":"pith","pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","venue":"cs.CL","work_id":"d4eaadf8-a3c6-4eee-98fb-1b337dd42e2d","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:b98fad0f2594782fc3e5ed21303120f25d9509114798fc1a2479ba5698778bc1","observation_id":"6d2fbad8-8e70-43d4-b9e2-5c2df885c689","resolution":{"observed_at":"2026-05-21T14:10:13.491193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19223","last_updated":"2025-10-12T15:42:47Z","snapshot_observed_at":"2026-08-09T15:57:47.133628Z","submitted_at":"2025-05-25T16:36:20Z","title":"LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models","version":2},"cited_work":{"arxiv_id":"2505.19223","doi":"10.48550/arxiv.2505.19223","metadata_source":"pith","pith_arxiv_id":"2505.19223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models","venue":"cs.LG","work_id":"ebe72b3e-b18c-4784-8c3d-d7bfda67e098","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2505.19223","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:d93dc8d398f7206cfc9f6a45bcb1cc7e24902436030746ecb3c562d3286ce9ed","observation_id":"70a2a09d-4379-4f5a-ae18-7e03d495d561","resolution":{"observed_at":"2026-05-21T14:10:13.511937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1 M MX m=1 E(y,x ti−1 (m)) +ϵ C−ϵ−h(ϵ, M, λ, D) f(x ti−1 (m)) # +E q(xti−1 |y,xti )[1Ac ti f(x ti−1 )] ≤ C C−ϵ−h(ϵ, M, λ, D) Exti−1","venue":null,"work_id":"5443d426-03f1-4810-8ce6-466aff95117c","year":2016},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:c1b38bafefc5c536e2533571953fb6e0de61849a17038a9a508438ca9f0c8572","observation_id":"ae350ee7-47dc-4ae1-abca-813d6df0cf58","resolution":{"observed_at":"2026-05-21T14:10:13.931796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The number of tokens generated overIsteps is Ntokens = IX i=1 M(B+K(d x −iB)) =M d x +IM Kd x − 1 2 (I+ 1)M Kd x =M 1 + I−1 2 K dx","venue":null,"work_id":"bdd04199-04e0-40ed-b82f-1ec3b0eb9ce2","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:064d483d95d8d8df0130610f0647b2c7c5645a42a95dd4dccc396e20ebd740d7","observation_id":"15d562f2-aab2-48b4-90da-e969ef298187","resolution":{"observed_at":"2026-05-21T14:10:13.929579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Best-of-N is naturally integrated into our ETS framework as a special case, with detailed hyperparameters provided in Appendix C.2","venue":null,"work_id":"6094c496-bd9d-4461-9692-9141cffa8c16","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:af3d40f205f4be1cfa2537edfc32d5bc86956b0ad6427acfb15185491f8ab2b4","observation_id":"dd9e1dd6-e54d-4660-afb1-4445cf78e362","resolution":{"observed_at":"2026-05-21T14:10:13.934233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For DLMs, we implement beam search ourselves; however, due to their iterative generation nature, DLMs cannot be accelerated via batching in the same way as ARMs","venue":null,"work_id":"a25b8202-fcdf-4721-91b6-b6fb415fc01c","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:cb695dddc7a03c3a93cb9438a8f0e949be37dd66d3e7762744080d04b2c82618","observation_id":"af774b80-8076-4032-9792-75d4d8ccc42d","resolution":{"observed_at":"2026-05-21T14:10:13.939017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We ablate the temperature on Qwen3-8B and plot GPQA accuracies (left) with corresponding latencies (right)","venue":null,"work_id":"80842519-6864-4ff1-a826-871c5c9e2eed","year":2024},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:c9bacbecf340d7a7bbb2ca202d2a2a41cd550d41b2b8480eaf139e90f28ae933","observation_id":"dcadba1b-9e35-4970-84a1-d11a96d7bd56","resolution":{"observed_at":"2026-05-21T14:10:13.941243Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9867.0767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Based on this efficiency trade-off, we fix dx = 512for all main experiments on ARMs","venue":null,"work_id":"fc09d6a4-b416-4fa7-9fa5-1255dd02b895","year":null},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:b84dd6d3bb4ff6d325b69719e88062f0f6b0dc5e259db32670d7937091f19076","observation_id":"34c34621-212a-45da-b0e8-f1d034f42558","resolution":{"observed_at":"2026-05-21T14:10:13.440830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T22:57:43.474898Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":33,"verified_fuzzy":6},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 2 inbound Pith citation observations for arXiv:2601.21484."}