{"as_of":"2026-08-09T05:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a4b5290b3f16530a4eecc97b297c261ce90d9df54c0420eaac431b176051a18b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:17:46.033521Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T09:47:59.922599Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T16:18:01.560780Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2410.18451"},"observation_digest":"sha256:0620a63312ff9b31cad8618e4407fa99d9290bbb7898c5ce4959906ef54fb00b","observation_id":"751ebca6-97a9-4d89-845a-c0bddda875f0","resolution":{"observed_at":"2026-05-17T16:18:01.688186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2412.21139","last_updated":"2025-06-06T07:53:20Z","snapshot_observed_at":"2026-07-06T20:14:49.976782Z","submitted_at":"2024-12-30T18:15:39Z","title":"Training Software Engineering Agents and Verifiers with SWE-Gym","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T05:20:40.483057Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2412.21139"},"observation_digest":"sha256:2ab986bff7ce2f8d7976e48ecdbe93748083d61749f941b95683bc8f35035ce0","observation_id":"fe2c7e9f-6eeb-4093-b116-adbf38238b95","resolution":{"observed_at":"2026-05-18T05:20:40.532699Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"reference_index":249,"source":"arxiv_source","source_observed_at":"2026-05-13T17:30:02.803757Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2502.02737"},"observation_digest":"sha256:8e8665b23dd22004f96ec49e52f04a033ae9f1473a56f97c6e3c97ef2c96be3a","observation_id":"bbb07ed4-5c56-43c8-9149-8d4d764f1977","resolution":{"observed_at":"2026-05-13T17:30:03.070601Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-08T12:17:46.033521Z","title":"Advancing llm reasoning generalists with preference trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07599","last_updated":"2025-06-06T11:18:28Z","snapshot_observed_at":"2026-08-09T02:47:59.381934Z","submitted_at":"2025-02-11T14:49:44Z","title":"DPO-Shift: Shifting the Distribution of Direct Preference Optimization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T12:17:46.033521Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2502.07599"},"observation_digest":"sha256:2f2be06dc0fa6eab081dd5ee3db823ab6721c865eaf3c7696a5ff4dbe24d0ec1","observation_id":"1403d4b0-07a5-4db9-9c9d-63e497ddc699","resolution":{"observed_at":"2026-08-08T12:17:46.033521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-08T04:54:50.972531Z","title":"Advancing llm reasoning generalists with preference trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.972531Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:28cd3f2daf1de5a02923f1c245711461e25e3f2c3c030a3b21785000eaad3a72","observation_id":"165f613f-8b50-463b-87c7-d8edfa19b879","resolution":{"observed_at":"2026-08-08T04:54:50.972531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T09:43:00.208065Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2503.21776"},"observation_digest":"sha256:2fd3f9fbb419da115bba7242af66c3e1a67ef0122a904ed230dcdf1a3d0543de","observation_id":"97156b06-e60e-412f-bc12-c2c7951d7809","resolution":{"observed_at":"2026-05-12T09:43:00.303113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-07T14:29:33.431718Z","title":"Advancing llm reasoning generalists with preference trees.arXiv preprint arXiv:2404.02078, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.431718Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:5c598761ef2e0d423118c35846c9b78e1d0d0f14d8b1f60ce3055e36753966fc","observation_id":"5bab72b9-5519-4cfb-8f12-b78c64860908","resolution":{"observed_at":"2026-08-07T14:29:33.431718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-06T15:40:17.967384Z","title":"Advancing llm reasoning generalists with preference trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-08T08:50:14.371298Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.967384Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:ee0137cb4f4c0c561bba9c852a8d60cef9d202238cdbe2f47b8bf8a43e2ed7a5","observation_id":"a0780e28-bddc-4838-9500-e3b1140c06a7","resolution":{"observed_at":"2026-08-06T15:40:17.967384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-05T20:30:30.162000Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.162000Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:6f7faa1bee3617b1b0a531d7b7e52bb3abff7f638bc3d046753719542c5e6597","observation_id":"7053f5d5-dea0-40bc-9503-8717edc46fbd","resolution":{"observed_at":"2026-08-05T20:30:30.162000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-04T23:10:21.344039Z","title":"Advancing llm reasoning generalists with preference trees,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06795","last_updated":"2025-09-08T15:24:33Z","snapshot_observed_at":"2026-08-06T11:18:33.345942Z","submitted_at":"2025-09-08T15:24:33Z","title":"Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T23:10:21.344039Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2509.06795"},"observation_digest":"sha256:ce1eb88b57618611a61414cbb7e00f7cd192da0876cc3787333d1aeb285ead0d","observation_id":"de9fd7fd-02f4-48a6-90e0-a0ae86389acd","resolution":{"observed_at":"2026-08-04T23:10:21.344039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-04T23:09:41.578345Z","title":"Advancing llm reasoning generalists with preference trees,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.578345Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:a5b18d0363c0275bbd2661e410f7f4ad16b6922c5419a19b7761f562b1d6703a","observation_id":"66f4bc15-23dc-4d73-aba2-5d4f2540df54","resolution":{"observed_at":"2026-08-04T23:09:41.578345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2510.24235","last_updated":"2026-04-20T06:29:42Z","snapshot_observed_at":"2026-08-03T23:17:37.743021Z","submitted_at":"2025-10-28T09:43:47Z","title":"PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T03:15:57.744706Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2510.24235"},"observation_digest":"sha256:2a4e73c88e0d0f06b7f9d5acef6c9744f0a9a3eaffe976f2e48b5a7ca5ab3570","observation_id":"b03affbf-8748-48a8-b01b-0021ec3c3e58","resolution":{"observed_at":"2026-05-18T03:20:49.262191Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2604.12312","last_updated":"2026-04-14T05:42:41Z","snapshot_observed_at":"2026-08-02T05:56:57.097541Z","submitted_at":"2026-04-14T05:42:41Z","title":"CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T14:56:00.449776Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2604.12312"},"observation_digest":"sha256:3a86ff61caa1172c0fa40fbb7ffb83b63a6a4ae827a1680b8b36802a362a77f2","observation_id":"c93977e0-94bb-4c22-9f53-e65977d49b3d","resolution":{"observed_at":"2026-05-11T11:26:02.393606Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2605.10195","last_updated":"2026-05-14T07:42:56Z","snapshot_observed_at":"2026-08-03T09:42:12.047946Z","submitted_at":"2026-05-11T08:45:17Z","title":"Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T03:51:52.375703Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2605.10195"},"observation_digest":"sha256:c6b05f7af7eed243c1b6068ddf26b9c7a9b807e7737745915dd735da0bcf788e","observation_id":"af10dbf6-ac5e-4141-b505-c0e394271f2b","resolution":{"observed_at":"2026-05-12T06:51:30.256032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2605.10195","last_updated":"2026-05-14T07:42:56Z","snapshot_observed_at":"2026-08-03T09:42:12.047946Z","submitted_at":"2026-05-11T08:45:17Z","title":"Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T05:11:32.053440Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2605.10195"},"observation_digest":"sha256:bc81be104628a5e6121dc7b9d8d7034cbc8e4425c926c9cb89ed2068fe83247f","observation_id":"afbbf399-40d4-47e1-8cc6-6f4a444e99ce","resolution":{"observed_at":"2026-05-15T05:15:03.285300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-13T06:08:28.855671Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:2f760311d037b8ad7a4aa889da26f27244f3425d2388cc6a404cf86666347950","observation_id":"c197a95d-51d7-4132-993a-48c8947a0adb","resolution":{"observed_at":"2026-05-13T06:12:22.771833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-22T10:00:58.600743Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:5c0d6553e7f4a3464e34dabb3d83ed700f6f3d03d7da9a1cc8326516a0fb23ce","observation_id":"cdafa392-70f2-41ba-b055-d46aef9d1d2e","resolution":{"observed_at":"2026-05-22T10:01:23.055182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2606.05434","last_updated":"2026-06-03T20:57:57Z","snapshot_observed_at":"2026-07-06T23:45:28.379468Z","submitted_at":"2026-06-03T20:57:57Z","title":"Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T06:56:01.601701Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2606.05434"},"observation_digest":"sha256:a496eb4e545b99cf5ad65313a3953922d3261b3a34ddc7aa9dbf89644637fcbe","observation_id":"0d72bc2b-36a2-4861-a354-1bc2b1e43cf5","resolution":{"observed_at":"2026-07-02T07:26:46.066822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2606.10528","last_updated":"2026-06-09T07:57:50Z","snapshot_observed_at":"2026-07-06T23:49:41.940954Z","submitted_at":"2026-06-09T07:57:50Z","title":"Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T13:39:17.701196Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2606.10528"},"observation_digest":"sha256:95357319a7d45f7050d196ed3bda5d215102229ef305e117aeb8ce12da5166c8","observation_id":"0a1dc478-abb7-42a0-b754-eaed8449afc6","resolution":{"observed_at":"2026-07-03T04:47:38.255909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2606.11634","last_updated":"2026-06-10T03:56:03Z","snapshot_observed_at":"2026-08-02T13:37:43.737297Z","submitted_at":"2026-06-10T03:56:03Z","title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-27T10:18:54.163862Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2606.11634"},"observation_digest":"sha256:c6c28b604ed4bfa2f70daf431cc1da1212015adcd1566524e2e5b917c984f68c","observation_id":"35613fd2-39ca-4567-9df6-1dd09537c8c0","resolution":{"observed_at":"2026-07-03T09:47:59.923933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:3df6b751ab6d3c92b6b00ad90b1408ea8fe7c4188c5317cdfb27af11871c4de5","observation_id":"cf321595-60bd-4b5a-a8f3-66f03fa2802c","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-02T08:40:39.023948Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:39.023948Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:22fc84c796c3ca8f612fff945f15d12c6f3302a8406723b11cc9dd347e051f60","observation_id":"350e3b83-e95c-497e-96fa-f4c9f3db9a24","resolution":{"observed_at":"2026-08-02T08:40:39.023948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.02078/citation-record","integrity":"/paper/2404.02078/integrity","json":"/paper/2404.02078/citation-record.json","paper":"/paper/2404.02078"},"outbound":[],"paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2404.02078."}