{"as_of":"2026-08-08T18:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6e0bebd080a19e53d2c54817f275a243eb18ca8b58ee4961dcf1ecb6aa3423bc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:01:49.664298Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T06:06:41.070540Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02391","last_updated":"2025-05-05T06:26:00Z","snapshot_observed_at":"2026-08-07T15:56:29.149996Z","submitted_at":"2025-05-05T06:26:00Z","title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02391","snapshot_observed_at":"2026-08-07T06:01:49.664298Z","title":"Optimizing chain-of-thought reasoners via gradient variance minimization in rejection sampling and rl.arXiv preprint arXiv:2505.02391, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06470","last_updated":"2025-06-06T18:55:16Z","snapshot_observed_at":"2026-08-07T05:53:54.045201Z","submitted_at":"2025-06-06T18:55:16Z","title":"SIGMA: Refining Large Language Model Reasoning via Sibling-Guided Monte Carlo Augmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:49.664298Z"},"links":{"cited_paper":"/paper/2505.02391","citing_paper":"/paper/2506.06470"},"observation_digest":"sha256:aafd96a50f14291e45ded5a698aa12f6cf12ae98bd988492b10ae1ded7c74779","observation_id":"bccae710-a182-47cd-93e1-f582b97def4c","resolution":{"observed_at":"2026-08-07T06:01:49.664298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02391","last_updated":"2025-05-05T06:26:00Z","snapshot_observed_at":"2026-08-07T15:56:29.149996Z","submitted_at":"2025-05-05T06:26:00Z","title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02391","snapshot_observed_at":"2026-08-03T19:38:23.430181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T19:38:23.430181Z"},"links":{"cited_paper":"/paper/2505.02391","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:0c9e2660ad4bd978adb7ca68d0a115c7109e9345434e847f788e9ae8cee91aab","observation_id":"41bb5f15-b3ab-47ba-9182-7d978c723933","resolution":{"observed_at":"2026-08-03T19:38:23.430181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02391","last_updated":"2025-05-05T06:26:00Z","snapshot_observed_at":"2026-08-07T15:56:29.149996Z","submitted_at":"2025-05-05T06:26:00Z","title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02391","snapshot_observed_at":"2026-08-04T06:47:16.900557Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.900557Z"},"links":{"cited_paper":"/paper/2505.02391","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:9a2e4c6c32159896f5186cd05a5f302bb7943339c3644afd0a3328f18dc3eed7","observation_id":"f0549afe-c503-48f6-b347-d34c7c8c723c","resolution":{"observed_at":"2026-08-04T06:47:16.900557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02391","last_updated":"2025-05-05T06:26:00Z","snapshot_observed_at":"2026-08-07T15:56:29.149996Z","submitted_at":"2025-05-05T06:26:00Z","title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02391","snapshot_observed_at":"2026-08-03T02:43:38.039514Z","title":"Optimizing chain-of-thought reasoners via gradient variance minimization in rejection sampling and rl.arXiv preprint arXiv:2505.02391, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10014","last_updated":"2026-05-31T19:13:22Z","snapshot_observed_at":"2026-08-06T02:34:35.293978Z","submitted_at":"2026-02-10T17:36:41Z","title":"A Task-Centric Theory for Iterative Self-Improvement with Easy-to-Hard Curricula","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T02:43:38.039514Z"},"links":{"cited_paper":"/paper/2505.02391","citing_paper":"/paper/2602.10014"},"observation_digest":"sha256:458deaf4260d4f58393ba125d7a68f023560155863c0b4a2cba4e31673e68981","observation_id":"c27f7bb9-1692-4506-9202-d39226132c92","resolution":{"observed_at":"2026-08-03T02:43:38.039514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02391","last_updated":"2025-05-05T06:26:00Z","snapshot_observed_at":"2026-08-07T15:56:29.149996Z","submitted_at":"2025-05-05T06:26:00Z","title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL","version":1},"cited_work":{"arxiv_id":"2505.02391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02391","snapshot_observed_at":"2026-07-02T06:06:41.070540Z","title":"Optimizing chain-of-thought reasoners via gradient variance minimization in rejection sampling and rl","venue":null,"work_id":"00ef4163-b75b-4860-b700-2a5b76c16e8c","year":2025},"citing_paper":{"arxiv_id":"2602.12579","last_updated":"2026-05-22T13:13:23Z","snapshot_observed_at":"2026-07-06T22:45:44.135338Z","submitted_at":"2026-02-13T03:40:52Z","title":"VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T07:26:35.767179Z"},"links":{"cited_paper":"/paper/2505.02391","citing_paper":"/paper/2602.12579"},"observation_digest":"sha256:d9c3ccdf112b5a6c0db4c4f03bd943b8156b5ad4028d304abee01c7367932e67","observation_id":"5063b41d-8853-4fbb-88d2-cb6914f75e65","resolution":{"observed_at":"2026-05-25T07:26:41.631562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02391","last_updated":"2025-05-05T06:26:00Z","snapshot_observed_at":"2026-08-07T15:56:29.149996Z","submitted_at":"2025-05-05T06:26:00Z","title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL","version":1},"cited_work":{"arxiv_id":"2505.02391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02391","snapshot_observed_at":"2026-07-02T06:06:41.070540Z","title":"Optimizing chain-of-thought reasoners via gradient variance minimization in rejection sampling and rl","venue":null,"work_id":"00ef4163-b75b-4860-b700-2a5b76c16e8c","year":2025},"citing_paper":{"arxiv_id":"2604.10827","last_updated":"2026-04-12T21:49:13Z","snapshot_observed_at":"2026-08-05T18:01:30.449144Z","submitted_at":"2026-04-12T21:49:13Z","title":"Your Model Diversity, Not Method, Determines Reasoning Strategy","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-10T15:16:30.448400Z"},"links":{"cited_paper":"/paper/2505.02391","citing_paper":"/paper/2604.10827"},"observation_digest":"sha256:8ed8c61848b2c0265a149525640f8fc7376612769e844451c390dcd5c6233d3e","observation_id":"3e1a0d99-f6cc-429c-96a5-c48079f6e7c8","resolution":{"observed_at":"2026-05-11T10:56:02.867497Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02391","last_updated":"2025-05-05T06:26:00Z","snapshot_observed_at":"2026-08-07T15:56:29.149996Z","submitted_at":"2025-05-05T06:26:00Z","title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL","version":1},"cited_work":{"arxiv_id":"2505.02391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02391","snapshot_observed_at":"2026-07-02T06:06:41.070540Z","title":"Optimizing chain-of-thought reasoners via gradient variance minimization in rejection sampling and rl","venue":null,"work_id":"00ef4163-b75b-4860-b700-2a5b76c16e8c","year":2025},"citing_paper":{"arxiv_id":"2605.07331","last_updated":"2026-05-08T06:35:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T06:35:02Z","title":"Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-11T01:19:58.448344Z"},"links":{"cited_paper":"/paper/2505.02391","citing_paper":"/paper/2605.07331"},"observation_digest":"sha256:2420032e7c7522034c3ca4eb95a5ea7a8709bf440ba5ef902099bc1681751811","observation_id":"9f7167e3-4397-4ab1-b6f7-9864df108db4","resolution":{"observed_at":"2026-05-11T04:30:55.487341Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02391","last_updated":"2025-05-05T06:26:00Z","snapshot_observed_at":"2026-08-07T15:56:29.149996Z","submitted_at":"2025-05-05T06:26:00Z","title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL","version":1},"cited_work":{"arxiv_id":"2505.02391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02391","snapshot_observed_at":"2026-07-02T06:06:41.070540Z","title":"Optimizing chain-of-thought reasoners via gradient variance minimization in rejection sampling and rl","venue":null,"work_id":"00ef4163-b75b-4860-b700-2a5b76c16e8c","year":2025},"citing_paper":{"arxiv_id":"2606.04560","last_updated":"2026-06-04T06:53:10Z","snapshot_observed_at":"2026-08-08T02:18:13.870572Z","submitted_at":"2026-06-03T07:47:47Z","title":"Rollout-Level Advantage-Prioritized Experience Replay for GRPO","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-28T07:43:21.284574Z"},"links":{"cited_paper":"/paper/2505.02391","citing_paper":"/paper/2606.04560"},"observation_digest":"sha256:eb8c9b55f98fdad58c58eb5e178573645f48b773c446b141f8e974bbf8fdcc71","observation_id":"b6111562-bf36-46ae-bf57-8811dabd805c","resolution":{"observed_at":"2026-07-02T06:06:41.072433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02391","last_updated":"2025-05-05T06:26:00Z","snapshot_observed_at":"2026-08-07T15:56:29.149996Z","submitted_at":"2025-05-05T06:26:00Z","title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02391","snapshot_observed_at":"2026-08-05T00:22:11.865683Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00782","last_updated":"2026-08-01T17:29:14Z","snapshot_observed_at":"2026-08-07T03:55:00.582409Z","submitted_at":"2026-08-01T17:29:14Z","title":"Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T00:22:11.865683Z"},"links":{"cited_paper":"/paper/2505.02391","citing_paper":"/paper/2608.00782"},"observation_digest":"sha256:4d1bdeca1dc5f939b9b8eeaaeb4b82ac2a192361f3c8f82d6cbb6f3e5843b0f6","observation_id":"514e9eb2-f1de-49df-ad60-8c9559b9b20c","resolution":{"observed_at":"2026-08-05T00:22:11.865683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02391/citation-record","integrity":"/paper/2505.02391/integrity","json":"/paper/2505.02391/citation-record.json","paper":"/paper/2505.02391"},"outbound":[],"paper":{"arxiv_id":"2505.02391","last_updated":"2025-05-05T06:26:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T15:56:29.149996Z","submitted_at":"2025-05-05T06:26:00Z","title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2505.02391."}