{"as_of":"2026-08-23T16:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83fd4ce5ff7bde21f049a71a8992f10950afb2a95280eedee1b0e5f956e2335a","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T23:25:30.618655Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:48:16.678850Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30859","snapshot_observed_at":"2026-08-01T06:48:16.678850Z","title":"arXiv preprint arXiv:2605.30859 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:16.678850Z"},"links":{"cited_paper":"/paper/2605.30859","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:9093a7e122582e4572d699f463e890e5008e8a14481f36ed43d57266a1ae5f67","observation_id":"730dca30-1ac0-4e30-ae2b-17eb3ba55269","resolution":{"observed_at":"2026-08-01T06:48:16.678850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.30859/citation-record","integrity":"/paper/2605.30859/integrity","json":"/paper/2605.30859/citation-record.json","paper":"/paper/2605.30859"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:eca01697832c78e28614bde95e6b833e3d3d312d3920af6a40e7723d3d016a9a","observation_id":"fa931942-a04f-4c4d-b214-8fc82ba12925","resolution":{"observed_at":"2026-06-28T23:42:50.088583Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:af33db4a4e0bcb7183b1ca337402a84182cc141bd5ea7cb0175522ad2e8260f3","observation_id":"8226b003-ce25-4d5a-acca-88de5bf100e2","resolution":{"observed_at":"2026-06-28T23:42:50.083973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-13T08:22:12.599337Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:3b3e5bc611a18b6184f811ceddc19bf80e3156cc9ab90d30fe216204dc329e90","observation_id":"5e9395cb-3585-40f2-b4a6-27a8ef09b296","resolution":{"observed_at":"2026-06-28T23:42:50.076818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:365a9cdce8896af08f5e8f525226da366047625baada9404a6103f7929257074","observation_id":"fed96b4c-3f39-42f9-a99e-59ac890accd3","resolution":{"observed_at":"2026-06-28T23:42:50.078985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:25:30.618655Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:eeb76cd3411c2f52caaf583b33c1138b3ec691fc020c1f39062d60371f8fd508","observation_id":"03eaa09e-d3c0-47ac-a641-c5585ce9c440","resolution":{"observed_at":"2026-06-28T23:25:30.618655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11345","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T08:56:06.417978Z","title":"Part ii: Roll flash–accelerating rlvr and agentic training with asynchrony","venue":null,"work_id":"810c144e-2d15-4352-a654-0f8af536eb98","year":2025},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:8a644299c79c73975ed3933519320758b90e9acb0fba1a1d1c7941e5df04fc7a","observation_id":"727266ea-1d75-4775-b660-44b8b1e5b9ac","resolution":{"observed_at":"2026-06-28T23:42:50.081473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:473206b4587fdad11040085cc1a6b824741bdb1364f957f176fa8ebd2ee9bb68","observation_id":"60dff0bd-e376-47ee-b820-35dbb75640bd","resolution":{"observed_at":"2026-06-28T23:42:50.086265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:f673ba36d56917e2a3c754200ac701888e02d406c1ce70f3f59b66c12d3f5614","observation_id":"d654de1b-55a5-4e19-93be-47b8172e5883","resolution":{"observed_at":"2026-06-28T23:42:50.090793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-08-16T14:37:33.548231Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:1165d94b5ba58dc827ed388f2ffc9ffd9ba69bee32bab8aa5c59abfdbd8cfa22","observation_id":"8efc664a-946f-4c94-aa80-9ce234bc3154","resolution":{"observed_at":"2026-06-28T23:42:50.093065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-20T14:18:10.920944Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:7e312a5abe9cf5ab636f2c7e71db99fe25563d2ef83e8f9df415128235d3a6db","observation_id":"c2ea108f-23fc-4e1a-9d94-96e3e760afc8","resolution":{"observed_at":"2026-06-28T23:42:50.096061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:9397c89ba7e2a0faa0755391ebf7f57155d4fcaa4028ab5f56ce40a50980220a","observation_id":"907a62d6-9a38-4266-9f58-e8fbc157a8d2","resolution":{"observed_at":"2026-06-28T23:42:50.098836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15930","last_updated":"2025-04-22T14:19:06Z","snapshot_observed_at":"2026-08-20T01:49:19.844891Z","submitted_at":"2025-04-22T14:19:06Z","title":"StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation","version":1},"cited_work":{"arxiv_id":"2504.15930","doi":"10.48550/arxiv.2504.15930","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15930","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Streamrl: Scalable, heterogeneous, and elastic rl for llms with disaggregated stream generation","venue":"ArXiv.org","work_id":"63df3644-702d-4ae6-8e4a-954a41887545","year":2025},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"cited_paper":"/paper/2504.15930","citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:018563155734ab72c34ec936d20473e988b5253c45269cac2fcd0bc431de019f","observation_id":"313d458a-1224-4b4d-8c51-f82bee97f89a","resolution":{"observed_at":"2026-06-28T23:42:50.074123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:16.320291+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:16.320291+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s41019-023-00235-6","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DB-GPT: Large language model meets database","venue":"Data Science and Engineering","work_id":"e6c78630-ada3-4f2d-8ba1-80bcf2383161","year":2024},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:b63857803cb3a6d43d1ca590b8a228917d841b45a874503703f24c982d3d26a0","observation_id":"6a9e9a85-78f6-444e-a77b-19276ff35ef2","resolution":{"observed_at":"2026-06-28T23:32:46.860427Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-20T05:24:49.999388+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T05:24:49.999388+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:25:30.618655Z","title":"This trend confirms that our method effectively mitigates the verbose long-tail issue early on, greatly enhancing training efficiency","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:bb6417cdfb024a4a484e8dae684d91c58917368b1e33fbc2362b3e4b0e336541","observation_id":"fb1f1dd5-bc9c-4bbe-a916-ecc785a7e39b","resolution":{"observed_at":"2026-06-28T23:25:30.618655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":2,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 1 inbound Pith citation observation for arXiv:2605.30859."}