{"as_of":"2026-08-03T22:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6508f9251d371d6be5186b27ef1fc11fd80310a0ae1472bbe2fcbcb6b0c2fa03","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T05:29:46.136115Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T04:42:35.589143Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-21T08:39:53.190263Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"cited_work":{"arxiv_id":"2510.19225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.19225","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","venue":"cs.DC","work_id":"307defa2-eea6-4ad3-96bf-98aa7ec127c9","year":2025},"citing_paper":{"arxiv_id":"2511.14617","last_updated":"2026-04-03T12:47:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T16:12:21Z","title":"Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T20:38:30.169363Z"},"links":{"cited_paper":"/paper/2510.19225","citing_paper":"/paper/2511.14617"},"observation_digest":"sha256:6687111b3f7103f73d5ffa50a904922f07425d665295290db8e3d0c5682d6160","observation_id":"685d405b-63c7-447e-b362-7bcee6e66df9","resolution":{"observed_at":"2026-05-17T20:40:14.539973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"cited_work":{"arxiv_id":"2510.19225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.19225","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","venue":"cs.DC","work_id":"307defa2-eea6-4ad3-96bf-98aa7ec127c9","year":2025},"citing_paper":{"arxiv_id":"2604.09107","last_updated":"2026-04-10T08:40:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-10T08:40:56Z","title":"TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T17:16:33.020610Z"},"links":{"cited_paper":"/paper/2510.19225","citing_paper":"/paper/2604.09107"},"observation_digest":"sha256:4f377daef35f5cd9574dd956f5c5a14fd3734316f9a5689d690344f445dc169d","observation_id":"e495facd-1d90-4ca3-b2eb-153d151ebfb0","resolution":{"observed_at":"2026-05-11T07:11:00.493598Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"cited_work":{"arxiv_id":"2510.19225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.19225","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","venue":"cs.DC","work_id":"307defa2-eea6-4ad3-96bf-98aa7ec127c9","year":2025},"citing_paper":{"arxiv_id":"2604.23838","last_updated":"2026-04-26T18:45:31Z","snapshot_observed_at":"2026-08-02T18:30:10.398959Z","submitted_at":"2026-04-26T18:45:31Z","title":"JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-08T06:36:33.914193Z"},"links":{"cited_paper":"/paper/2510.19225","citing_paper":"/paper/2604.23838"},"observation_digest":"sha256:4ee7befae92e949ec7dd497b37f0f8af4f35de224638779dc6e61595c1946dee","observation_id":"8542cd7e-c8d7-4a3e-a071-7bc0d6cc42bd","resolution":{"observed_at":"2026-05-11T21:11:12.345905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"cited_work":{"arxiv_id":"2510.19225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.19225","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","venue":"cs.DC","work_id":"307defa2-eea6-4ad3-96bf-98aa7ec127c9","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-08T05:14:14.168753Z"},"links":{"cited_paper":"/paper/2510.19225","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:5576d1ccd322d7637610dfa215b4c8247379e120a85227b884918c6eca4fb7e3","observation_id":"c8484406-2043-4097-95c9-6fe822898a78","resolution":{"observed_at":"2026-05-11T21:31:16.421375Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"cited_work":{"arxiv_id":"2510.19225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.19225","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","venue":"cs.DC","work_id":"307defa2-eea6-4ad3-96bf-98aa7ec127c9","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-21T08:39:31.911497Z"},"links":{"cited_paper":"/paper/2510.19225","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:d3769fb3ff966e8787490c4c3b5a17f0bd7b8f86a20334ac8f3d13a571c48f11","observation_id":"07c4c85e-3489-4c37-935a-494b0781c983","resolution":{"observed_at":"2026-05-21T08:39:53.192515Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"cited_work":{"arxiv_id":"2510.19225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.19225","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","venue":"cs.DC","work_id":"307defa2-eea6-4ad3-96bf-98aa7ec127c9","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2510.19225","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:f7edaa747536540638d71b78febe26122d8aa5774a061a06f7e47fc61b85cd32","observation_id":"d4c13c69-fe25-43b0-a6fd-5dc55bdb2550","resolution":{"observed_at":"2026-05-20T20:13:43.876213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.19225","snapshot_observed_at":"2026-07-13T04:42:35.589143Z","title":"Morley Mao, Arvind Krishnamurthy, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09207","last_updated":"2026-07-10T08:51:14Z","snapshot_observed_at":"2026-07-30T04:22:48.479088Z","submitted_at":"2026-07-10T08:51:14Z","title":"Bidirectional Resource Scheduling for Disaggregated and Asynchronous RL Post-Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T04:42:35.589143Z"},"links":{"cited_paper":"/paper/2510.19225","citing_paper":"/paper/2607.09207"},"observation_digest":"sha256:980691bf9bae33ccea8a058cd40526cdddb277f4e236a973ae3df17d661a0540","observation_id":"183c033f-efc9-493c-823f-9bbb5602a690","resolution":{"observed_at":"2026-07-13T04:42:35.589143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.19225/citation-record","integrity":"/paper/2510.19225/integrity","json":"/paper/2510.19225/citation-record.json","paper":"/paper/2510.19225"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cluster Fragmentation","venue":null,"work_id":"079e4248-f6ee-4924-be97-04cab470a0f9","year":2022},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:0788e1cfa83eb9f6e2055b8022406175153877944252783a49db8dbfd9605ac0","observation_id":"423a33f6-2789-4326-be84-a546ded17f73","resolution":{"observed_at":"2026-05-18T05:30:55.626792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9462502a-a7f2-466b-a189-ec2eed752e96","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:b8fcb945091996355cdaa081b10a5b4e84601327de440d2d75895f791bf8885f","observation_id":"9b2136f5-9539-41a7-9e31-80a398fc4cad","resolution":{"observed_at":"2026-05-18T05:30:55.633811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 4","venue":null,"work_id":"85f905bf-1b52-4e0b-a6b0-7d4432bd414d","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:ca78a0b597565ad94f286be6cadede6b8591e823ad674732966402bca5953bf5","observation_id":"637e379d-e53f-4bf8-8fdc-6bca85b0a2ca","resolution":{"observed_at":"2026-05-18T05:30:55.629355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2e92a9ca-1156-4ab9-81a8-1c10402d5a58","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:143034944464e556428ffdee0e7f05bd28e4f73eff0715a1e8ca4685e419ddaa","observation_id":"257b253c-67d3-4610-a014-717b9b969836","resolution":{"observed_at":"2026-05-18T05:30:55.637432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a09c5484-c96e-4e71-9ed6-03922c08af82","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:8eaae47c095a852485a51213bceb0a2ad34cb5cc64da5c6e311423eca64a34cb","observation_id":"2862a915-f6ab-4eb0-b10b-e42620e58d06","resolution":{"observed_at":"2026-05-18T05:30:55.631593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Practical Tips for Preventing GPU Fragmentation for Vol- cano Scheduler","venue":null,"work_id":"1e4253a2-7947-421c-9178-b0acbc9bdc8b","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:cb5dc6317523a21c1dd08acb22092d3353884a7a2ae994406e3cb8b3732ef82d","observation_id":"beeee007-1f3f-48d9-9226-d8d0f6eab16b","resolution":{"observed_at":"2026-05-18T05:30:55.558122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"375972ee-18a8-4700-837b-4291f6c9bcc3","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:c27163138ad87a92b01edb451cd43fc7c460aa96e012572f76105c99356434ba","observation_id":"d15728de-fe14-4576-adfb-c93ebeaa9249","resolution":{"observed_at":"2026-05-18T05:30:55.620294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"16b1e0e5-99f2-424b-bb48-29464ed4a0f8","year":2024},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:9718e1476823438bf80f9b49e37b7b66694385180ee3c97601b4bd36bf86fd85","observation_id":"957d9065-9d6e-4180-a19b-7854122a416d","resolution":{"observed_at":"2026-05-18T05:30:55.576807Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"55dd57c2-19dd-4f6f-8e6e-d60b7fa9a227","year":2024},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:9bbff11e26828185025a3c9327a9434d5bf993aa7a79f12f6e464ac6e18cd828","observation_id":"cabd24e5-a541-4bde-931c-f58d2c6b22a0","resolution":{"observed_at":"2026-05-18T05:30:55.572700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-07-10T21:57:39.187585Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:94ecade5ade8f76433e4c57e1169f9c9650a9d0d0937827e2b8cdbb0089c4519","observation_id":"dfc8bfee-2973-4ef5-ac6b-aeaf4c5df871","resolution":{"observed_at":"2026-05-18T05:30:55.176765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1169693a-1ee8-4cb4-b552-114f68665087","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:7e12868200c0b9a933674d5d208d49219e171e2d889dee6bd5dd2fc222180017","observation_id":"5e520cff-7d53-4400-a449-c0b8a2d83ddf","resolution":{"observed_at":"2026-05-18T05:30:55.599094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:d79c6a9502b115e79aaa2c89824bd083f3393533560289355e36f482ab73d4d6","observation_id":"7e4fbd14-023c-41ec-9a28-d3da2d623370","resolution":{"observed_at":"2026-05-18T05:30:55.191637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d09ce9c1-e387-4bc2-b6c3-e31f41086364","year":null},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:8992478f12d5d0954627328ef1be6ac9f082ca6fb8f85f934787a93e77990844","observation_id":"3a4bdb6b-ba2c-4804-8fd1-867d0c83c711","resolution":{"observed_at":"2026-05-18T05:30:55.601198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-07-06T21:51:04.907326Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":null,"work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:3f5af3e0bd8078763c278f6687bc98b1d985f9cc17092ae0625b45ba9d462849","observation_id":"112883d0-6887-4de7-b4b7-899ef8ca68e7","resolution":{"observed_at":"2026-05-18T05:30:55.233504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8cdb2097-2493-49a3-82e9-d0c2de927aed","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:b1f8130ba3e0e15468d19a35f069679223bd30b5830ba8ae63ae1809ecb88e13","observation_id":"6544ee94-daf3-4f84-9648-d15bc9cec45e","resolution":{"observed_at":"2026-05-18T05:30:55.570552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18588","last_updated":"2025-08-26T01:42:46Z","snapshot_observed_at":"2026-07-06T22:18:35.948728Z","submitted_at":"2025-08-26T01:42:46Z","title":"History Rhymes: Accelerating LLM Reinforcement Learning with RhymeRL","version":1},"cited_work":{"arxiv_id":"2508.18588","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18588","snapshot_observed_at":"2026-07-03T23:59:07.264671Z","title":"History rhymes: Accelerating llm reinforcement learning with rhymerl","venue":null,"work_id":"2b77db42-385a-4db7-8b75-d164235015ec","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2508.18588","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:6bdc3d8b5b597eac4919dc95903ba2c5f1c860978733d8196c08dcc8090b2b36","observation_id":"3800836e-76ec-4e92-a022-d6015b1b7204","resolution":{"observed_at":"2026-05-18T05:30:55.188214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":"2405.11143","doi":"10.48550/arxiv.2405.11143","metadata_source":"pith","pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","venue":"cs.AI","work_id":"70fa48c9-2f84-49f6-9aca-37476e021fc3","year":2024},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:b2e67c902054a28aea5d0783462ca70678f0ddaa32741e4e716693afe301ea63","observation_id":"31a9f0a3-7836-4555-a88e-12f2e4d358f1","resolution":{"observed_at":"2026-05-18T05:30:55.208183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6a8eceb5-10a5-4d1f-8648-91f485593a7c","year":2023},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:b3f7432aed04e98941885a13a7e661f32ed72f8147677e8617e4f6142446c18e","observation_id":"9382e063-ca4c-492d-8754-d6a99b9902cc","resolution":{"observed_at":"2026-05-18T05:30:55.622328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3bf72bac-a597-4d03-b568-9786a9a15154","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:af9ed5456a30b7262e83bd5f7ca0f740075c9b4334933fc387eee85c91435607","observation_id":"56fc4c1d-ef92-48ea-9d0c-3f7b79fa7b01","resolution":{"observed_at":"2026-05-18T05:30:55.579022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"75959ae9-4cc1-49d6-aa5b-5fc2ce45f3da","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:ebcde07dc666ff94c987e42e2c603705840c2bfc4964e833b8a91969785c1881","observation_id":"235ff972-881a-4102-b5b7-268fd23e157c","resolution":{"observed_at":"2026-05-18T05:30:55.574752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T20:46:34.417090Z","title":null,"venue":null,"work_id":"36114d7f-e448-4db4-b8c6-bf9f86274172","year":null},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:5c771c569ccc36bc9478e6d4dc9552fcc742e8778627d17e9ccfe0de672a7ec1","observation_id":"23006547-8d9f-47bc-8917-65f012bce416","resolution":{"observed_at":"2026-05-18T05:30:55.611599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:14:47.293389Z","title":"InProceedings of the 29th symposium on operating systems principles","venue":null,"work_id":"b530ecc5-f2b4-4215-b4c3-01837fcb5993","year":null},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:07e84797fd04d7e19d96169cb759e007d4cfa84ad482b6cbab15d31f31809379","observation_id":"5061157e-82de-4d52-acac-3464bbff90aa","resolution":{"observed_at":"2026-05-18T05:30:55.592807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e15e1789-43f0-4a2f-b787-7e7f3c726576","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:9183b42e1fa9915a75a830180c91f2fa9f957cfb4be903eccbc798b74b17f0ed","observation_id":"bb6d0632-5b22-4230-82aa-a5d2a8924111","resolution":{"observed_at":"2026-05-18T05:30:55.568554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:53:27.993437Z","title":null,"venue":null,"work_id":"b3d1bb7a-da88-451a-b29c-66bd3973b21d","year":2024},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:ec326d2709ba9aca13f3a66dbde51fb823767cc7c5b7687d1829826841f3ca1f","observation_id":"988e7597-d628-4138-a630-031087b74ac7","resolution":{"observed_at":"2026-05-18T05:30:55.624636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"436889c4-4f66-4230-8bc9-5f90c19ec271","year":2024},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:037167bca2567ae1a5aa1b1b87b5f3cf304bcf9db5ac64a13f5655d6824203f4","observation_id":"198a70ea-b922-4844-a5f0-0f76b8c98233","resolution":{"observed_at":"2026-05-18T05:30:55.585735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"27bae60b-5e90-416e-bb9d-59d3a6cd69f1","year":2021},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:6a2786527eeba527c9ec341306345e30cff3e6e792c38a1147dbcae77c4c6bce","observation_id":"75919721-e841-4dd2-94d7-61c20a469f6e","resolution":{"observed_at":"2026-05-18T05:30:55.562473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dcd08b87-3878-4c4d-a267-19f7b58b90fe","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:32bb812b62087d7659d8112552ef0b94b42543adac3208978fc91b02d22f2732","observation_id":"f10b5def-86f5-4c57-b9eb-399d0d438695","resolution":{"observed_at":"2026-05-18T05:30:55.581326Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"19bda51e-bc75-4fb4-b25b-d1b5dcd8ba21","year":2022},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:b901cd473e45bb211b16a3b9143a639cab7bc2c83ba58df58f43cf566c12a098","observation_id":"6ed8c2bf-9666-4e1d-a706-3d5fe06c220a","resolution":{"observed_at":"2026-05-18T05:30:55.564617Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17604","last_updated":"2025-04-22T20:31:48Z","snapshot_observed_at":"2026-07-06T20:57:02.587855Z","submitted_at":"2025-03-22T01:18:59Z","title":"OmniScience: A Domain-Specialized LLM for Scientific Reasoning and Discovery","version":4},"cited_work":{"arxiv_id":"2503.17604","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.17604","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prabhakar, M","venue":null,"work_id":"cb9e8ed0-4eb7-4f3b-8b4d-3800eea5b598","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2503.17604","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:e514e7e96d95cff266bf7fbae14d58f0f15319b933796090189615c02c37e865","observation_id":"95134791-18b3-4072-a888-65beb49dda52","resolution":{"observed_at":"2026-05-18T05:30:55.219555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T22:31:29.294151Z","title":null,"venue":null,"work_id":"69d06f5d-fae2-4928-9588-0cf5fb40bdad","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:27f37815575e6793b5e8edeb4db571ed9e032e75d359b168c04995999d9dae42","observation_id":"72a3281d-2337-4080-bc6b-04e6414dfb82","resolution":{"observed_at":"2026-05-18T05:30:55.566517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"02e00ff9-77ec-4edf-b331-7be59f8761be","year":2024},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:b77635d48d1d0cc52fd2c16fee80d5c85ad0cc18f146aa219795e45c60b6014c","observation_id":"e5cb9022-16e3-47c7-91e8-e19d0c8b9a05","resolution":{"observed_at":"2026-05-18T05:30:55.607509Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:b756e84a96f96e3b35b272d8643fdbc8b6189dbcafd503f599fb995a359f8d2b","observation_id":"3216d57f-ca74-4212-99a4-3a0bd929a210","resolution":{"observed_at":"2026-05-18T05:30:55.169826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5c83f002-a3a4-471a-a23b-fe321db4f735","year":null},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:339f2f103c7a3c0a0f86dcdc7b20ba6a3711bc62d855af55904cacf8ec0f5117","observation_id":"5230db82-2244-4b59-815c-a280dc64693b","resolution":{"observed_at":"2026-05-18T05:30:55.605462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:ccaaf90861a779f65cabc7d4656b7b5ab18aa791fffd69e9595395799b0b32c0","observation_id":"4a43df39-d55c-444e-a707-541e9fd19706","resolution":{"observed_at":"2026-05-18T05:30:55.198715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01481","last_updated":"2024-09-03T05:47:42Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:13:40Z","title":"NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment","version":2},"cited_work":{"arxiv_id":"2405.01481","doi":"10.48550/arxiv.2405.01481","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.01481","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Nemo-aligner: Scalable toolkit for efficient model alignment","venue":null,"work_id":"1e8ee77a-1a57-4dff-ab72-33f7dd80c556","year":2024},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2405.01481","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:6a5cd0c6c7257d84102cb4c7fbc71fa9d06d8bbe967cd6296e463f6f4eacd02d","observation_id":"ebe49702-74e0-46e6-9b87-78bf1d386461","resolution":{"observed_at":"2026-05-18T05:30:55.184777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:14.063035+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:14.063035+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"565a4706-38bf-4dc5-b33a-53f258a2a543","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:c0ad2f900b5022fbcbd46c1e992c8c11323d7d81b343e64af012430837682f16","observation_id":"1582443d-d85e-4947-a340-4b3228d4e9bb","resolution":{"observed_at":"2026-05-18T05:30:55.594879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5500.33582","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"02dae020-2d97-4eee-94ad-2a3b8ba34e3d","year":2019},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:c9c5be5020248dcacc70798ddd2721ca948ba09c13cfe85815951c187ac82f06","observation_id":"2934a069-1c95-49d8-9444-6d95f9712d9f","resolution":{"observed_at":"2026-05-18T05:30:55.216546Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:ab59dc7cccdff8f9d9ea62f7e96c0bde0410d2cc5a48e8f2b39fef78c3c71dc2","observation_id":"b8c7d411-8f3e-4774-bf07-c5b2f3d24c74","resolution":{"observed_at":"2026-05-18T05:30:55.194958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7d2cd26a-4e17-448c-85a6-9642960aa01d","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:3c1067a41ffb1e0b7fbabd95785d2b84875e3e2db0157066e0c64dab8044fd68","observation_id":"b0142fb2-ee5b-404b-a6e8-182b0a93362a","resolution":{"observed_at":"2026-05-18T05:30:55.583610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c75f4682-80f0-4e52-8d09-53d68937c5de","year":2023},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:ce5f31494a5687bc93d637cc3861120f1f7855993ded400373e8a5ea2dceb440","observation_id":"279697a5-71c6-4a6c-a463-1d97098c67dc","resolution":{"observed_at":"2026-05-18T05:30:55.587820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"309e57d1-82de-4bc1-ae25-9def1353e498","year":2023},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:cec7fd04cd39206e7f862b75d900d44e59d65c71a443e2fd87daf6100e81da3d","observation_id":"328a973a-1ce8-4489-8594-568816ddd32e","resolution":{"observed_at":"2026-05-18T05:30:55.589953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0077de2b-4eab-4412-8d82-defbe02745da","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:a724c3117c896ff15d46f335e25b6d74ca98695457dcec23c3189a5be7b62ebb","observation_id":"a38540cd-fdf0-4dd1-b31e-8870cc0684bd","resolution":{"observed_at":"2026-05-18T05:30:55.597112Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1f9b9c5c-c828-450a-bc7f-1b8b81ffd402","year":null},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:bbd1ddc6cc3aac4f5563092a9f6de2b8ea33add7087887f9ae574df3e4d5a83c","observation_id":"bb4a12ca-1e6e-45c4-bc23-978780e1ac06","resolution":{"observed_at":"2026-05-18T05:30:55.603503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.04656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T13:35:46.630324Z","title":"Lazarus: Resilient and elastic training of mixture-of-experts models with adaptive expert placement","venue":null,"work_id":"483d5f90-d0d8-44ed-a9db-2376fca2f3b5","year":2024},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:a023c78596005d273ae07db60df3fa4294eb75e83665278dc3509d1b77f26319","observation_id":"b9517b2d-b250-4828-8740-7ad0ec9ebd12","resolution":{"observed_at":"2026-05-18T05:30:55.212463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2802bd78-9bde-4e94-ae1a-b3d7331c9ba0","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:a89d1918933d3260b8b4ca3556176dc65b8bd74ebe457769315487e8a6054228","observation_id":"ae475a06-9561-4920-8d4e-6ca8119ca96f","resolution":{"observed_at":"2026-05-18T05:30:55.613717Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:4a43465d98ba8426096fdaf46e16ca3bb8c1de64014e3939d108fbf7d847015a","observation_id":"d3ee691f-6d74-477e-b2e1-c5b87c8ad401","resolution":{"observed_at":"2026-05-18T05:30:55.180452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1540.36115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T05:59:38.367495Z","title":null,"venue":null,"work_id":"fc02320b-6cb6-4372-b44b-744742973441","year":2023},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:71535f15906d7498a7ecf3cd03849ed0c7aab0e57b58b0d2e2ee5c850e9aaa2f","observation_id":"bd6bbebc-25cf-4e91-80dd-8ff0aa869d19","resolution":{"observed_at":"2026-05-18T05:30:55.173518Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.20673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.190550Z","title":"Geometric-mean policy optimization","venue":null,"work_id":"a9c27ea5-14a8-4719-a98d-c59a3a8c142a","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:7cb2e93a96bd6912520bd24ed73c3c4d51fa66913a4c1ecfa86a91212d77ed02","observation_id":"33355674-f339-43a5-a32e-ab5acf05a079","resolution":{"observed_at":"2026-05-18T05:30:55.204553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a41c1f62-143a-45ab-920c-9cca609d67fe","year":2024},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:6eaa538041ba6e15f40eb4b0e88f77a0a926cfcd4a6acde686ea64dc429b9090","observation_id":"2ecf4baf-1581-47c5-bfc2-4894b466b4f1","resolution":{"observed_at":"2026-05-18T05:30:55.609491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-07-06T21:04:06.413573Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":"2504.03160","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-07-03T04:37:37.738752Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","venue":"cs.AI","work_id":"460d8021-a193-45c3-89a7-b72f6767c87f","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:357c095395523571606859b7daf49b7207afed0442446de31133b579c3a07e95","observation_id":"44ae8061-d817-4ef5-8424-b6f767f6d934","resolution":{"observed_at":"2026-05-18T05:30:55.223085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8b46ed91-6da3-4fd6-b1e8-7c0dcb13aa1e","year":null},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:88d4f88cf0de01cbb952f5b9701bb85a23526d92f43a0c0d8d1f5fe9bca180ab","observation_id":"f21e5519-dcb7-4398-aabb-1c9b741d522e","resolution":{"observed_at":"2026-05-18T05:30:55.616061Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15930","last_updated":"2025-04-22T14:19:06Z","snapshot_observed_at":"2026-07-06T21:13:04.549829Z","submitted_at":"2025-04-22T14:19:06Z","title":"StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation","version":1},"cited_work":{"arxiv_id":"2504.15930","doi":"10.48550/arxiv.2504.15930","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15930","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Streamrl: Scalable, heterogeneous, and elastic rl for llms with disaggregated stream generation","venue":null,"work_id":"63df3644-702d-4ae6-8e4a-954a41887545","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2504.15930","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:53da811cde940e5d0b5e1ddd3e2c07707c12ae2a2ff69298d5351183250851aa","observation_id":"74cff2a9-d30f-490e-bb5e-b9933ca563d1","resolution":{"observed_at":"2026-05-18T05:30:55.166777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:16.320291+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:16.320291+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"22dc6622-323e-44d9-815f-cab89c7d44ed","year":null},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:b7f4d2499b86c5fc6b6a180d44d10fdd0667f4f62aa7ff3677f1b6be86f4dff3","observation_id":"cfc82a25-6500-4303-ac17-6d1d88f0dca9","resolution":{"observed_at":"2026-05-18T05:30:55.618246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13221","last_updated":"2025-04-22T14:32:59Z","snapshot_observed_at":"2026-08-03T04:47:37.434427Z","submitted_at":"2024-09-20T05:15:38Z","title":"Optimizing RLHF Training for Large Language Models with Stage Fusion","version":3},"cited_work":{"arxiv_id":"2409.13221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.13221","snapshot_observed_at":"2026-06-29T10:13:17.822899Z","title":null,"venue":null,"work_id":"87722a37-e188-441d-9cd2-9481b8ac1b18","year":2024},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2409.13221","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:c14920c0f798375e5a7b1a5832d264670b4063004cb19e5b16877d897c26b7c2","observation_id":"2dc9d4be-4caa-4da0-98d4-aa11b890e697","resolution":{"observed_at":"2026-05-18T05:30:55.229732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-07-06T20:55:32.397101Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:282b2567960c655a547b30986a9a616ecbe043e931419662912af838beefc617","observation_id":"df998f68-4a2b-44f7-8386-e11527426948","resolution":{"observed_at":"2026-05-18T05:30:55.226541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"07bb114c-d4bc-4b58-af5b-f7e3e318e2a7","year":2021},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:97d16b8bcbcc3691309cfd0ed0ec8b2737ebfd54638e3406838dcdcb307f55b5","observation_id":"44090378-4f50-4280-8b8c-409854e7d69a","resolution":{"observed_at":"2026-05-18T05:30:55.560264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","latest_version":3,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":33,"verified_exact":17,"verified_fuzzy":4},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 7 inbound Pith citation observations for arXiv:2510.19225."}