{"as_of":"2026-08-04T09:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:12a1df53535417f1d439b0e5331d0c6441366f3f4b42f0caa72c859d8e30c113","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T20:10:32.300423Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.15565/citation-record","integrity":"/paper/2605.15565/integrity","json":"/paper/2605.15565/citation-record.json","paper":"/paper/2605.15565"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.16108","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:28:58.506549Z","title":"arXiv preprint arXiv:2511.16108(2025)","venue":null,"work_id":"cd691b36-09ff-4fda-9a35-a206d861e133","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:54f2a261144346a52c23d23443d26331119e13653e1cf6168bc18ace8a799ad8","observation_id":"e5ac3e37-e40a-49d5-95be-b33b108e4b03","resolution":{"observed_at":"2026-05-20T20:13:43.816406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13657","last_updated":"2025-10-26T23:25:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-17T19:04:38Z","title":"Why Do Multi-Agent LLM Systems Fail?","version":3},"cited_work":{"arxiv_id":"2503.13657","doi":"10.48550/arxiv.2503.13657","metadata_source":"pith","pith_arxiv_id":"2503.13657","snapshot_observed_at":"2026-07-10T13:37:06.777259Z","title":"Why Do Multi-Agent LLM Systems Fail?","venue":"cs.AI","work_id":"b186294a-cda7-4df0-9a28-27d379af92b2","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2503.13657","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:fd4b3375da4acb8b38b4e28fa8af0ac8d6129880e7cfeb505d2badc15acc8938","observation_id":"64a59955-792c-4894-8561-9c2230e39d4a","resolution":{"observed_at":"2026-05-20T20:13:43.821503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.08847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:39:31.179357Z","title":"MAS: Stable Reinforcement Learning for Multi-Agent LLM Systems , author=","venue":null,"work_id":"7f5d749f-8491-42f6-8abd-12719e909d6c","year":2026},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:43d05693b2eafebdc072e9c4d3556aaffc7a229ad3f4322ef505b14f206b1a01","observation_id":"21b2c46e-5089-4ddb-afaa-704d575f4f6e","resolution":{"observed_at":"2026-05-20T20:13:43.840692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frontier rl is cheaper than you think.https://fireworks.ai/blog/frontier-rl-is-cheaper-than-you-think , March 2026","venue":null,"work_id":"f47ae3ae-43c3-4d3e-949e-53f6b3e2531d","year":2026},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:b1afc84f7e2210ba1077c0ff45eb9c0d6bf298fdd0193250b5aa89a6a0a0d67c","observation_id":"6156e740-7730-4aaf-b7d0-6935a859492c","resolution":{"observed_at":"2026-05-20T20:13:44.831613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-07-10T21:57:39.187585Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:ce60f41f628e83bcccd6676c6af856da97c95d1a5637769f84038a6fd6c1b0c6","observation_id":"83b5152c-cd27-45c1-90b1-7541046ec6ff","resolution":{"observed_at":"2026-05-20T20:13:43.758614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.07976","doi":"10.48550/arxiv.2508.07976","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:27:26.699065Z","title":"Beyond ten turns: Unlocking long-horizon agentic search with large-scale asynchronous rl","venue":null,"work_id":"cf9b5d87-269e-421e-aec4-52f7899c89f0","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:3c7f1a743617dc5d362c8d9e2dfc10c44348e465af5640a4e360e40622b39342","observation_id":"cc460b16-ab70-4c03-8ca0-427c5b8225b2","resolution":{"observed_at":"2026-05-20T20:13:43.812045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:d0ebb28c7f712f38c3516e856c0ec4026ab2583a4f5686029ae17a4d085fda68","observation_id":"2f9e8ab8-1dd4-49fa-a234-e81503f366ec","resolution":{"observed_at":"2026-05-20T20:13:43.793215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03578","last_updated":"2026-01-28T04:55:23Z","snapshot_observed_at":"2026-07-06T17:25:53.950578Z","submitted_at":"2024-02-05T23:06:42Z","title":"LLM Multi-Agent Systems: Challenges and Open Problems","version":3},"cited_work":{"arxiv_id":"2402.03578","doi":"10.48550/arxiv.2402.03578","metadata_source":"pith","pith_arxiv_id":"2402.03578","snapshot_observed_at":"2026-07-10T14:17:10.124264Z","title":"LLM Multi-Agent Systems: Challenges and Open Problems","venue":"cs.MA","work_id":"c39b4786-4cab-4eaa-88c0-f2402c17c059","year":2024},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2402.03578","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:f5f2409f79c2061208068ce0cb94b941bf17a673dc47b8740d686a2dbca0ed3b","observation_id":"968fb06a-b677-4af5-9dc9-75ea096ead2a","resolution":{"observed_at":"2026-05-20T20:13:43.797792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-07-06T21:51:04.907326Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":null,"work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:f09c319ae9288bd49e9f274283069afee39797d7a499dc4d7c11e21188d9473b","observation_id":"5140c882-4a16-4283-816c-bda3d05ccc19","resolution":{"observed_at":"2026-05-20T20:13:43.849930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18588","last_updated":"2025-08-26T01:42:46Z","snapshot_observed_at":"2026-07-06T22:18:35.948728Z","submitted_at":"2025-08-26T01:42:46Z","title":"History Rhymes: Accelerating LLM Reinforcement Learning with RhymeRL","version":1},"cited_work":{"arxiv_id":"2508.18588","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18588","snapshot_observed_at":"2026-07-03T23:59:07.264671Z","title":"History rhymes: Accelerating llm reinforcement learning with rhymerl","venue":null,"work_id":"2b77db42-385a-4db7-8b75-d164235015ec","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2508.18588","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:80a3ef0d3e471df89ac6c626fe2fb0564f7df50369c23685c1596308b4a7cee1","observation_id":"69499fa6-ac48-494e-8c0b-ac469511e626","resolution":{"observed_at":"2026-05-20T20:13:43.860135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.12476","last_updated":"2026-04-11T14:05:07Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-13T22:20:51Z","title":"HetRL: Efficient Reinforcement Learning for LLMs in Heterogeneous Environments","version":2},"cited_work":{"arxiv_id":"2512.12476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.12476","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HetRL: Efficient Reinforcement Learning for LLMs in Heterogeneous Environments","venue":"cs.DC","work_id":"434e2d85-7d98-4083-a646-ea0de8c9a667","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2512.12476","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:23b1548b871d49adc6d24320627203c3db9b80d138d3381a78076f42d23d740d","observation_id":"62d2a544-9f76-4179-a953-6367120a43cd","resolution":{"observed_at":"2026-05-20T20:13:43.801716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Art: Agent reinforcement trainer.https://github.com/openpipe/art","venue":null,"work_id":"a935d397-78fd-4f63-8379-6698364a94c9","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:9526f13d92994fb434e213a4cd125c595692b05e2f5a008221c7366377880b67","observation_id":"9046c92b-22ca-4f4f-a040-2679e90e6c4d","resolution":{"observed_at":"2026-05-20T20:13:44.826771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":"2405.11143","doi":"10.48550/arxiv.2405.11143","metadata_source":"pith","pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","venue":"cs.AI","work_id":"70fa48c9-2f84-49f6-9aca-37476e021fc3","year":2024},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:0e3058d6d023b555dff42a6e8421ab47784415c68ef83923a41db7f111b92cfb","observation_id":"810f253f-aad9-4d69-bf90-4eca9a565b99","resolution":{"observed_at":"2026-05-20T20:13:43.798594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prime-rl","venue":null,"work_id":"e42ba328-83fa-45a4-9ec0-7597cf1c79a3","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:3fb0938456b389ec9d80ffae63f4bf8d6904b7e2159a7a8a2e77f498737c6d52","observation_id":"3fef6357-5d32-41eb-a601-f2c997b7c9b8","resolution":{"observed_at":"2026-05-20T20:13:44.819615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:e0fe2de76a84a91a51b9f0fc672086751b971f74af37894b31de070023c06594","observation_id":"0059c9ed-692a-4e1b-9034-1108bcf710a8","resolution":{"observed_at":"2026-05-20T20:13:43.711778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":"2310.06770","doi":"10.1145/512927.512945","metadata_source":"pith","pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","venue":"cs.CL","work_id":"d0effe15-a689-441a-8e3f-ea35f1c4e4b1","year":2023},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:51e9f50ea2d83cba4fe4d860f56d2700bd18a806a2f90cb138ee04094f34734b","observation_id":"6bb570e2-8c71-432d-a870-14b40df9836e","resolution":{"observed_at":"2026-05-20T20:13:43.718261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2503.09516","doi":"10.48550/arxiv.2503.09516","metadata_source":"pith","pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","venue":"cs.CL","work_id":"0e0b7549-2bc4-4574-aa7f-588ffa16eaae","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:a8b398fb4a89b34a664d7f436692702a4c59c89d9111e24bc864a144358168e8","observation_id":"11430c34-f4b3-4ac8-a656-fa7690e67b00","resolution":{"observed_at":"2026-05-20T20:13:43.737537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.14040","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:59:46.536138Z","title":"Computerrl: Scaling end-to-end online reinforcement learning for computer use agents","venue":null,"work_id":"cd9d7458-2a31-46a9-9107-77d316195b49","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:aa623ffcbab2dc907715c8658bc85fea6c5a1d07f873b7209d079d8ff88938ca","observation_id":"3c225aa8-a2dd-4d7e-b057-297c8f30a4dc","resolution":{"observed_at":"2026-05-20T20:13:43.871508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepcoder: A fully open-source 14b coder at o3-mini level","venue":null,"work_id":"3c34a8fc-df65-4887-ab85-504895810519","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:473bbf3d801c714431580df537e52c4e75441815989f7e72c5d422a5489252b1","observation_id":"e36dea94-3082-4d10-88d6-ee702e8fd02b","resolution":{"observed_at":"2026-05-20T20:13:44.810298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepscaler: Surpassing o1-preview with a 1.5b model by scaling rl","venue":null,"work_id":"2136f1e1-f134-4cd7-9c59-3345e000e1e5","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:adafa096e79fa333afa7174d91414362b59e1d13d705d6e397f48a5b4881f54c","observation_id":"c508ca35-1289-498d-95ae-0e8577b480b4","resolution":{"observed_at":"2026-05-20T20:13:44.813510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14088","last_updated":"2025-04-24T13:24:42Z","snapshot_observed_at":"2026-07-06T18:34:07.264237Z","submitted_at":"2024-06-20T08:04:07Z","title":"ReaL: Efficient RLHF Training of Large Language Models with Parameter Reallocation","version":2},"cited_work":{"arxiv_id":"2406.14088","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14088","snapshot_observed_at":"2026-07-03T18:48:49.536779Z","title":"Realhf: Optimized rlhf training for large language models through parameter reallocation","venue":null,"work_id":"ef22908e-c279-4d33-a979-6ae77585a9bd","year":2024},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2406.14088","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:a5477ee9ae2cfc7c0dd62ee7741ba274fbd6d50d145345f578b038c039d2db1b","observation_id":"62b51473-9f4e-44f7-93fa-3a1685713e0c","resolution":{"observed_at":"2026-05-20T20:13:43.884991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real: Efficient rlhf training of large language models with parameter reallocation","venue":null,"work_id":"fcb292ce-c500-45eb-b36a-9dc24c8eae23","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:37d0830bf16b1ee4560853b46661919b9c45c58599f92333b085063bd9c8a697","observation_id":"19336e7b-b9c9-482b-9bd4-ac708c7ee35a","resolution":{"observed_at":"2026-05-20T20:13:44.806799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.03839","last_updated":"2026-05-19T16:03:06Z","snapshot_observed_at":"2026-07-06T22:44:23.981940Z","submitted_at":"2026-02-03T18:56:48Z","title":"Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL","version":2},"cited_work":{"arxiv_id":"2602.03839","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.03839","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL","venue":"cs.LG","work_id":"a54cd7e8-afa5-48b9-afd2-ec3c4638601c","year":2026},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2602.03839","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:9bfb9f9d650153f0679eba0ebd81f5724ea2166ee11dc6e6ff9bb8ddfc86a365","observation_id":"1a6ddd1f-f4ff-4e66-9639-4b98d2145ec3","resolution":{"observed_at":"2026-05-20T20:13:43.730105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18252","last_updated":"2025-04-26T08:33:32Z","snapshot_observed_at":"2026-08-02T12:27:47.895828Z","submitted_at":"2024-10-23T19:59:50Z","title":"Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models","version":3},"cited_work":{"arxiv_id":"2410.18252","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.18252","snapshot_observed_at":"2026-07-10T21:57:39.335341Z","title":"Asynchronous rlhf: Faster and more efficient off-policy rl for language models","venue":"cs.LG","work_id":"89e577b6-ccb0-422f-9751-3ad83561b117","year":2024},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2410.18252","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:9f91d47e340f9fbd8196b8998dac312831af501bdbb8349480d1c95df4662954","observation_id":"f0aac165-e892-4322-beda-7603a055b7f8","resolution":{"observed_at":"2026-05-20T20:13:43.696571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T10:04:52.382298Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"2dc9c508-76e0-4e0e-b3ca-cc5656b43a68","year":2022},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:26d3ac663ee76a1cf219081949f98c6ec0f5c2f3966915d8a3367abd15880dc8","observation_id":"83b30e56-ffc8-40d7-b135-5d8b6f2970b1","resolution":{"observed_at":"2026-05-20T20:13:44.816717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:738896cae4d14c6bcb70c2a3bd3c14a2e4ec29b0a1fcc9ca69a2671777bd92bd","observation_id":"20260cb5-267c-4991-ba5f-5b8eb6c00367","resolution":{"observed_at":"2026-05-20T20:13:43.692460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:f89870c17a7fb2f5241b3b9d0f03c7dfeab2939ead659e0bdb1a6a7431ac27b9","observation_id":"1801ca8e-c178-4c98-996e-213fbce79f34","resolution":{"observed_at":"2026-05-20T20:13:43.773103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01481","last_updated":"2024-09-03T05:47:42Z","snapshot_observed_at":"2026-08-04T02:02:52.136893Z","submitted_at":"2024-05-02T17:13:40Z","title":"NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment","version":2},"cited_work":{"arxiv_id":"2405.01481","doi":"10.48550/arxiv.2405.01481","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.01481","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Nemo-aligner: Scalable toolkit for efficient model alignment","venue":null,"work_id":"1e8ee77a-1a57-4dff-ab72-33f7dd80c556","year":2024},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2405.01481","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:12a2ab7e1a523ec7d31d2acb9551e479201bd78694e469c0a8b2181252821bf2","observation_id":"f275f9a5-465a-4df6-90d9-fb8f31b817b3","resolution":{"observed_at":"2026-05-20T20:13:43.733269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:14.063035+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:14.063035+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:2a261603d387a191b6a9ff53e493e594b645607db95c0a7d33b315569a558013","observation_id":"bc652e75-f322-4d52-9d89-accc02eeafa4","resolution":{"observed_at":"2026-05-20T20:13:43.788293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving data efficiency for llm reinforcement fine-tuning through difficulty-targeted online data selection and rollout replay","venue":null,"work_id":"a1d2bb38-8a42-46fa-a7fd-a18109aa7419","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:906223f5d60a3d2fba32c9f72633fd25dc2e7b7243dd3313197784b8686b6bd7","observation_id":"c5855360-b852-4146-a87f-bdbf1630bfc7","resolution":{"observed_at":"2026-05-20T20:13:44.823009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-07-10T22:47:36.964713Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:4e60c704e4e9dc7cabc364170993882fc8e9737222b9b78fd757d842b5532e7a","observation_id":"abce3304-3ba0-4a1c-bc56-d1841b7bd503","resolution":{"observed_at":"2026-05-20T20:13:43.767751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.07848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Marti-mars2: Scaling multi-agent self-search via reinforcement learning for code generation","venue":null,"work_id":"d896c7a1-db2e-41a6-84b7-0809e579ab12","year":2026},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:b6facc4c8b56a500f965465e71dc2b1deda6c97ccbd5c65d2888c3ac356a4999","observation_id":"1e8cabbe-a2bd-4812-be4f-c4ce7ea66b79","resolution":{"observed_at":"2026-05-20T20:13:43.748091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02488","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T18:48:49.510756Z","title":"Rlanything: Forge environment, policy, and reward model in completely dynamic rl system","venue":null,"work_id":"6d0116cf-2531-41e0-a250-af72f29c9448","year":2026},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:e03cc272805f40872df74ed13c118bc0133d8e336486cf45966b1eb983faedee","observation_id":"6efcf597-9f36-4c42-a2b2-993d3c4866ac","resolution":{"observed_at":"2026-05-20T20:13:43.835972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":"2502.18449","doi":"10.48550/arxiv.2502.18449","metadata_source":"pith","pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","venue":"cs.SE","work_id":"4b93fb93-87c9-40fe-84d0-d7ecb4e11bed","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:799e7f34fd018d9782f57cb2ab2a02b07ab688711fc26d5cb86e37ae13423e04","observation_id":"e54ac121-514a-4c13-9bb0-2a88f1b536e7","resolution":{"observed_at":"2026-05-20T20:13:43.865329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:33:50.923956Z","title":"Autogen: Enabling next-gen llm applications via multi-agent conversations","venue":null,"work_id":"e57ce12a-7d16-4d21-a253-28bdb8094e1a","year":2024},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:ed1a4ec6e64f985bb721923fefa4e75060b9e6a8d4b45c8a3dd341c291af0a73","observation_id":"591e94f5-fa5c-4e94-ad96-9e2b90393888","resolution":{"observed_at":"2026-05-20T20:13:59.194486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"cited_work":{"arxiv_id":"2510.19225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.19225","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","venue":"cs.DC","work_id":"307defa2-eea6-4ad3-96bf-98aa7ec127c9","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2510.19225","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:9f8d253f23a7a2ff515af28837aec77de77f20fec91a924d15efcd828bca5896","observation_id":"d4c13c69-fe25-43b0-a6fd-5dc55bdb2550","resolution":{"observed_at":"2026-05-20T20:13:43.876213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Less: selecting influential data for targeted instruction tuning","venue":null,"work_id":"a1974652-6af6-4714-8a3d-d34f12d0f09d","year":2024},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:ea0537ed02f3171e3700ebff871e0198e03625f1f49d4a9ad0a4a4eb719abffa","observation_id":"baca4235-a3ab-4962-b775-976bd4d23c9f","resolution":{"observed_at":"2026-05-20T20:13:44.752068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2504.13818","doi":"10.48550/arxiv.2504.13818","metadata_source":"pith","pith_arxiv_id":"2504.13818","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","venue":"cs.LG","work_id":"e6d53e5b-2180-482b-82ca-0e64d572c87f","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2504.13818","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:b2c12a45e6b46bba72f7d1c31a57dc7086d6537ecf90b98a9293e4d1a458dd15","observation_id":"f0910be4-e456-42bb-8fd2-ea4a3144cab1","resolution":{"observed_at":"2026-05-20T20:13:43.844864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00796","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:29:56.814113Z","title":"Areal-hex: Accommodating asynchronous rl training over heterogeneous gpus","venue":null,"work_id":"ab7d76cd-db6b-429f-ade0-6fd6089294c1","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:5820d5cb3953851131eab63c28038de3e56a2c89109d17cc6620b229d2b21463","observation_id":"b9495583-66d6-4193-92ef-947a9c18d515","resolution":{"observed_at":"2026-05-20T20:13:43.831396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:82ef23c8ff39d8297b10ae3aecb3236370a848b3f6998a57bb6ed85b2a6ed7a6","observation_id":"7959dc1c-335d-4f0f-b6f6-a2b6ee583d59","resolution":{"observed_at":"2026-05-20T20:13:43.826382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:9499c7fec4f5630bee896cc109ef57215c6219414f054faf89831a78890ba515","observation_id":"04a651c2-4e2f-422b-8f0f-a6280f66e224","resolution":{"observed_at":"2026-05-20T20:13:43.854447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:0293bd83c89f9c82301ca20791b07261b953c312733e1cdc9fb615f7b2f82fd7","observation_id":"b90d3184-8539-48d4-9d1e-b5469aae3006","resolution":{"observed_at":"2026-05-20T20:13:43.880509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:6149be844e1161b341d66967ba713360bd8abd8aea4e1bf1bb554504523b32cf","observation_id":"d207b28e-0eb3-451d-b031-739af31a52ac","resolution":{"observed_at":"2026-05-20T20:13:43.806981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04206","doi":"10.48550/arxiv.2510.04206","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Agentrl: Scaling agentic reinforcement learning with a multi-turn, multi-task framework","venue":null,"work_id":"5d14b2f1-ee1c-407d-8b3f-4e653c4781ad","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:dfc92febc984a74f81f3705eb9333aecce2a2f190054d1a60e85e16daadad454","observation_id":"276b815a-5661-4bb8-8f3f-9010f045d6fc","resolution":{"observed_at":"2026-05-20T20:13:43.793461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:09:40.711009Z","title":"Stronger-mas: Multi-agent reinforcement learning for collaborative llms","venue":null,"work_id":"a78d10f7-9680-40c0-8cd3-2fd3366211e6","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:e0027bed121f87df10ded973d85d9ccb330e5271c7f4cc2a30635c448f108b5a","observation_id":"fa48a93b-bf3d-4aec-8f05-28af6dfba6da","resolution":{"observed_at":"2026-05-20T20:13:43.803157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-07-10T14:27:07.145784Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:11fea40d75e243c9c30495df077f8b350be744895155c8138d635a5f35be9120","observation_id":"ff5148d9-995c-4f9a-b5b5-c0c504056ea1","resolution":{"observed_at":"2026-05-20T20:13:43.783001Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-07-06T21:35:22.208213Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:d671d5ad2071cb3f95033c68a6b84080f25aa961fdd6d74e3e3b6283c20362ff","observation_id":"72467af6-8d03-4f29-8f8f-1424b2767578","resolution":{"observed_at":"2026-05-20T20:13:43.788110Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prosperity before collapse: How far can off-policy rl reach with stale data on llms? InICLR","venue":null,"work_id":"a2d855fe-72dc-46da-bf4b-3eb3cb4054cc","year":2026},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:521a0c74909ca4c5330c6fc6b0f912e9c1ccf8ea35484417dcfd1de434ab9969","observation_id":"a1073676-9eb1-49cd-a3d0-2c0b44902166","resolution":{"observed_at":"2026-05-20T20:13:44.848514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepresearcher: Scaling deep research via reinforcement learning in real-world environments","venue":null,"work_id":"fc87d92b-d07d-43e7-971d-db2fab6250bd","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:d9400595a22f997a05fcb325d95a8c04924becc3d74879a9daf8c6becea0f58f","observation_id":"2727de08-137d-4805-96ef-5bd097032a20","resolution":{"observed_at":"2026-05-20T20:13:44.839196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15930","last_updated":"2025-04-22T14:19:06Z","snapshot_observed_at":"2026-07-06T21:13:04.549829Z","submitted_at":"2025-04-22T14:19:06Z","title":"StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation","version":1},"cited_work":{"arxiv_id":"2504.15930","doi":"10.48550/arxiv.2504.15930","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15930","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Streamrl: Scalable, heterogeneous, and elastic rl for llms with disaggregated stream generation","venue":null,"work_id":"63df3644-702d-4ae6-8e4a-954a41887545","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2504.15930","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:8acb4bcd9f2078464fa178dfe92badd0ffee5157b470da84c4833ac759d0ecb7","observation_id":"d060c8be-386b-4cbb-be5f-fad2cb4be93d","resolution":{"observed_at":"2026-05-20T20:13:43.778925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:16.320291+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:16.320291+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimizing {RLHF} training for large language models with stage fusion","venue":null,"work_id":"7ef93a07-7237-4559-a601-d17024e35877","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:c05c1b2b596f56b6387f0c729e03b2222116c29fbb7f891e386d9c716ef4588a","observation_id":"e6ca8ac4-376e-4d69-8f72-b591ed56edbf","resolution":{"observed_at":"2026-05-20T20:13:59.182924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let’s think step by step . . . \\boxed{}","venue":null,"work_id":"9498beb7-8d2b-4968-9249-ab762d492fb7","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:422ac0041eb9150fa38ac0a0541baf5d6f7934ed58e327410c69f0c7d1544298","observation_id":"f129269a-ebc8-4592-b110-51497ffb580c","resolution":{"observed_at":"2026-05-20T20:13:44.842356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Any actions except provided available actions will be regarded as illegal","venue":null,"work_id":"bc7e9ff2-2eae-4942-b49d-74a5525816a1","year":null},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:707a48c480d2dee821b6136ac8a1106b7d8bccf806c35e2f51a339d43aa64201","observation_id":"97000aee-cd75-4152-b2b0-26c0963fba8e","resolution":{"observed_at":"2026-05-20T20:13:44.834814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ea791557-9e9b-472e-92fe-8826e626161a","year":null},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:175c188fae6b0c25d194e193677d03c40bd840ef11be64a933cb7833b13f27b5","observation_id":"ec4340f9-926c-4185-8846-9b8ccddb3085","resolution":{"observed_at":"2026-05-20T20:13:44.769678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":37,"verified_fuzzy":15},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2605.15565."}