{"as_of":"2026-08-13T02:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e5d5a95846d426fc48b16097d805e3a093500c036d2f82010f75f79a55e4b94","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:07:52.017037Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:32:02.473074Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T03:05:55.340981Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"cited_work":{"arxiv_id":"2604.11554","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.11554","snapshot_observed_at":"2026-07-09T03:05:55.340981Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","venue":"cs.CL","work_id":"cad889be-3e24-4161-95a3-73ca7ebb0195","year":2026},"citing_paper":{"arxiv_id":"2605.13779","last_updated":"2026-05-26T16:10:31Z","snapshot_observed_at":"2026-07-06T23:25:21.032938Z","submitted_at":"2026-05-13T16:59:08Z","title":"MinT: Managed Infrastructure for Training and Serving Millions of LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T19:25:12.407148Z"},"links":{"cited_paper":"/paper/2604.11554","citing_paper":"/paper/2605.13779"},"observation_digest":"sha256:27987ec040b57897cee5c5462fb82efb384e80b6ff2502d65be876ac8c97f635","observation_id":"f287ec78-98c1-4c7c-a4b5-d6bdf99027d9","resolution":{"observed_at":"2026-05-14T19:27:51.877050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"cited_work":{"arxiv_id":"2604.11554","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.11554","snapshot_observed_at":"2026-07-09T03:05:55.340981Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","venue":"cs.CL","work_id":"cad889be-3e24-4161-95a3-73ca7ebb0195","year":2026},"citing_paper":{"arxiv_id":"2605.13779","last_updated":"2026-05-26T16:10:31Z","snapshot_observed_at":"2026-07-06T23:25:21.032938Z","submitted_at":"2026-05-13T16:59:08Z","title":"MinT: Managed Infrastructure for Training and Serving Millions of LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T21:47:00.295144Z"},"links":{"cited_paper":"/paper/2604.11554","citing_paper":"/paper/2605.13779"},"observation_digest":"sha256:30830f5e33a1febb8de8010c46c270072a1856eceeb721fd07a74cc5aec15e4d","observation_id":"884a07e3-0ce2-459d-b434-52d7660279fd","resolution":{"observed_at":"2026-06-30T22:05:06.192120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"cited_work":{"arxiv_id":"2604.11554","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.11554","snapshot_observed_at":"2026-07-09T03:05:55.340981Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","venue":"cs.CL","work_id":"cad889be-3e24-4161-95a3-73ca7ebb0195","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-10T07:57:28.813921Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2604.11554","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:60b90919698fcea0155a372cc5f14970f0d3b5120057bf092cbf3cf202577f31","observation_id":"6e2c39ff-7e1f-479a-b9c1-8b983d4ab74c","resolution":{"observed_at":"2026-07-09T03:05:55.342846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11554","snapshot_observed_at":"2026-08-01T21:32:02.473074Z","title":"Relax: An asynchronous reinforcement learning engine for omni-modal post-training at scale, 2026.https://arxiv.org/abs/2604.11554","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16074","last_updated":"2026-07-17T15:58:20Z","snapshot_observed_at":"2026-08-10T18:42:30.024031Z","submitted_at":"2026-07-17T15:58:20Z","title":"JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T21:32:02.473074Z"},"links":{"cited_paper":"/paper/2604.11554","citing_paper":"/paper/2607.16074"},"observation_digest":"sha256:07752da73104ca018ee8c577b8faec0f0904be3e89b810f898a2cc1e2e14ce0b","observation_id":"0e0cbcdd-cab6-4b7a-adf8-2a79aacbd96a","resolution":{"observed_at":"2026-08-01T21:32:02.473074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11554","snapshot_observed_at":"2026-08-01T09:49:31.413822Z","title":"Relax : An asynchronous reinforcement learning engine for omni-modal post-training at scale","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-12T22:20:44.276246Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:31.413822Z"},"links":{"cited_paper":"/paper/2604.11554","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:cd2388f68e34cd3b09dd1ae7ce3daf37f37501751ef53b6c4402bbc2070d888d","observation_id":"7b849eeb-c909-49a0-82db-ab62884f9c63","resolution":{"observed_at":"2026-08-01T09:49:31.413822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.11554/citation-record","integrity":"/paper/2604.11554/integrity","json":"/paper/2604.11554/citation-record.json","paper":"/paper/2604.11554"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.153429Z","title":"Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers","venue":null,"work_id":"4df9a4a1-3908-4d16-9c0b-253bb245a0c4","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:7bbd5ac0928097cb9c63c7128e6e659223e6b439c8c5fdbcb66fba3c460cae4c","observation_id":"1ae3668c-a270-4107-8c10-7735919be773","resolution":{"observed_at":"2026-05-11T09:16:03.310604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:f2e9609b1098faced5255f30fc8c2b94125eceff18a106ffc5f672e7d6531e10","observation_id":"714e39aa-db5f-4aef-aeb5-1c9337d642b9","resolution":{"observed_at":"2026-05-11T09:16:03.341044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:fef7dba8db0317852d2fbcce7843784cb50d03c5ed8c69277a494325b3aec73a","observation_id":"b274a53d-5f5f-4918-a1b5-a213f762e5d9","resolution":{"observed_at":"2026-05-11T09:16:03.301588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:2bed0197613a3523c6e3764140c0699cdc51b58b7a7afd89cfd8d79ca6b3603f","observation_id":"db06b6f2-ac58-48de-bc7c-201a510860e9","resolution":{"observed_at":"2026-05-11T09:16:03.321578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:8b225091d42ece28bdaf28906301bf7218c56f3564e344f41ff1344b992bbd97","observation_id":"389b0b5c-4d69-4e40-ab41-6bacfd400e4b","resolution":{"observed_at":"2026-05-11T09:16:03.332879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:417b89a87967173e382bbbec81b74b05b0b74ad26da51cfa766ce4f6a3b97c44","observation_id":"69cea288-5a44-4e2d-9c81-121c0dbd02d6","resolution":{"observed_at":"2026-05-11T09:16:03.315145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-12T12:08:23.520312Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":"2405.11143","doi":"10.48550/arxiv.2405.11143","metadata_source":"pith","pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","venue":"cs.AI","work_id":"70fa48c9-2f84-49f6-9aca-37476e021fc3","year":2024},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:f9db4d05dea2b4feb5d362a0544a7a6b098f220a4d9521aef9d55fb0fdaa66c8","observation_id":"b83aa4c6-ea2d-4b2d-ab97-d57879b95d3a","resolution":{"observed_at":"2026-05-15T03:28:57.414349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:396eed80e9dacd411fa971eb166fa5adc82d3bc292f34330b9421800b03d955a","observation_id":"a80d0625-6c83-4771-ae17-5c4bf08115af","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:7a3edc4154895e93da9556d975737bf68f53dba53ee1e2b4683ad2fa04efae20","observation_id":"aa820f69-54c1-4543-b167-7b144dec4266","resolution":{"observed_at":"2026-05-11T09:16:03.252155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T21:55:43.371585Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:b2f528f7771a822f3274914bdb007b1afd8847906b1559bac511594984fdb67b","observation_id":"3a2c3f59-b823-4fc0-9825-6df5dccc7e83","resolution":{"observed_at":"2026-05-11T09:16:03.246392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.18815","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:08:43.027406Z","title":"type\": \"function","venue":null,"work_id":"5a21a37d-7198-4fa8-b16b-4210e37c3b65","year":2026},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:c2c22540f2355abfcd663299291bfbf88944bf83b8161d450cc522a00dc9f537","observation_id":"3b3b2430-9bd8-4b90-b944-7c5de00d4679","resolution":{"observed_at":"2026-05-11T09:16:03.270343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"slime: An llm post-training framework for rl scaling","venue":null,"work_id":"baded6a0-c5e7-4b94-855f-53edd8f1ab0a","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:603d1530009138c541ee6f8d70928afb1c03b6ccced70eecee5387a3ba634cfd","observation_id":"591aac5d-eb66-468d-bf3e-096d54507a30","resolution":{"observed_at":"2026-05-17T16:51:59.969766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05889","last_updated":"2018-09-30T03:14:16Z","snapshot_observed_at":"2026-08-03T08:53:04.947369Z","submitted_at":"2017-12-16T01:29:49Z","title":"Ray: A Distributed Framework for Emerging AI Applications","version":2},"cited_work":{"arxiv_id":"1712.05889","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.05889","snapshot_observed_at":"2026-07-03T21:28:58.485698Z","title":"Ray: A Distributed Framework for Emerging AI Applications","venue":"cs.DC","work_id":"51ecb22c-ae12-46b2-8aa3-8f5e412b17ba","year":2017},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/1712.05889","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:3fc3066169f905b1422df1db8431619ca3102c8228cc618486d91cc8d0db8deb","observation_id":"c5e76a10-61fa-4300-8191-63716353c914","resolution":{"observed_at":"2026-05-11T09:16:03.296707Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-12T12:29:44.507445Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":"1706.03741","doi":"10.48550/arxiv.1706.03741","metadata_source":"pith","pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep reinforcement learning from human preferences","venue":"stat.ML","work_id":"95b596b9-4880-42ad-ac79-570a3a8a9dee","year":2017},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:122e93eefc021ae8e05c9518f5d720b6d25099e076c2943f2177c5960b242c29","observation_id":"323d3a8a-39db-4ade-95b4-8f65f6b6faac","resolution":{"observed_at":"2026-05-16T08:39:30.882444Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":"2203.02155","doi":"10.1007/s00354-022-00198-8","metadata_source":"pith","pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training language models to follow instructions with human feedback","venue":"cs.CL","work_id":"52aff42f-4fa9-4fcf-bdb3-1459b9bebf65","year":2022},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:379b5b80ccde36fb2620f0ced3a97be426b4aa780abb0a6f37b48b3b89c3d182","observation_id":"b387c5ab-57a5-4f31-8afe-d48cc3ad668d","resolution":{"observed_at":"2026-05-11T09:16:03.207345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":"2503.09567","doi":"10.48550/arxiv.2503.09567","metadata_source":"pith","pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-07-10T18:57:31.639044Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","venue":"cs.AI","work_id":"0b361fed-cf2a-4b90-b61a-de88de4b8840","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:b352bcbb3b7266de4d6237fff4011c93d8b91839b6db79d2bff2fd81cf850bd2","observation_id":"aa881d94-6290-4ec3-84c3-a3051ebe5043","resolution":{"observed_at":"2026-05-12T08:40:42.146675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T19:23:19.477611+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T19:23:19.477611+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:a846aef5493c6dbc5dfe75eef1c9ec7964b9c11dac81bea077e070d15577034d","observation_id":"8ec5f994-e0ca-49e6-95ef-2cd0bf0003bb","resolution":{"observed_at":"2026-05-11T09:16:03.240975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-11T10:42:54.633244Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:74106479bbc96344d0df813a7fe4604ba1a4d63d5a8be7163f7e47b36b3c0472","observation_id":"e29febe5-7e34-4270-a0c3-f8dbc3898095","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":"2304.11277","doi":"10.48550/arxiv.2304.11277","metadata_source":"pith","pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","venue":"cs.DC","work_id":"bee7755e-b855-401d-813a-06ae9451d768","year":2023},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:68950fc01e92d581fe532e1e31f7dd8c5fb0714819b488c85354cb4b67c5ff5c","observation_id":"b2f940ef-fad4-45de-a12e-be7f400cce3d","resolution":{"observed_at":"2026-05-12T04:15:20.153254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.02495","doi":"10.48550/arxiv.2504.02495","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Inference-time scaling for generalist reward modeling","venue":"ArXiv.org","work_id":"be1aa439-dad2-4f1c-b107-a8c1d5a94e91","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:a86a30246374787515a9a8d329c54fb992efffdfa7658700e5e58d373aed026b","observation_id":"609eb919-2099-427a-962b-6cb59eedc62b","resolution":{"observed_at":"2026-05-11T09:16:03.235452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:af121e7d5db8ffc34e3bebf8467587fd30cf77c0e71d6d764c4f49d51576154b","observation_id":"87eebf59-fac5-45cc-b15c-4399c9236ab6","resolution":{"observed_at":"2026-05-11T09:16:03.279034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"494c2a87-74bc-430f-964f-9e4278977a71","year":2026},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:fcdad2aee044389ded40f350b9d68216e39abd601ddc6182bc6497310b6eb8de","observation_id":"71c61e6f-ee4f-4fe5-a518-e46df2326e7a","resolution":{"observed_at":"2026-05-17T16:51:59.972786Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":1,"verified_exact":16,"verified_fuzzy":1},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 5 inbound Pith citation observations for arXiv:2604.11554."}