{"as_of":"2026-08-17T04:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:299fd029e8fff0d69d72e5ced98f82fbdfc462ee156cefe7e819f9a5aa2c5811","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:11:38.252026Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T07:40:35.113858Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T07:41:14.649759Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"cited_work":{"arxiv_id":"2509.08721","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08721","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nikolay Blagoev, Oguzhan Ersoy, and Lydia Yiyu Chen","venue":null,"work_id":"55090566-de37-493c-bf18-00916b254e89","year":null},"citing_paper":{"arxiv_id":"2604.02372","last_updated":"2026-03-31T16:00:40Z","snapshot_observed_at":"2026-08-12T15:46:11.437691Z","submitted_at":"2026-03-31T16:00:40Z","title":"Backdoor Attacks on Decentralised Post-Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T23:23:22.658691Z"},"links":{"cited_paper":"/paper/2509.08721","citing_paper":"/paper/2604.02372"},"observation_digest":"sha256:3794b441a248dc0120a06d73fd12e2d74a0f62f7a610f443838c74ca88d8c4f8","observation_id":"eedf2711-0005-4d73-b17b-6169657a0b6f","resolution":{"observed_at":"2026-05-13T23:23:26.221641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"cited_work":{"arxiv_id":"2509.08721","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08721","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nikolay Blagoev, Oguzhan Ersoy, and Lydia Yiyu Chen","venue":null,"work_id":"55090566-de37-493c-bf18-00916b254e89","year":null},"citing_paper":{"arxiv_id":"2605.22537","last_updated":"2026-05-21T14:25:24Z","snapshot_observed_at":"2026-08-13T08:54:25.401943Z","submitted_at":"2026-05-21T14:25:24Z","title":"F-TIS: Harnessing Diverse Models in Collaborative GRPO","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T07:40:35.113858Z"},"links":{"cited_paper":"/paper/2509.08721","citing_paper":"/paper/2605.22537"},"observation_digest":"sha256:55bda8e233f46aba607b80c5b44c0a195647f0b2f8f13e40e01f2879bdf9213d","observation_id":"2d9cc47d-bec0-4e20-8335-f2074985d647","resolution":{"observed_at":"2026-05-22T07:41:14.654011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.08721/citation-record","integrity":"/paper/2509.08721/integrity","json":"/paper/2509.08721/citation-record.json","paper":"/paper/2509.08721"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-15T08:59:30.302596Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-15T16:11:38.023666Z","title":"Self-play fine-tuning converts weak language models to strong language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.023666Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:cf2cf84a7cc89f41f5a1d8606ba7f7774448435afdd380aa9bcf6e7413e0c61f","observation_id":"04965135-5b5a-4c16-b64c-7e8a866b9a66","resolution":{"observed_at":"2026-08-15T16:11:38.023666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T16:11:38.029405Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.029405Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:4d37b06586ed37fd7b6adc8d0144b7c62bd49d00488777a422273e63c6fbd025","observation_id":"28f31821-5267-445e-be6d-d62de77433d4","resolution":{"observed_at":"2026-08-15T16:11:38.029405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14325","last_updated":"2023-05-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:55:11Z","title":"Improving Factuality and Reasoning in Language Models through Multiagent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14325","snapshot_observed_at":"2026-08-15T16:11:38.035959Z","title":"Tenenbaum, and Igor Mordatch","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.035959Z"},"links":{"cited_paper":"/paper/2305.14325","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:f92c38ea8041c8080700e906dd0f3da9c6c73e04435b8b6a272459b8a9aef2ca","observation_id":"93dd3fd5-e281-4625-bf24-5b7927551f3a","resolution":{"observed_at":"2026-08-15T16:11:38.035959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-15T16:11:38.042144Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.042144Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:b5d0d5611d07d5a4efd9ff8a320e9eb87f4ff8ef10c5f7ca785eb242cf7f3adc","observation_id":"e6c60293-83df-4036-8035-987740f8026c","resolution":{"observed_at":"2026-08-15T16:11:38.042144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15115","last_updated":"2024-11-27T11:58:50Z","snapshot_observed_at":"2026-08-16T13:07:47.363691Z","submitted_at":"2024-10-19T13:53:50Z","title":"On Designing Effective RL Reward at Training Time for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15115","snapshot_observed_at":"2026-08-15T16:11:38.047737Z","title":"On designing effective rl reward at training time for llm reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.047737Z"},"links":{"cited_paper":"/paper/2410.15115","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:08d6b5fdee6cdf4e7704799acaec25be6f036817e1d48e5e0af5f48e8128c187","observation_id":"d6810192-2a98-4fcb-ada7-0e1d88d533be","resolution":{"observed_at":"2026-08-15T16:11:38.047737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:39.267232Z","title":"Introducing rl swarm’s new backend: Genrl","venue":null,"work_id":"44e602ef-6ccc-4536-adc6-dfe5d0f53689","year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.053251Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:c2447a83cea1e85fe111b6ca4a2f012323fc9e4e05a1ccc8fece4dd3eafcdd5c","observation_id":"0dc77fef-8e5d-4786-a540-594480ad10e0","resolution":{"observed_at":"2026-08-15T16:11:39.271650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:39.251132Z","title":"Gensyn rl swarm","venue":null,"work_id":"d075e270-227a-4615-8ba1-c96df9f394cb","year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.058693Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:13e1ca7525382e2a19c44f9ac7e893c5a76da4c9468e683293a409e5d6ee0898","observation_id":"269bfd1b-dbed-46e9-81af-3aacf9f19b3d","resolution":{"observed_at":"2026-08-15T16:11:39.255993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-15T16:11:38.064488Z","title":"Clipscore: A reference-free evaluation metric for image captioning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.064488Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:028487f13cef561874689920c8384c210532e4033ea573d0a498e38d6271fcc4","observation_id":"d71e7bb5-96ed-4c46-9e88-5fcde5ef24ec","resolution":{"observed_at":"2026-08-15T16:11:38.064488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:39.234940Z","title":"Bowman, Tim Rockt\\\" a schel, and Ethan Perez","venue":null,"work_id":"bd0d87c8-0871-4018-afef-b5e1e24de6e6","year":2024},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.071245Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:4d3b8b1a4265f288c71a62e2f46edd50ce0fc64dc83464af3751fcd5d016363f","observation_id":"a46e0d65-e37e-4aa3-8edc-0ecfa851d540","resolution":{"observed_at":"2026-08-15T16:11:39.239713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-15T16:11:38.076287Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.076287Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:e5bf1c30eb1959a386ad99c37778f37748cd82b1ad7d4caa84cdfa23eac41ecc","observation_id":"0c69c874-c4a3-4b7e-9290-54a0a856b72d","resolution":{"observed_at":"2026-08-15T16:11:38.076287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:38.082881Z","title":"Coderl: Mastering code generation through pretrained models and deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.082881Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:6cfff1959aba1f67c9a0cc46822005ba2bf5e4fba7c5fcaaa0eff32f880df81e","observation_id":"eae964b9-d577-476e-948f-b091cd0b449e","resolution":{"observed_at":"2026-08-15T16:11:38.082881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:39.218346Z","title":"Camel: Communicative agents for \"mind\" exploration of large language model society","venue":null,"work_id":"3d26a037-0bba-47fb-8adc-a4a52a7dac41","year":2023},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.087984Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:2757cac94d3403e36cf9bc4d9893c300cddcdbc84bfacdbc5a8e0ba5d02c2899","observation_id":"704f084e-e67f-4ce9-a5ef-2fca2056a526","resolution":{"observed_at":"2026-08-15T16:11:39.223623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11776","last_updated":"2024-06-17T17:33:09Z","snapshot_observed_at":"2026-08-16T13:42:08.899625Z","submitted_at":"2024-06-17T17:33:09Z","title":"Improving Multi-Agent Debate with Sparse Communication Topology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11776","snapshot_observed_at":"2026-08-15T16:11:38.093375Z","title":"Improving multi-agent debate with sparse communication topology, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.093375Z"},"links":{"cited_paper":"/paper/2406.11776","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:3073443deb88c91ead10f5db605a97ab7af6a93e25e3dbab074267252499d793","observation_id":"5be3c361-0515-4534-9677-6fc7350b755b","resolution":{"observed_at":"2026-08-15T16:11:38.093375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19118","last_updated":"2024-10-09T02:41:21Z","snapshot_observed_at":"2026-08-15T13:46:19.286791Z","submitted_at":"2023-05-30T15:25:45Z","title":"Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19118","snapshot_observed_at":"2026-08-15T16:11:38.098724Z","title":"Encouraging divergent thinking in large language models through multi-agent debate, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.098724Z"},"links":{"cited_paper":"/paper/2305.19118","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:8bdc88dbe6f315c5b504ca7788007c364fef22b5687bd2cb6d01fd4588f354ef","observation_id":"ef425cb0-e61f-4267-b996-c693242287e0","resolution":{"observed_at":"2026-08-15T16:11:38.098724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16129","last_updated":"2026-05-30T09:48:39Z","snapshot_observed_at":"2026-08-16T11:35:35.874657Z","submitted_at":"2025-04-21T07:03:54Z","title":"MARFT: Multi-Agent Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16129","snapshot_observed_at":"2026-08-15T16:11:38.103829Z","title":"Marft: Multi-agent reinforcement fine-tuning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.103829Z"},"links":{"cited_paper":"/paper/2504.16129","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:8f9a205cfa4cfafcbe07f3ee17747437e137de3d3e0d9e12b72206701245f8fa","observation_id":"42e39dd7-55d2-400f-aab7-650c5e6df32d","resolution":{"observed_at":"2026-08-15T16:11:38.103829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:38.109179Z","title":"Llm collaboration with multi-agent reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.109179Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:e84142d54f748344fa7051ff45227f334c626e278f52f9f71ab5e63123ca9bf3","observation_id":"b55754cc-3787-4499-a329-4b63d9320414","resolution":{"observed_at":"2026-08-15T16:11:38.109179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:39.196817Z","title":"Coevolving with the other you: Fine-tuning llm with sequential cooperative multi-agent reinforcement learning","venue":null,"work_id":"290721cd-7245-47ba-b114-7743c672bbbd","year":2024},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.116384Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:d84e6e64f7eb368b6b29e4e3f9893b47260cb265dd18ed6a20fe86c333caca03","observation_id":"fa691390-2f9f-4629-b252-83b5634efa0d","resolution":{"observed_at":"2026-08-15T16:11:39.206463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-15T16:11:38.122268Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.122268Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:89e0e7de3fc91ec349d56cc62cc2ff88fc0cf9c120633ce07b474a5d62b8ad4f","observation_id":"ba52a9bb-f820-45e3-a236-89c70f7539ee","resolution":{"observed_at":"2026-08-15T16:11:38.122268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:38.127762Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.127762Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:904a224409e160af35d46d0f9cb8b36f1214a9ba8fbf77208cdc59ffd634cc2d","observation_id":"3afbe756-0010-4c42-9b30-c292b97b8845","resolution":{"observed_at":"2026-08-15T16:11:38.127762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20011","last_updated":"2024-10-25T23:52:28Z","snapshot_observed_at":"2026-08-16T13:05:49.624956Z","submitted_at":"2024-10-25T23:52:28Z","title":"A Survey of Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20011","snapshot_observed_at":"2026-08-15T16:11:38.132668Z","title":"Ahmed, Nedim Lipka, Ruiyi Zhang, Xiang Chen, Tong Yu, Sungchul Kim, Hanieh Deilamsalehy, Namyong Park, Mike Rimer, Zhehao Zhang, Huanrui Yang, Ryan A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.132668Z"},"links":{"cited_paper":"/paper/2410.20011","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:cb4a0f617cbc133af3df9ef8a0a902984abd1d086392530d67b638488a27dc29","observation_id":"d70bd771-4080-42a6-aafc-d4ffcc97d08f","resolution":{"observed_at":"2026-08-15T16:11:38.132668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:39.178726Z","title":"Aligning language models to follow instructions","venue":null,"work_id":"b004e1c3-4718-4872-a99a-298b1f49bb1e","year":2022},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.137824Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:86bd399f8520ae2ac06f3a188e84809528894bc34208ec02a62bff4487196f1e","observation_id":"a6475cc0-fe77-43e3-9e92-4992aa9c8d6d","resolution":{"observed_at":"2026-08-15T16:11:39.183649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:39.150653Z","title":"Learning to reason with llms","venue":null,"work_id":"d27c40e0-6b72-476b-ab33-b837db2c6355","year":2024},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.143047Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:a7431c7b08160790743d58a6dabced66f9ec27957b1b3a94100bf1b8e14c63bd","observation_id":"b1967b71-42e4-4d3f-8704-939d8f2cd846","resolution":{"observed_at":"2026-08-15T16:11:39.160352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-15T16:11:38.147977Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.147977Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:a598884977bf98f1bbf9a4f154e955d3667ef8384674076f33296395467bce3a","observation_id":"827aaa37-c583-4756-b3cb-817dc88ce216","resolution":{"observed_at":"2026-08-15T16:11:38.147977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18439","last_updated":"2025-07-12T20:13:27Z","snapshot_observed_at":"2026-08-16T12:55:16.151952Z","submitted_at":"2025-02-25T18:33:48Z","title":"MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18439","snapshot_observed_at":"2026-08-15T16:11:38.152836Z","title":"Maporl: Multi-agent post-co-training for collaborative large language models with reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.152836Z"},"links":{"cited_paper":"/paper/2502.18439","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:5fc8aadc0e325505fc20f77b49f158e4a50f37f96f17baee68e2c413cea5ad6e","observation_id":"ad40bdd9-db83-4635-ab1b-fb9e691d24f2","resolution":{"observed_at":"2026-08-15T16:11:38.152836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-08-15T19:46:54.909325Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-15T16:11:38.158686Z","title":"Red teaming language models with language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.158686Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:c74eaf2195f417b21e6c210e918a889087d80a24eae2f9dfcce933915a1fa84f","observation_id":"d045c633-4a48-4240-b5f8-3e00400c50c2","resolution":{"observed_at":"2026-08-15T16:11:38.158686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:38.164045Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.164045Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:824cc186b6281d4361acb906ae0e3ad771b30bcc76039933e69d2dae0d742a4a","observation_id":"5a97264f-265c-4f92-852d-c6e3ed522a5a","resolution":{"observed_at":"2026-08-15T16:11:38.164045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T16:11:38.169427Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.169427Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:cbae64222983369f99e89f3b69eedcb19502ddc813908037c9e115d4250e13e1","observation_id":"8febbaa1-a426-41cb-9ff9-5e68eb4c2459","resolution":{"observed_at":"2026-08-15T16:11:38.169427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T16:11:38.175033Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.175033Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:d6ef2995a282ce2f0cb23c4c4f8e8af8c8036cbfb6536dc87917bed9a97349f1","observation_id":"9d47a817-b740-4b5b-9a05-0c50a2b5f7ed","resolution":{"observed_at":"2026-08-15T16:11:38.175033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:38.180073Z","title":"Reasoning gym: Reasoning environments for reinforcement learning with verifiable rewards, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.180073Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:c20b01d8196f300b72f39c49cab782adad16115b61a3ca5f5bc30e1801270002","observation_id":"21f9b2df-4f6a-43d8-9b18-9758b989a4a4","resolution":{"observed_at":"2026-08-15T16:11:38.180073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05707","last_updated":"2025-03-03T18:58:16Z","snapshot_observed_at":"2026-08-16T12:59:23.869246Z","submitted_at":"2025-01-10T04:35:46Z","title":"Multiagent Finetuning: Self Improvement with Diverse Reasoning Chains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05707","snapshot_observed_at":"2026-08-15T16:11:38.192344Z","title":"Tenenbaum, Antonio Torralba, Shuang Li, and Igor Mordatch","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.192344Z"},"links":{"cited_paper":"/paper/2501.05707","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:70e4c4defcdca94963b6e1a5a325cccde905160826ef5853f23ab97eb7820ce1","observation_id":"b6b384e7-e0b4-4da2-ae8b-8f5aa93894fc","resolution":{"observed_at":"2026-08-15T16:11:38.192344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:39.111684Z","title":"Fine-tuning language models for factuality","venue":null,"work_id":"6dcef493-e104-41d4-912b-a58750db59e7","year":2023},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.197585Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:62779486bc2331e593cedd42a00a6f2c11bf206fe202088f7000e2d7379bd2cd","observation_id":"1add689b-884f-42f3-88f8-c32f9affdb43","resolution":{"observed_at":"2026-08-15T16:11:39.119425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-13T20:34:22.010534Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-15T16:11:38.202370Z","title":"Llamarl: A distributed asynchronous reinforcement learning framework for efficient large-scale llm training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.202370Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:d0d9d6afec931acd6cbd12a3c346598e80909357788ffa0754bb0694d3dd446b","observation_id":"875b28fa-e440-4d6d-bbee-76b50c82aa86","resolution":{"observed_at":"2026-08-15T16:11:38.202370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08155","last_updated":"2023-10-03T20:47:10Z","snapshot_observed_at":"2026-08-08T22:28:26.004138Z","submitted_at":"2023-08-16T05:57:52Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08155","snapshot_observed_at":"2026-08-15T16:11:38.207162Z","title":"Autogen: Enabling next-gen llm applications via multi-agent conversation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.207162Z"},"links":{"cited_paper":"/paper/2308.08155","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:e2e48e131a80ea57026c0cb4142bfbc91144bc604e744c6215c4571582420344","observation_id":"83f1c6ee-957a-4375-85b5-6dba009facdf","resolution":{"observed_at":"2026-08-15T16:11:38.207162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-15T16:11:38.212687Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.212687Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:e3dea0c0573bc85dbd5a2a3ee8d6ea6860b623d5e6cfc69ace7447b2effdc8d0","observation_id":"9fb83e6f-e9ff-4ebf-83be-ad000124da5c","resolution":{"observed_at":"2026-08-15T16:11:38.212687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-15T16:11:38.218726Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.218726Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:bbc891e3391cfa8880e846174677e680dac698342aa2ad69d7ffc2c7f658f3af","observation_id":"43ee3926-cce7-4f2f-82a2-6936c1ba95ef","resolution":{"observed_at":"2026-08-15T16:11:38.218726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-16T13:23:25.049278Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-15T16:11:38.223789Z","title":"Generative verifiers: Reward modeling as next-token prediction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.223789Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:169e06a274fda29579950032414cf5afddc828a6df3f17c140223f5df632e6bd","observation_id":"151856ee-cfed-4593-950e-6a8c2fb8bf71","resolution":{"observed_at":"2026-08-15T16:11:38.223789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04780","last_updated":"2025-02-07T09:33:44Z","snapshot_observed_at":"2026-08-14T14:26:13.263906Z","submitted_at":"2025-02-07T09:33:44Z","title":"SiriuS: Self-improving Multi-agent Systems via Bootstrapped Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04780","snapshot_observed_at":"2026-08-15T16:11:38.229066Z","title":"Sirius: Self-improving multi-agent systems via bootstrapped reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.229066Z"},"links":{"cited_paper":"/paper/2502.04780","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:8372a73b8f3389ac1e39e3cc0ac3b0d8e72e3afdc89d1dd3cf12be2578e5117c","observation_id":"2d5ad3ed-b20d-409a-9eed-2dff7c548699","resolution":{"observed_at":"2026-08-15T16:11:38.229066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-15T16:11:38.234186Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.234186Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:00f80f5891368c80cbb8857094a654c88af0dccd94f5fe4bad7c5e7c5a15a6d0","observation_id":"324bde60-eac4-4c01-8fcc-467217f76eda","resolution":{"observed_at":"2026-08-15T16:11:38.234186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:38.239822Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.239822Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:e2050dbddf85d463a96591f1736f52356987b818adc55efec02a342e34d83206","observation_id":"cc2580f9-6482-49b6-8f05-4750c704c76d","resolution":{"observed_at":"2026-08-15T16:11:38.239822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:38.245234Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.245234Z"},"links":{"citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:13bb20cf323abdb28c225a6c0cf9afae2e1e1dd103a793eefdc70343522d5b02","observation_id":"c599f75f-d57a-4a96-a53b-4c927e5bde66","resolution":{"observed_at":"2026-08-15T16:11:38.245234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19385","last_updated":"2025-02-26T18:30:49Z","snapshot_observed_at":"2026-08-16T12:54:54.515975Z","submitted_at":"2025-02-26T18:30:49Z","title":"HDEE: Heterogeneous Domain Expert Ensemble","version":1},"cited_work":{"arxiv_id":"2502.19385","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19385","snapshot_observed_at":"2026-08-15T16:11:38.298311Z","title":"HDEE: Heterogeneous Domain Expert Ensemble","venue":"cs.LG","work_id":"e42254a5-9927-495c-9136-e8e927438020","year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.252026Z"},"links":{"cited_paper":"/paper/2502.19385","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:e2fcd658c104c27cf1eec022160a07249274a3d12f7f88a5f0bf8efeddcfe570","observation_id":"a5f4ac86-69ee-4962-8a27-59534893ae92","resolution":{"observed_at":"2026-08-15T16:11:38.305753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T00:50:41.300918Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 2 inbound Pith citation observations for arXiv:2509.08721."}