{"as_of":"2026-08-04T21:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:314a24c48e685d61e7c7bfc454ccd2fdad5e8f9d17b831ce27b2bfee980c3d77","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:27:59.369199Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18006/citation-record","integrity":"/paper/2607.18006/integrity","json":"/paper/2607.18006/citation-record.json","paper":"/paper/2607.18006"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:55.403950Z","title":"Training language models to reason efficiently , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:55.403950Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:116d35d50c9b4e83147524c41d40376b94b4b07705fa0bd296fe203a9abe57b2","observation_id":"1f11a536-74f8-4725-aecc-df04d89b869c","resolution":{"observed_at":"2026-08-01T16:27:55.403950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:55.507433Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:55.507433Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:f149e37928c95699770b171c357df46531948e4b76c3c85b2bf80fc5024b4a77","observation_id":"e879c3e6-9204-4e84-8e3a-e9153cfd1c97","resolution":{"observed_at":"2026-08-01T16:27:55.507433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:55.701447Z","title":"An empirical study on eliciting and improving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:55.701447Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:ac4ebce49b8bd8c0d09bd2c9e78da6ef86e25779ee144938ee693c770d739d70","observation_id":"2537a7cf-e35f-4445-baef-594c86e7bbef","resolution":{"observed_at":"2026-08-01T16:27:55.701447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:55.863790Z","title":"Christiano and Jan Leike and Tom B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:55.863790Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:08a459d2935f8b66738865e4979d32cbf07d62067eb3a5f4e8a75e0532c71778","observation_id":"aa65e37e-90d0-4960-bce0-c2a44cb976bd","resolution":{"observed_at":"2026-08-01T16:27:55.863790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:56.122478Z","title":"Process reinforcement through implicit rewards , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:56.122478Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:f0512ab14f45191e5ad3654b5dc9636e75f910ab77e7a7f7312fbf2ae3981a25","observation_id":"ee983df6-3c37-411f-8685-9488804ea4f2","resolution":{"observed_at":"2026-08-01T16:27:56.122478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:56.294786Z","title":"Reinforcement learning for reasoning in small","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:56.294786Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:9d7453ab972e2139c1ca984c225ce865b9415f8e0e405270345952a52b1308cf","observation_id":"53b21f1a-c083-4c01-9aa9-bd0c14aaca8f","resolution":{"observed_at":"2026-08-01T16:27:56.294786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:56.446088Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:56.446088Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:dfa6a697966cd7ef6f1659fa5163625a0443914b7cb86c4cc4e19e26512f4e0c","observation_id":"39fc7620-3b95-40d1-8514-9197a9bc0d27","resolution":{"observed_at":"2026-08-01T16:27:56.446088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:56.620218Z","title":"Tenenbaum and Igor Mordatch , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:56.620218Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:9960b03df69bd8307175644afc5b2e79483a0ad1475a719f219a1cbafee3206c","observation_id":"c0b6a909-68f7-4f7f-a4bf-6a40bba1ed7e","resolution":{"observed_at":"2026-08-01T16:27:56.620218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:56.779095Z","title":"Rae and Laurent Sifre , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:56.779095Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:b1845413193a42d1ff014aab7678ea7ec61f9a91966ee5ab96ff73c15c69f8aa","observation_id":"9a08082a-1d71-435d-b5b7-7bbdd4f70fac","resolution":{"observed_at":"2026-08-01T16:27:56.779095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:56.948605Z","title":"Hu and Yelong Shen and Phillip Wallis and Zeyuan Allen-Zhu and Yuanzhi Li and Shean Wang and Lu Wang and Weizhu Chen , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:56.948605Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:c818b1b119d1313ee5a60a4c90ce4c7e3107ec5b3031cc566aeecbe6570e5b04","observation_id":"3fe24059-8875-4d9a-8597-c13ca83c4bf6","resolution":{"observed_at":"2026-08-01T16:27:56.948605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:57.110746Z","title":"Aligning language models with offline learning from human feedback , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:57.110746Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:cc477483cc4cc3648c6ea666a975759d2b94c68ce7cc54bda51f85da92ec7894","observation_id":"e268f8d0-5925-4ee2-8167-70bd29029657","resolution":{"observed_at":"2026-08-01T16:27:57.110746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:57.194081Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:57.194081Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:cbebdb28970b1ed68d32744ea0f762441ec65ff0aa4eef0bdd6ad87dcef0a40e","observation_id":"202b353d-1000-4bf1-b2a5-d6aa9583e2fb","resolution":{"observed_at":"2026-08-01T16:27:57.194081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:57.257497Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:57.257497Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:43e55ecd6151b48f7a8a0bbfe0301dbb64388d7b1fdce1ed86fa0b68a6a0eb90","observation_id":"99abe00c-f04c-4391-9b7f-8baba8c55339","resolution":{"observed_at":"2026-08-01T16:27:57.257497Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:57.310241Z","title":"Encouraging divergent thinking in large language models through multi-agent debate , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:57.310241Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:d67a7782872891b93e0045c6b4f8d0e7709afbc75da5cb14d62b92463073296e","observation_id":"d346f2a6-2c46-485a-8bae-4b4b6ecd79c2","resolution":{"observed_at":"2026-08-01T16:27:57.310241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:57.393564Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:57.393564Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:aaccdd6095dd8a2b958ef39d0b7464f648776400649a1d26081b6527799aed3f","observation_id":"789a0f5d-c0dd-4837-a158-1c208722b1c5","resolution":{"observed_at":"2026-08-01T16:27:57.393564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:57.442090Z","title":"Let's verify step by step , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:57.442090Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:5cf36c8cf9bac32e544224b2e0d43729864ea39345dfe9d3acc6743a55026f62","observation_id":"681c953c-df0d-48af-8e5e-d81c6268cded","resolution":{"observed_at":"2026-08-01T16:27:57.442090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:57.448973Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:57.448973Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:183e5742ba6b400629be4acea35777d8e9371e0f270e0ef954a98dff616f6e8d","observation_id":"b7b58bcd-32d2-4ae1-8b72-bac85c1fd75a","resolution":{"observed_at":"2026-08-01T16:27:57.448973Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:57.472924Z","title":"Decoupled weight decay regularization , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:57.472924Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:e1fa65906dc1f38e8478b712776f470543daa06dd6b32e549d6c2d915390e892","observation_id":"8d583203-0413-43ad-90bf-bc7f55f3baf8","resolution":{"observed_at":"2026-08-01T16:27:57.472924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:57.567065Z","title":"Tang and Manan Roongta and Colin Cai and Jeffrey Luo and Li Erran Li and Raluca Ada Popa and Ion Stoica , note =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:57.567065Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:5679f033fd21d1e9847db738f5253c18a0756994d1e9eae185e58cd979bcf2f9","observation_id":"db91a171-d5ef-44c3-8d85-b9c703139881","resolution":{"observed_at":"2026-08-01T16:27:57.567065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:57.698910Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:57.698910Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:2d1e1ad6b65344f8436dd640a1b405d2399794ace741c43b58b8bfe56d6dd8c6","observation_id":"661d5186-70ea-4bd4-b432-869bd540527d","resolution":{"observed_at":"2026-08-01T16:27:57.698910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:57.851559Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:57.851559Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:6bc2a499140fca9cfff5f3460d70d0c76409403fe278b7248df0ba81494a80d1","observation_id":"c518ff40-7516-4c96-9051-46ee4fd284c9","resolution":{"observed_at":"2026-08-01T16:27:57.851559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:57.948759Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:57.948759Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:12e91a134863aa924c7536dbc9d0cc271cce343002d4cb802cecff89b4e63c0f","observation_id":"deaed43f-98b8-4a3f-9a69-5dc13f9cc25f","resolution":{"observed_at":"2026-08-01T16:27:57.948759Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:58.081063Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:58.081063Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:c1745061dfdfe55ab7a3c98023f6255861250bc58a275b530a9c61289c943de4","observation_id":"1e02256b-6be4-48c7-a571-151db92e06ee","resolution":{"observed_at":"2026-08-01T16:27:58.081063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:58.237817Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:58.237817Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:b92f1b752d3df52b63297d3d883e4811308c7f2800d5ed2ae1cf4424fc9724fe","observation_id":"e4ae42e5-d29d-4bed-8c53-30aa88025b15","resolution":{"observed_at":"2026-08-01T16:27:58.237817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:58.392378Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:58.392378Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:511186ae677685dd1ee970a056c40a57d31cb191420dda17bb396b63169a3b3a","observation_id":"1be8d935-5523-4508-9678-d1c292aa7113","resolution":{"observed_at":"2026-08-01T16:27:58.392378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:58.510618Z","title":"Tenenbaum and Antonio Torralba and Shuang Li and Igor Mordatch , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:58.510618Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:971e7928a154bced9bcfce4a728d08e6286c4b4d57a425e88f7cacb807ffec41","observation_id":"20557ec1-8d05-425a-91e8-17c0fd7219c6","resolution":{"observed_at":"2026-08-01T16:27:58.510618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:58.615158Z","title":"Offline Reinforcement Learning for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:58.615158Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:e833fbbbe2f3471ce43a2a1503faceaec7222b87e13389a918e032dc6ea6135b","observation_id":"1db38d7b-e75b-4524-85dd-aef9b38528a9","resolution":{"observed_at":"2026-08-01T16:27:58.615158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:58.726551Z","title":"Tina: Tiny reasoning models via","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:58.726551Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:13a058994e88deb614d64d3495e4c4c93d26f1cb80d241bd964c911085b4110f","observation_id":"146ef1e4-0700-4636-a7d6-274c49a32241","resolution":{"observed_at":"2026-08-01T16:27:58.726551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:58.800145Z","title":"Le and Ed H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:58.800145Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:37bba10b6cc6ffdd916009c4175cd4771cb6b08a915484765aa87571e11dc5ed","observation_id":"3b57f0a6-b9fe-4f06-a3e7-d2082c230624","resolution":{"observed_at":"2026-08-01T16:27:58.800145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:58.908730Z","title":"Chain-of-thought prompting elicits reasoning in large language models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:58.908730Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:9912e484bdf663bebfdfbf7341bea378e84af40fa15e943e77fa54a03a6ee208","observation_id":"3d919d21-9b24-4900-a6ed-ab7eeb8ecfb1","resolution":{"observed_at":"2026-08-01T16:27:58.908730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:59.030312Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:59.030312Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:fbfdb919722e5fa3ae383f2a8b8469108c12e09c8f282ff63ed18c5224d6a5be","observation_id":"3a0a30a4-3ebd-4b1d-b273-55298ba667df","resolution":{"observed_at":"2026-08-01T16:27:59.030312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:59.138476Z","title":"Griffiths and Yuan Cao and Karthik Narasimhan , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:59.138476Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:2c5a8bdbe553ca3a5673f881575a88463a1401eb7dcd69ef84b619d723a62c4c","observation_id":"8c7e0609-fc24-44d9-8922-c7190dd919bb","resolution":{"observed_at":"2026-08-01T16:27:59.138476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:59.245988Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:59.245988Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:75b47dcc189360361354fd2da3d3ce874ae09485e71684e1434a3b086aa4dc46","observation_id":"2a060402-f705-4c0f-9927-df78b2e64e89","resolution":{"observed_at":"2026-08-01T16:27:59.245988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:59.351582Z","title":"What's behind","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:59.351582Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:b2ece2ddd2600de81bd0de284fa5008bf0a867cffa942b9851f439b581ba28ab","observation_id":"249b5484-1bd8-4b5b-82b3-d547fac87604","resolution":{"observed_at":"2026-08-01T16:27:59.351582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:27:59.369199Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T16:27:59.369199Z"},"links":{"citing_paper":"/paper/2607.18006"},"observation_digest":"sha256:2795628471264d0460cffa5a46e4235f4ddf9eee09703a6af222459294e3470c","observation_id":"7fccc60f-d235-469d-a747-7396aedca89a","resolution":{"observed_at":"2026-08-01T16:27:59.369199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18006","last_updated":"2026-07-20T14:38:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T05:32:51.743566Z","submitted_at":"2026-07-20T14:38:00Z","title":"MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":3,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2607.18006."}