{"as_of":"2026-08-05T02:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66c1a7fe8c06ae7901262ad0a5928f5b92b472ddc36b1510bbe073642dc6d935","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:01:25.490489Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T22:56:37.763786Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2503.09501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-09T22:56:37.763786Z","title":"Rema: Learning to meta-think for llms with multi-agent reinforcement learning","venue":"cs.AI","work_id":"7eae456f-aefc-492d-bfbe-5271113323e8","year":2025},"citing_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-05-22T21:39:49.832151Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2504.01990"},"observation_digest":"sha256:ba30c8fa739ba8ae4435ac7d4c363d89ae6ae837050c30aaafaefa91e144b6ac","observation_id":"31a01da1-b436-419f-9ef4-4a8789cbfc67","resolution":{"observed_at":"2026-05-22T21:42:10.681342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-08-03T10:01:25.490489Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-03T10:01:20.972258Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:25.490489Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:5b7eac2d27c3b02c9bba75e896aa4cd67bdbfacfd861c5a9a0a4bd81a4acd827","observation_id":"03613c47-f757-4d02-85a3-20eb907510f6","resolution":{"observed_at":"2026-08-03T10:01:25.490489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2503.09501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-09T22:56:37.763786Z","title":"Rema: Learning to meta-think for llms with multi-agent reinforcement learning","venue":"cs.AI","work_id":"7eae456f-aefc-492d-bfbe-5271113323e8","year":2025},"citing_paper":{"arxiv_id":"2604.08000","last_updated":"2026-04-09T09:06:13Z","snapshot_observed_at":"2026-07-06T22:57:13.745326Z","submitted_at":"2026-04-09T09:06:13Z","title":"PASK: Toward Intent-Aware Proactive Agents with Long-Term Memory","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T18:05:40.242925Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2604.08000"},"observation_digest":"sha256:93c2cf6e9ad7542a59bac04b502a906c67d253d01f1e3a68e979d0799db00f92","observation_id":"1839bc5c-f1d9-4f5c-a6b8-67beba00fd52","resolution":{"observed_at":"2026-05-11T05:30:59.641074Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2503.09501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-09T22:56:37.763786Z","title":"Rema: Learning to meta-think for llms with multi-agent reinforcement learning","venue":"cs.AI","work_id":"7eae456f-aefc-492d-bfbe-5271113323e8","year":2025},"citing_paper":{"arxiv_id":"2604.15972","last_updated":"2026-04-17T11:36:20Z","snapshot_observed_at":"2026-07-06T23:03:26.308324Z","submitted_at":"2026-04-17T11:36:20Z","title":"Weak-Link Optimization for Multi-Agent Reasoning and Collaboration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T08:53:03.420926Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2604.15972"},"observation_digest":"sha256:2625a83817e7e2198df673f2a4aacb141986809605a407c472f69acaede5086d","observation_id":"803fa2c0-1856-4033-93e7-2e4a992ee665","resolution":{"observed_at":"2026-05-10T08:58:13.232273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2503.09501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-09T22:56:37.763786Z","title":"Rema: Learning to meta-think for llms with multi-agent reinforcement learning","venue":"cs.AI","work_id":"7eae456f-aefc-492d-bfbe-5271113323e8","year":2025},"citing_paper":{"arxiv_id":"2604.20140","last_updated":"2026-04-22T03:08:30Z","snapshot_observed_at":"2026-07-06T23:06:40.154278Z","submitted_at":"2026-04-22T03:08:30Z","title":"HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T00:51:37.506096Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2604.20140"},"observation_digest":"sha256:c7862c37cfb5f3c7d84a7f9d2995e8e58a30da57d25c922eac4b87d604e1e0f1","observation_id":"be9f6412-e539-4728-9fed-975d56a6b911","resolution":{"observed_at":"2026-05-10T00:54:48.595081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2503.09501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-09T22:56:37.763786Z","title":"Rema: Learning to meta-think for llms with multi-agent reinforcement learning","venue":"cs.AI","work_id":"7eae456f-aefc-492d-bfbe-5271113323e8","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-02T08:20:53.174108Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T01:17:28.124867Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:c36d8d153fa5233d4628f47fa75796a2ac5d88b5a2e26754726b7dce65ea7b12","observation_id":"0d912134-9d6c-4f83-a529-03f72eb64e6b","resolution":{"observed_at":"2026-05-12T08:06:31.567058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2503.09501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-09T22:56:37.763786Z","title":"Rema: Learning to meta-think for llms with multi-agent reinforcement learning","venue":"cs.AI","work_id":"7eae456f-aefc-492d-bfbe-5271113323e8","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-02T08:20:53.174108Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T18:07:27.492419Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:3c9192c02c4a4b26ac2ad5f0f38d40be1915760e1ae14bdbbb057cebadab34f9","observation_id":"30be449b-bb44-4dcf-98b4-f100817906e0","resolution":{"observed_at":"2026-05-19T18:07:42.344993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2503.09501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-09T22:56:37.763786Z","title":"Rema: Learning to meta-think for llms with multi-agent reinforcement learning","venue":"cs.AI","work_id":"7eae456f-aefc-492d-bfbe-5271113323e8","year":2025},"citing_paper":{"arxiv_id":"2605.18500","last_updated":"2026-05-18T14:54:49Z","snapshot_observed_at":"2026-08-04T20:28:50.199892Z","submitted_at":"2026-05-18T14:54:49Z","title":"Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T11:21:39.492072Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2605.18500"},"observation_digest":"sha256:f79bd9a0b15dea58e97889320a11373db93e5d59f53a3128ed14664ba7642848","observation_id":"645471cc-29c6-4711-8751-8270dc713942","resolution":{"observed_at":"2026-05-20T11:23:14.035547Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2503.09501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-09T22:56:37.763786Z","title":"Rema: Learning to meta-think for llms with multi-agent reinforcement learning","venue":"cs.AI","work_id":"7eae456f-aefc-492d-bfbe-5271113323e8","year":2025},"citing_paper":{"arxiv_id":"2605.21768","last_updated":"2026-05-20T22:02:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-20T22:02:00Z","title":"Memory-R2: Fair Credit Assignment for Long-Horizon Memory-Augmented LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T09:18:15.753115Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2605.21768"},"observation_digest":"sha256:b1f6dde9cbb3b1a49aff6b34f12dffcfbc330b5cdf603da4cd671cf2da1c8dbf","observation_id":"b4ed6ee3-62ee-4e03-a436-b0852d366c7c","resolution":{"observed_at":"2026-05-22T09:21:21.800398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-13T08:52:44.531560Z","title":"Xin Wang, Zhiyao Cui, Hao Li, Ya Zeng, Chenxu Wang, Ruiqi Song, Yihang Chen, Kun Shao, Qiaosheng Zhang, Jinzhuo Liu, Siyue Ren, Shuyue Hu, and Zhen Wang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26451","last_updated":"2026-04-08T06:50:37Z","snapshot_observed_at":"2026-08-03T07:37:39.596684Z","submitted_at":"2026-04-08T06:50:37Z","title":"Design First, Code Later: Aesthetically Pleasing Template-Free Slides Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T08:52:44.531560Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2605.26451"},"observation_digest":"sha256:d073de8b9fdc8ae99d4d01ce7e716ede049fe8b40ea31cf579fbab11f35edbc0","observation_id":"600d072f-bf08-44dd-a9b8-39a11b16c190","resolution":{"observed_at":"2026-07-13T08:52:44.531560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2503.09501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-09T22:56:37.763786Z","title":"Rema: Learning to meta-think for llms with multi-agent reinforcement learning","venue":"cs.AI","work_id":"7eae456f-aefc-492d-bfbe-5271113323e8","year":2025},"citing_paper":{"arxiv_id":"2606.26935","last_updated":"2026-06-25T12:09:16Z","snapshot_observed_at":"2026-07-07T00:01:10.711037Z","submitted_at":"2026-06-25T12:09:16Z","title":"Where Do CoT Training Gains Land in LLM based Agents?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-26T04:55:14.293452Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2606.26935"},"observation_digest":"sha256:f270a548b63dd5c664f1b9ddda8def521c16cc2b3cfa60eea66f96cc16b321f3","observation_id":"fd45f8b0-9842-42cc-8c33-61a942f2e337","resolution":{"observed_at":"2026-07-04T13:49:51.510271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2503.09501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-09T22:56:37.763786Z","title":"Rema: Learning to meta-think for llms with multi-agent reinforcement learning","venue":"cs.AI","work_id":"7eae456f-aefc-492d-bfbe-5271113323e8","year":2025},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-04T14:08:21.374754Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:da2c4b8aa0fac92571e8b92297cc5d444b62670647903a5fa39a040d1050efbf","observation_id":"6d755d8b-ccb0-41b4-a7e8-8d2bb96f16c4","resolution":{"observed_at":"2026-07-09T22:56:37.765076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-14T03:32:02.298042Z","title":"arXiv preprint arXiv:2503.09501 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11736","last_updated":"2026-07-13T15:59:25Z","snapshot_observed_at":"2026-08-02T18:59:39.647064Z","submitted_at":"2026-07-13T15:59:25Z","title":"MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-14T03:32:02.298042Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2607.11736"},"observation_digest":"sha256:70c0f6df426dd5d5663bf82f0a484cffd8303240273d5410eba64d96a6bae836","observation_id":"27b1aa33-e165-4331-be6f-5a30bce0a4e6","resolution":{"observed_at":"2026-07-14T03:32:02.298042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-30T13:09:01.454452Z","title":"arXiv preprint arXiv:2503.09501 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.454452Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:bff6919c60314aafeef3fea8ef9f69fa254e52e8ebd0fbdff25af8cb21188e01","observation_id":"cf496511-afe6-448c-aa03-daec8daf50ec","resolution":{"observed_at":"2026-07-30T13:09:01.454452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.09501/citation-record","integrity":"/paper/2503.09501/integrity","json":"/paper/2503.09501/citation-record.json","paper":"/paper/2503.09501"},"outbound":[],"paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2503.09501."}