{"as_of":"2026-08-12T08:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97bfbccfc1e267c27518a6c1c2882cd7eb7169be62d6ac5b45e1fe39afc763f5","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:54:15.234655Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.11818/citation-record","integrity":"/paper/2501.11818/integrity","json":"/paper/2501.11818/citation-record.json","paper":"/paper/2501.11818"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.963124Z","title":"Averaged-dqn: Variance reduction and stabilization for deep reinforcement learning","venue":null,"work_id":"55e72233-b777-4764-b2fd-9ced58ad764e","year":2017},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:14.997877Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:4c7501ca4bbb2a16182e881328b20c0016a25bbca60310a9287980dbd60f2690","observation_id":"d595296c-277c-4c08-afcd-25cc24ae2f1d","resolution":{"observed_at":"2026-08-10T17:54:15.969401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.004322Z","title":"The arcade learning environment: An evaluation platform for general agents","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.004322Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:091470a5fb76b4ae89f26f6030cb836be9bebbf94021ea54e7776c439b94f2ab","observation_id":"43195795-b596-49ed-9140-ff6393c7882c","resolution":{"observed_at":"2026-08-10T17:54:15.004322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.933851Z","title":"Bagging predictors","venue":null,"work_id":"f75750d6-7509-48c2-93e0-9e9996f11b44","year":1996},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.011053Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:24cd3d830b7cc9e3bcf4365728eaa6cfd9a2121a64e72673b043e06c6803bcf3","observation_id":"ee6d6feb-50b3-4911-9366-50b374d44232","resolution":{"observed_at":"2026-08-10T17:54:15.939736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.018051Z","title":"Openai gym, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.018051Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:0239577f659990df35e7eb6fd96a50bece297fb302a0d84aeb68237ef14f03b5","observation_id":"b707fcc8-526d-4d26-917e-9bfb71b54486","resolution":{"observed_at":"2026-08-10T17:54:15.018051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.01502","last_updated":"2017-11-07T20:45:59Z","snapshot_observed_at":"2026-08-11T11:25:34.419365Z","submitted_at":"2017-06-05T19:01:26Z","title":"UCB Exploration via Q-Ensembles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.01502","snapshot_observed_at":"2026-08-10T17:54:15.024862Z","title":"Ucb exploration via q-ensembles","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.024862Z"},"links":{"cited_paper":"/paper/1706.01502","citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:5eacb49f85fa8da3e3be5dc68d07180c06ced6aab27169039e030c9022a84cc3","observation_id":"3bc65c9a-76bd-44ee-bba8-a9a87a2fa851","resolution":{"observed_at":"2026-08-10T17:54:15.024862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.902393Z","title":"Ensemble network architecture for deep reinforcement learning","venue":null,"work_id":"118986af-6639-4658-81f5-273b6f771849","year":2018},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.031318Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:b2cb51625307258c4bb1335f1b8bf001200f73ac5e98d836364b874d16b6afbb","observation_id":"eb0b5f0d-a2ed-42bc-b898-ff5bf253ea23","resolution":{"observed_at":"2026-08-10T17:54:15.909535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.879337Z","title":"Shared experience actor-critic for multi-agent reinforcement learning","venue":null,"work_id":"f265b099-cd34-4a66-b5ab-2c9915f760b4","year":2020},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.038372Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:8fd99797fc779112d50d53ae04764b5f9db123a1c566c8d99dc0039803b75f09","observation_id":"82bb5e4d-71fe-4604-ba6d-915d8f8e0541","resolution":{"observed_at":"2026-08-10T17:54:15.885021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.859759Z","title":"Off-policy actor-critic","venue":null,"work_id":"b7a4673b-480b-4352-a505-cedd017395a4","year":2012},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.043574Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:d3fa708beff8e855ea0b6703b48956d9a30d2457585d59c1780ff8e13fdea999","observation_id":"1d699731-5b88-4391-846e-5b98ac3c1763","resolution":{"observed_at":"2026-08-10T17:54:15.866951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.048448Z","title":"Openai baselines","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.048448Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:84c7bf476ac8c3d539aded936ec79fea9567f86edc00635e766e3454d741f0bc","observation_id":"14becfc5-eee5-493e-b41e-115e2554285b","resolution":{"observed_at":"2026-08-10T17:54:15.048448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.827976Z","title":"Ensembles for continuous actions in reinforcement learning","venue":null,"work_id":"4481be11-fabe-454c-b233-b2baaf8f6437","year":2013},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.054101Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:ee99bf60aa8c2b39036aa14ece5b40d7932cf4ffb2c8846d80bba535440a7ac5","observation_id":"0286253b-91c1-4d0e-a464-5688661beb18","resolution":{"observed_at":"2026-08-10T17:54:15.834345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.808309Z","title":"Ensemble methods for reinforcement learning with function approximation","venue":null,"work_id":"f2ed7c69-9f70-463d-b46a-8008bd1832aa","year":2011},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.059019Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:90e732428c20f2da02a410adc9fdd38470e3a1737b3b88766c341b179a6e8027","observation_id":"4f4762f9-0b4d-46ca-8a8e-fbdc59f637de","resolution":{"observed_at":"2026-08-10T17:54:15.815147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.787617Z","title":"Neural network ensembles in reinforcement learning","venue":null,"work_id":"fb48674d-f64a-4ffa-86c2-ee9ff917bbea","year":2015},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.064125Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:c9fc4d42c13afe1dec5b89c3574b9998d9ac85dea5b9abcb7287e65f13886bf6","observation_id":"2972a5a8-2a9c-432e-aeaf-d6faf51c2305","resolution":{"observed_at":"2026-08-10T17:54:15.793680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.765757Z","title":"Selective neural network ensembles in reinforcement learning: taking the advantage of many agents","venue":null,"work_id":"cbb4299c-0e84-497c-8cff-8d532bf60d5b","year":2015},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.069413Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:e6d5a3dd84916e17847204d8375d8a4e3d9d7fc4605cd6894580d2a83c840d31","observation_id":"555d45d6-574d-4d47-904f-3a955b08c49c","resolution":{"observed_at":"2026-08-10T17:54:15.773761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.747639Z","title":"A short introduction to boosting","venue":null,"work_id":"14da8161-4898-443c-91db-72a0d0bd4f27","year":1999},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.074586Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:42e0f7e9772a3163cd2ca1cd727f4d1a62683b292d4c70e3034cf680be677aad","observation_id":"090c9a3c-5be9-4c3a-ad25-ac9c008c7680","resolution":{"observed_at":"2026-08-10T17:54:15.752921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.078798Z","title":"Random decision forests","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.078798Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:c38314f12eed20a4f03a06f882a100a29257a3f7411a757483e63aeadeb7137b","observation_id":"59fd98ba-7c9a-4e27-bb28-58a9f28cf4d9","resolution":{"observed_at":"2026-08-10T17:54:15.078798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.716178Z","title":"Sunrise: A simple unified framework for ensemble learning in deep reinforcement learning","venue":null,"work_id":"d5174d0d-400c-4654-b2b2-0f519bb642e0","year":2021},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.083608Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:3f4346e8b785f9cc2bf14aefeb95c1a1cca36a54caf225dfe4236caac8fa315b","observation_id":"b7b66beb-958d-47de-875f-938149b2dcaf","resolution":{"observed_at":"2026-08-10T17:54:15.722281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.088060Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.088060Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:1978fe614217dbad3aaa0bd07a8aaac84702df6b5a6140d0f6cd814804c692fa","observation_id":"1eb34c0a-bee9-4f0f-b98d-b81eb892f234","resolution":{"observed_at":"2026-08-10T17:54:15.088060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.093554Z","title":"Maven: Multi-agent variational exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.093554Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:70cd26179c4af13d587b198c1748ce70e3f96b58c5e23137155474d725867be1","observation_id":"25444412-39e7-423d-885a-62a80e201cd3","resolution":{"observed_at":"2026-08-10T17:54:15.093554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.665176Z","title":"Albert bandura's social learning theory","venue":null,"work_id":"7df3028c-e687-4f04-9d15-b0118e7f82df","year":2011},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.099165Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:a1121e68fda5c1411551f21dd26c7a46768dc6c1f643cc6334e256d1f997022d","observation_id":"8e3c511e-eebc-48f4-9043-b8037ae09128","resolution":{"observed_at":"2026-08-10T17:54:15.670740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-10T17:54:15.110802Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.110802Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:7736b0fb297620fad43b25bbede8ea8110248e7205fbb12d609786b65db7fb3b","observation_id":"456a951c-a068-44b4-949e-c68f1487e35d","resolution":{"observed_at":"2026-08-10T17:54:15.110802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.650184Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"97f6bebd-0559-4b05-b8ef-ad09579691a5","year":1928},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.116403Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:7dd776e80b3bc80ed0a4f6532259ffe110ae6afcccb27a61c92337621391b8bf","observation_id":"cd848281-db10-43ca-9afd-c39c8537c975","resolution":{"observed_at":"2026-08-10T17:54:15.654761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.121860Z","title":"Safe and efficient off-policy reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.121860Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:896508fa04d5d2893e38758358707b10ad20239d9a82435b2d6f404527ec8e75","observation_id":"b83a95b7-a211-4b2a-8cf6-4fe325aa7289","resolution":{"observed_at":"2026-08-10T17:54:15.121860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.622391Z","title":"Split feature space ensemble method using deep reinforcement learning for algorithmic trading","venue":null,"work_id":"208f4637-cac4-4833-af64-9038f6711ed1","year":2022},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.127037Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:e4ba79133b0573c9b516aead240f3a441dfa9fac079ec019debeb79ce9ce93a0","observation_id":"5aca90c9-08a5-420c-a45d-7034708e33fa","resolution":{"observed_at":"2026-08-10T17:54:15.627854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.131836Z","title":"Deep exploration via bootstrapped dqn","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.131836Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:3bfb5f8f81bc04d8334d68a5901cbea43e66d43c9f3320671a278743255b0f2b","observation_id":"a6530f2e-fa8d-4947-9e89-a76c2a190a48","resolution":{"observed_at":"2026-08-10T17:54:15.131836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.10069","last_updated":"2017-09-14T12:45:46Z","snapshot_observed_at":"2026-07-06T05:35:43.650268Z","submitted_at":"2017-03-29T14:37:25Z","title":"Multiagent Bidirectionally-Coordinated Nets: Emergence of Human-level Coordination in Learning to Play StarCraft Combat Games","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.10069","snapshot_observed_at":"2026-08-10T17:54:15.137387Z","title":"Multiagent bidirectionally-coordinated nets: Emergence of human-level coordination in learning to play starcraft combat games","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.137387Z"},"links":{"cited_paper":"/paper/1703.10069","citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:886ec3f943b613d289ed5a6b5dc4070899f640988a47d19c22ce4d8fbfc6aa1d","observation_id":"5255880e-2a30-41ca-bd3a-eb7f87f61577","resolution":{"observed_at":"2026-08-10T17:54:15.137387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.582498Z","title":"Value propagation for decentralized networked deep multi-agent reinforcement learning","venue":null,"work_id":"3d482d3b-6f51-4fd4-8743-dda898d7f074","year":2019},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.143019Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:87ae388df102a0091e9067d8f38f1dda5c8bcb980356e88f13029f4253e52833","observation_id":"5c2248b4-76e2-49d5-aa46-426133c41cf5","resolution":{"observed_at":"2026-08-10T17:54:15.592590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.564292Z","title":"Qmix: Monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":"3e855c5f-1804-4a32-81fb-32c3bef96835","year":2018},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.148184Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:a61e6c1dbe4c964734f5a1d217c271925d9860d6f990d7a04cbdb74801d41858","observation_id":"ec593ee5-6ac1-4247-bcf2-256062858e31","resolution":{"observed_at":"2026-08-10T17:54:15.570061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.545592Z","title":"Seerl: Sample efficient ensemble reinforcement learning","venue":null,"work_id":"2a7e5288-a61d-4aac-b659-aa4e36ccb955","year":2021},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.153467Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:96e06e32a2ae26277a3a88cb969c64dc205f41483fd9e1989e616686ff72dbfd","observation_id":"3ee1cce3-8c26-4560-bed4-64d6bd817061","resolution":{"observed_at":"2026-08-10T17:54:15.552348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.158894Z","title":"Mastering atari, go, chess and shogi by planning with a learned model","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.158894Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:02429625682108e2d0bdce0858b01f2714166c28201621ee0334c9f06adfab24","observation_id":"237fb3b6-8f96-4119-a331-c8cd588a2b3a","resolution":{"observed_at":"2026-08-10T17:54:15.158894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T17:54:15.164598Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.164598Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:6ae15bfa347745748349bddc80617c3cd37065186b0a1fbddd7b6d23d5ebdc52","observation_id":"113e25bb-c575-4a37-b0bf-61cf7d9a143d","resolution":{"observed_at":"2026-08-10T17:54:15.164598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.170504Z","title":"Mastering the game of go with deep neural networks and tree search","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.170504Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:3152f26059b2495465204e8b15e14e73a26a78ea0ecd6123c26d69404cf9838d","observation_id":"1399ff49-cc67-4eb3-8cf8-04c0182f3027","resolution":{"observed_at":"2026-08-10T17:54:15.170504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.175872Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.175872Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:9d03cd6f293b811e9ff36ff7f7e913effcd0206e09ba23a3b87d43cfb8826b70","observation_id":"3fa27d88-a114-4b10-ba7b-f4f56a85f5d4","resolution":{"observed_at":"2026-08-10T17:54:15.175872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.181282Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and go through self-play","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.181282Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:8a70af0fcb5132844f86bb5a245161c440d964fa2a9990c1c718a582a6a45c38","observation_id":"bb7ebe73-58a2-47e4-813b-c7c8550ccd37","resolution":{"observed_at":"2026-08-10T17:54:15.181282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.483149Z","title":"Pebl: Pessimistic ensembles for offline deep reinforcement learning","venue":null,"work_id":"9dc86b48-5dd9-4017-8117-6e4fbe6606c2","year":2021},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.186840Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:b9fb027859de327bf39ea306db9b01d706cafc71584794615b84ef38e3eb44f5","observation_id":"51bb53a8-36a0-4127-b8e5-ee6413dabdab","resolution":{"observed_at":"2026-08-10T17:54:15.489338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.192365Z","title":"Learning multiagent communication with backpropagation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.192365Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:1dadd4e76cdc935ba9a8a35229cc79f1fa8e836b9708e49beb3dae6db780d3d1","observation_id":"12daf5e4-7578-4648-987a-bf530f3f22a9","resolution":{"observed_at":"2026-08-10T17:54:15.192365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.454569Z","title":"Value-decomposition networks for cooperative multi-agent learning based on team reward","venue":null,"work_id":"490b69f0-ab3a-4418-9337-135b53b62229","year":2018},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.198358Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:a3c16d0e7e2f189a43fedaef052c39ac53eb12dfe228a0b9a9108c6058ec6d69","observation_id":"2def070e-00c4-4d1c-9600-031cf11c2d00","resolution":{"observed_at":"2026-08-10T17:54:15.460279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.431821Z","title":"Roma: multi-agent reinforcement learning with emergent roles","venue":null,"work_id":"5e4cf019-a1ee-4096-ab85-18929ef401e2","year":2020},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.204400Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:0185f6ee7b808210910bca26725243ebd852a3bfece4296bc4c9419256f54ebd","observation_id":"21b145dc-394a-4ca6-bdb2-bd4c239c35e4","resolution":{"observed_at":"2026-08-10T17:54:15.436989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.415537Z","title":"Fcmnet: Full communication memory net for team-level cooperation in multi-agent systems","venue":null,"work_id":"4fd42c22-9e3e-46fd-953f-b62229eb0fe3","year":2022},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.210621Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:b8be58bd275661d25429a713d67c55d4ebd680b88437d1b8b7a311e5104ac62d","observation_id":"a28a96d2-a4e3-44e4-88a6-dee6acd00930","resolution":{"observed_at":"2026-08-10T17:54:15.420576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.399645Z","title":"Sample efficient actor-critic with experience replay","venue":null,"work_id":"a1a727f3-529f-487d-971c-3de119c9f625","year":2017},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.216561Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:7b7b5b4b7beb36a763030322a3a4b7cc58ee966af097acb2856837e75d03b33b","observation_id":"39711266-bde9-4978-af7b-1137f7331254","resolution":{"observed_at":"2026-08-10T17:54:15.404722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.222445Z","title":"Ensemble algorithms in reinforcement learning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.222445Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:d6cb81361f366532320c593f8b7eb57e12c26ef5c525455f912a1a775434be5b","observation_id":"bd7b7e09-74b6-4935-9fb9-7ec03857bd59","resolution":{"observed_at":"2026-08-10T17:54:15.222445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.372232Z","title":"Group-agent reinforcement learning","venue":null,"work_id":"88a6d512-e27a-4351-8edd-67ecc7b921e3","year":2023},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.228522Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:44109446afe7389784e1912b9de29044b27ad3a80d179587fdcc96551c1733eb","observation_id":"4d437267-2f75-453d-807f-181ae26111a9","resolution":{"observed_at":"2026-08-10T17:54:15.377611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:54:15.351870Z","title":"Deep reinforcement learning for automated stock trading: An ensemble strategy","venue":null,"work_id":"e7996c61-2fb5-4376-b8c1-8a13221d4c04","year":2020},"citing_paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T17:54:15.234655Z"},"links":{"citing_paper":"/paper/2501.11818"},"observation_digest":"sha256:cb2f7c821e51a4abd58d50258e2fd6839c843416e7cbb18f359f0232ea626775","observation_id":"dee14331-9472-4490-8eba-2c7a3a56d683","resolution":{"observed_at":"2026-08-10T17:54:15.359213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.11818","last_updated":"2025-02-15T10:24:09Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T02:23:10.063673Z","submitted_at":"2025-01-21T01:56:33Z","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2501.11818."}