{"as_of":"2026-08-21T15:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a74ea94e4b634851b023c7ac662552ab8b157cc13f2d2d8396b1eb8bb8d45677","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:11:51.843712Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T22:11:35.277901Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"cited_work":{"arxiv_id":"2507.18867","doi":"10.48550/arxiv.2507.18867","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.18867","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning","venue":"ArXiv.org","work_id":"2cc7f2de-61c5-45fd-b748-cf523e17e330","year":null},"citing_paper":{"arxiv_id":"2605.12655","last_updated":"2026-06-10T15:03:44Z","snapshot_observed_at":"2026-08-14T11:53:55.360220Z","submitted_at":"2026-05-12T19:01:16Z","title":"Robust Instruction Compliance in Cooperative Multi-Agent Reinforcement Learning","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:35.277901Z"},"links":{"cited_paper":"/paper/2507.18867","citing_paper":"/paper/2605.12655"},"observation_digest":"sha256:9e0b041cec811e19b9af81a2ee717348f68588f81b87242111940ed609f95a89","observation_id":"4595a430-4bdd-4eb1-a04b-a8175adb6fd6","resolution":{"observed_at":"2026-06-30T22:15:06.017440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.18867/citation-record","integrity":"/paper/2507.18867/integrity","json":"/paper/2507.18867/citation-record.json","paper":"/paper/2507.18867"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.341564Z","title":"An overview of recent progress in the study of distributed multi-agent coordination,","venue":null,"work_id":"b9fd086e-9cc9-4131-b4cd-7739063c4892","year":2012},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.721038Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:e20b6c9066c019be7c78110ebcf0658f61641bd9381cbc4196f0497a40d98645","observation_id":"86df1eb7-31ff-499f-8a05-7582d87f2d42","resolution":{"observed_at":"2026-08-15T18:11:52.346192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.328674Z","title":"Coordinated multi-agent reinforcement learning in networked distributed pomdps,","venue":null,"work_id":"255accc8-c980-4907-90f6-a87861ed1e83","year":2011},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.725330Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:ef0cb1e29950acbd0c557d543106f27530e4e457869bd484b4f89194bedecc41","observation_id":"7aae10c2-ec9c-40f6-a210-59ccbd00f5a4","resolution":{"observed_at":"2026-08-15T18:11:52.332714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.312413Z","title":"Interpretation of neural networks is fragile,","venue":null,"work_id":"f5716963-f06a-4527-a257-704905eb0ecb","year":2019},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.729192Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:18e098ba580d399c8f1754a22757d3e3c377769f884eeee5f289d48ec8ed6a82","observation_id":"928bbe21-dea1-4800-92a2-d5c09fa0eed6","resolution":{"observed_at":"2026-08-15T18:11:52.319777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06011","last_updated":"2017-09-18T15:37:45Z","snapshot_observed_at":"2026-08-14T20:32:08.595924Z","submitted_at":"2017-09-18T15:37:45Z","title":"Guided Deep Reinforcement Learning for Swarm Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06011","snapshot_observed_at":"2026-08-15T18:11:51.732896Z","title":"Guided deep reinforce- ment learning for swarm systems,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.732896Z"},"links":{"cited_paper":"/paper/1709.06011","citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:fe5993af27816c1fa6523090a956582fbcd7dbf4e1f6b5935a4fe380ee555e50","observation_id":"f02dc4b7-aa54-4ba2-83bc-20b554f92d04","resolution":{"observed_at":"2026-08-15T18:11:51.732896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.284632Z","title":"Q-value path decomposition for deep multiagent reinforce- ment learning,","venue":null,"work_id":"920f8704-8620-43a1-9ec9-92aa77a752fb","year":2020},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.737474Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:44723a43471b0690a94818bbac9fd82fb165aececc134e1051d7c0910e0eacb1","observation_id":"0ae5c23c-fd1b-49c2-8e86-f864dec45f2a","resolution":{"observed_at":"2026-08-15T18:11:52.291297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.269034Z","title":"RODE: Learning roles to decompose multi-agent tasks,","venue":null,"work_id":"fe368249-6320-407a-b5e4-d02c25b2e2a0","year":2020},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.741371Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:576b05da56ce064538542c9eb33c507e812b0feec63251eb348b921ac4e8d9df","observation_id":"f6ec4a4e-66db-4745-9627-d47e0086627b","resolution":{"observed_at":"2026-08-15T18:11:52.275210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.247366Z","title":"ROMA: Multi-agent reinforcement learning with emergent roles,","venue":null,"work_id":"cac16629-6168-4e25-bb6f-c00db790bab5","year":2020},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.745927Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:a0978cb2464339384bf5af5ea142fed6c7cfad72ab80fcfdcb4cb7c296018d31","observation_id":"dc522ff2-f8d9-4f2d-8920-66be7dec5564","resolution":{"observed_at":"2026-08-15T18:11:52.251242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.234581Z","title":"Value-decomposition networks for cooperative multi-agent learning based on team reward,","venue":null,"work_id":"0f464478-be28-444b-ad93-9ef8294890e1","year":2018},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.749662Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:68e11958e688a890ce232c3119db322d9f5ad87d1d264d3c9afdf9f7d8b7ea87","observation_id":"17163ee2-9a0a-4b59-8fa9-6e68f2bfd633","resolution":{"observed_at":"2026-08-15T18:11:52.238985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.220298Z","title":"QMIX: Monotonic value function factorisation for deep multi-agent reinforcement learning,","venue":null,"work_id":"a25a3a5c-7014-4678-ae34-ec03030e6f18","year":2018},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.753469Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:5d29522ee1bf08dbfb45b0e05c3bfec28da480fb993f26ee07ca373010766b5a","observation_id":"72450c64-c9f6-4d6b-a816-b14b5614cc75","resolution":{"observed_at":"2026-08-15T18:11:52.225317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.207220Z","title":"QPLEX: Duplex dueling multi-agent Q-learning,","venue":null,"work_id":"af25bcdc-f676-4d6d-b552-c56902305935","year":2020},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.757145Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:e733c51b8d70a43b7ccee36abfdfc9da8860bb18b46188295b332d4e31187498","observation_id":"7644ba24-bc25-4d19-b215-65910de58041","resolution":{"observed_at":"2026-08-15T18:11:52.211438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:51.760852Z","title":"Mixrts: Toward interpretable multi-agent reinforcement learning via mixing recurrent soft decision trees,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.760852Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:5616dbb08ea158c8625b83f92d099313c61bdb0f9c18d359faea36b7b945fc51","observation_id":"dd050ab3-74cd-4686-a4dd-6b607000b8a6","resolution":{"observed_at":"2026-08-15T18:11:51.760852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.185307Z","title":"NA 2Q: Neural attention additive model for interpretable multi-agent q-learning,","venue":null,"work_id":"611638c2-c347-43c5-916d-af31237f3eab","year":2023},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.765266Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:b4f3133eab3160160dacf39b18e8361c466b2437840b35e518fa745efc9c5e7e","observation_id":"7a55ea35-d8c7-4c25-b52b-79801420ac5c","resolution":{"observed_at":"2026-08-15T18:11:52.190260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.171880Z","title":"A comprehensive survey of multiagent reinforcement learning,","venue":null,"work_id":"22a36d6d-707a-4fa0-b63b-7bade732ee44","year":2008},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.769428Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:ec2d649248be0ba167200989b3e76bcddbbcfe4ed782926af63bea00c0e4c92b","observation_id":"f4847e28-195d-45e3-b790-be2c8c1e4fec","resolution":{"observed_at":"2026-08-15T18:11:52.176156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.151370Z","title":"Dynamic agent-based reward shaping for multi-agent systems,","venue":null,"work_id":"8432a9e5-8a4a-4599-a00c-28f2e0dd65e5","year":2014},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.773617Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:924f8cc07fbb82c5616be31444d7c72da7b7b8c4c50cd22f10bb1092594726ea","observation_id":"cd4549f7-d7b7-467e-847c-81185da4cabc","resolution":{"observed_at":"2026-08-15T18:11:52.157085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15691","last_updated":"2022-10-12T18:19:12Z","snapshot_observed_at":"2026-08-20T02:55:33.492178Z","submitted_at":"2021-06-29T19:53:15Z","title":"Deep Multiagent Reinforcement Learning: Challenges and Directions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15691","snapshot_observed_at":"2026-08-15T18:11:51.777431Z","title":"Multiagent deep reinforcement learning: Challenges and directions towards human-like approaches,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.777431Z"},"links":{"cited_paper":"/paper/2106.15691","citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:6c59cd7e709bd8c509db5a084bd49ad586ea2f8d930c106fe28e02db00090428","observation_id":"135661cd-6a0e-4ecf-9350-bc2dede56e62","resolution":{"observed_at":"2026-08-15T18:11:51.777431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.134921Z","title":"Cooperative exploration for multi-agent deep reinforcement learning,","venue":null,"work_id":"773dd827-d8fb-4c2c-8c4d-272e7808be04","year":2021},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.781506Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:61b03a82a5ee3c53f0ab464f80d54368c0d7b21bd03cf11b08707c702c765f42","observation_id":"c2afbab4-841b-45e2-a6c2-6f345f056307","resolution":{"observed_at":"2026-08-15T18:11:52.139282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.120615Z","title":"Maven: Multi-agent variational exploration,","venue":null,"work_id":"7fab81f8-c325-4600-ad4c-404af2dc0510","year":2019},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.785349Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:323084e1b4750c1db4294e46a07f3388ce1aae12de4a39ec762ab38c07c47864","observation_id":"df13e225-1866-4ce0-8d4a-c80628d35866","resolution":{"observed_at":"2026-08-15T18:11:52.124487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.107745Z","title":"Liir: Learning individual intrinsic reward in multi-agent reinforcement learning,","venue":null,"work_id":"ec4cba57-c31b-4b7c-917a-6cc8b3f704fe","year":2019},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.788773Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:87b248f47f2392e515423cb49675c13448976126569699c6823fa1345a9dbf17","observation_id":"cb4634f4-e8f4-4aa7-9e1b-188afe0bbfb8","resolution":{"observed_at":"2026-08-15T18:11:52.112144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.094722Z","title":"MASER: Multi-agent reinforcement learning with subgoals generated from experience replay buffer,","venue":null,"work_id":"d3678c51-11bb-4621-a21e-d5159e9aad61","year":2022},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.792385Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:b9690eee0774b466839798b1cea51b9d0a344966adc2438dd11f6473b8d2eb7a","observation_id":"e152f0ad-e6b0-4619-be9d-de4d721080e5","resolution":{"observed_at":"2026-08-15T18:11:52.099099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.082451Z","title":"Individual reward assisted multi-agent reinforcement learning,","venue":null,"work_id":"224dbffa-6a7a-4ddf-af14-6845f8e58cfa","year":2022},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.796299Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:91150b108918b5da3b0f2147b716f64593917c0eb7e10e50351778877fc56b46","observation_id":"4c71277c-3f95-4217-ad70-7494054548b5","resolution":{"observed_at":"2026-08-15T18:11:52.086940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.069318Z","title":"Haven: hierarchical cooperative multi-agent reinforcement learning with dual coordination mechanism,","venue":null,"work_id":"7a23212a-d39d-4622-9d80-f60bfba61071","year":2023},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.799555Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:f9685bc22077b0c7d81734d130e9f4d259765d82ee52ad1888248cc93deb1791","observation_id":"0bd24b21-7f41-4da1-84a3-ca66dac89248","resolution":{"observed_at":"2026-08-15T18:11:52.074201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.03444","last_updated":"2020-09-29T01:15:05Z","snapshot_observed_at":"2026-08-13T21:54:35.825619Z","submitted_at":"2020-08-08T04:56:30Z","title":"Hierarchical Reinforcement Learning in StarCraft II with Human Expertise in Subgoals Selection","version":3},"cited_work":{"arxiv_id":"2008.03444","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.03444","snapshot_observed_at":"2026-08-15T18:11:51.906999Z","title":"Hierarchical Reinforcement Learning in StarCraft II with Human Expertise in Subgoals Selection","venue":"cs.AI","work_id":"708a1152-cf18-40b4-a8d6-a0e3dfdaccbd","year":2020},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.803074Z"},"links":{"cited_paper":"/paper/2008.03444","citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:b3d97a083347976df68eb13650380520282d1de23bae9c85417d119d4fd7c17d","observation_id":"6b51b7fa-82ed-4b49-a18c-f78853a97a1d","resolution":{"observed_at":"2026-08-15T18:11:51.913702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.056194Z","title":"Dl2: training and querying neural networks with logic,","venue":null,"work_id":"73eaeb31-0694-4489-898c-c9d4fb8122d3","year":2019},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.806607Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:a1f9c6f88178fc1de08dbc309a214253555e93221408f8cfb9f7a3f3a4debddf","observation_id":"b0495970-2ab0-467c-9552-02fae64ee742","resolution":{"observed_at":"2026-08-15T18:11:52.060717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.042678Z","title":"Rule-based reinforce- ment learning for efficient robot navigation with space reduction,","venue":null,"work_id":"78946772-a687-4804-85a1-856fb3b4eb5e","year":2022},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.811090Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:118eed3154fa455953bac27512a66356b8b8ba1acf1a5048d9d1dd6f2354abe4","observation_id":"47143ef4-d7de-4bbb-96df-ecc229f0b9ad","resolution":{"observed_at":"2026-08-15T18:11:52.047291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.022679Z","title":"Extracting decision tree from trained deep reinforcement learning in traffic signal control,","venue":null,"work_id":"ca7dc549-40be-401b-957f-b90a16c55433","year":1997},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.814905Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:13f9a21812dad0ff78bf49864c0f17c794a86502686050d12c576a3b9be69e24","observation_id":"ff1811f7-7cea-4374-9ce0-e181e1928c31","resolution":{"observed_at":"2026-08-15T18:11:52.030720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07418","last_updated":"2020-05-21T07:02:41Z","snapshot_observed_at":"2026-08-13T23:29:31.450991Z","submitted_at":"2020-02-18T07:58:27Z","title":"KoGuN: Accelerating Deep Reinforcement Learning via Integrating Human Suboptimal Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07418","snapshot_observed_at":"2026-08-15T18:11:51.819017Z","title":"Kogun: accelerating deep reinforcement learning via integrating hu- man suboptimal knowledge,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.819017Z"},"links":{"cited_paper":"/paper/2002.07418","citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:66d7c8c063cb5f7fa9d583dd7f8927536f6857e6e9f43dfe6a8e6a1903da7f67","observation_id":"3139a28d-2881-4a15-adec-4878867ed2ae","resolution":{"observed_at":"2026-08-15T18:11:51.819017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:52.000521Z","title":"QTRAN: Learning to factorize with transformation for cooperative multi-agent reinforcement learning,","venue":null,"work_id":"84e10e3d-507b-4254-b99f-59a9d93e402e","year":2019},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.824232Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:a05538810196e1d270a57806c0cc6ed00ec96e05763306d3f1fbd7deca49426b","observation_id":"81a19c4a-408d-451b-b086-272ac28135e1","resolution":{"observed_at":"2026-08-15T18:11:52.005740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:51.985747Z","title":"Exploration with unreliable intrinsic reward in multi-agent reinforcement learning,","venue":null,"work_id":"1b8538e7-173e-47bf-837e-ea3036ee4e73","year":2019},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.828539Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:de938a4af0c96f5f0bebc3baee98caa1b0f978a2e809c783cd9bb5c05307d6b1","observation_id":"c6b5f62d-b164-4fc5-949d-95b81035ffcf","resolution":{"observed_at":"2026-08-15T18:11:51.990828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:51.972206Z","title":"Discovering generalizable multi-agent coordination skills from multi-task offline data,","venue":null,"work_id":"4a9b021f-5815-4060-bfe8-5ddb5918c77a","year":2023},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.833112Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:ec24ee7fdc211f329eb6b46e450baf3cf567ec3fc768b505e29b0fb18d3dfaa3","observation_id":"4e73d029-9e32-4d44-a71f-1a45254f122b","resolution":{"observed_at":"2026-08-15T18:11:51.977204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:51.959705Z","title":"Shared experience actor- critic for multi-agent reinforcement learning,","venue":null,"work_id":"1e4c650f-9214-428e-bfaf-f4de7c0f3a49","year":2020},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.837940Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:c2a5a0aad723962994edbe3a597f188abb989d1d76febc5f21ee1904e3c66d71","observation_id":"b16e8539-3a27-4d54-afe7-78d763cbaf48","resolution":{"observed_at":"2026-08-15T18:11:51.963741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:51.948083Z","title":"The StarCraft Multi-Agent Challenge,","venue":null,"work_id":"5175f9ea-1d0b-4f88-89ad-e40531602bf8","year":2019},"citing_paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:51.843712Z"},"links":{"citing_paper":"/paper/2507.18867"},"observation_digest":"sha256:e226b30d2b7cb78b77ef904b5892fdb58fb4019f65617878d33c6899565ae505","observation_id":"2f20e365-ddce-4432-a5f0-8a1708048f2e","resolution":{"observed_at":"2026-08-15T18:11:51.951454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.18867","last_updated":"2025-07-25T00:59:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T21:21:39.755263Z","submitted_at":"2025-07-25T00:59:10Z","title":"Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2507.18867."}