{"as_of":"2026-08-10T06:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:90ada077a14a2a145e24d38b921db379073637e96e6a5262e75554be1d63f990","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:35:14.607554Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T01:04:34.849053Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T12:43:17.310649Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"cited_work":{"arxiv_id":"2505.24378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24378","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.24378 , year=","venue":null,"work_id":"7c9940f4-9973-4441-bbf4-7aca07311eb6","year":null},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2505.24378","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:0ebbd2f24bd720801c8380742598bb4edf07d35b025a25f87aa723f52dea01d7","observation_id":"a56c7209-6758-468a-b56e-c7469ec6d877","resolution":{"observed_at":"2026-05-20T12:43:17.312593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24378","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Mastering massive multi-task reinforcement learning via mixture-of-expert decision transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2505.24378","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:aadbaeceb0807fde2341cb0dd8061ef834bc1b0afc63ac1bd0912c04d93584c7","observation_id":"5e178e4c-d9c0-4f81-a733-df7c239a43f4","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24378","snapshot_observed_at":"2026-07-31T01:04:34.849053Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25108","last_updated":"2026-07-27T22:12:45Z","snapshot_observed_at":"2026-08-10T00:18:57.693622Z","submitted_at":"2026-07-27T22:12:45Z","title":"OPERA: Offline Policy-guided Expert Routing and Adaptation for Universal Biomedical Image Analysis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T01:04:34.849053Z"},"links":{"cited_paper":"/paper/2505.24378","citing_paper":"/paper/2607.25108"},"observation_digest":"sha256:4c32e496c0daecb8fdce5ebbad898edbc0ceffb7d36f321e7f57478ce6ee4022","observation_id":"30b098a4-16bc-4552-8798-af175af70b62","resolution":{"observed_at":"2026-07-31T01:04:34.849053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24378/citation-record","integrity":"/paper/2505.24378/integrity","json":"/paper/2505.24378/citation-record.json","paper":"/paper/2505.24378"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:16.996635Z","title":"Just pick a sign: Opti- 9 Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer mizing deep multitask models with gradient sign dropout","venue":null,"work_id":"c2247c41-9cd7-4673-9c17-f88d786aa4e8","year":null},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:12.769846Z"},"links":{"citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:751dfb734ddeb4842283a70321814e05565e5da01612ee8d49c70f8f21ed8b40","observation_id":"04fddee2-4a6e-4900-a0c7-10930673d72c","resolution":{"observed_at":"2026-08-07T12:35:17.124607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:15.726348Z","title":null,"venue":null,"work_id":"f32a9951-8645-4f69-9256-a85d4eea72bc","year":2022},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:14.327115Z"},"links":{"citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:0c1c1fc15754de45529495242b292edbb12c5c061181938c0dde08b263751b60","observation_id":"2d48a9a4-588f-484f-9032-5d700a9cc86c","resolution":{"observed_at":"2026-08-07T12:35:15.823019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:15.549067Z","title":"• Ant-dir (Rothfuss et al., 2018): We also use 40 tasks in this domain, each with a goal direction uniformly sampled in a two-dimensional plane","venue":null,"work_id":"0dfd4832-db09-47ab-aa5d-3ac91e26a11a","year":2018},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:14.420269Z"},"links":{"citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:6be914ca8f61de729d1b147adc2c3553f5d7fb85bf75af7b277d3f755fbf92fe","observation_id":"b3438e62-21a4-4ab9-93b5-7b3f01391e1b","resolution":{"observed_at":"2026-08-07T12:35:15.642171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18080","last_updated":"2024-05-28T11:41:41Z","snapshot_observed_at":"2026-08-09T22:45:29.382218Z","submitted_at":"2024-05-28T11:41:41Z","title":"HarmoDT: Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2405.18080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.18080","snapshot_observed_at":"2026-08-07T12:35:14.874818Z","title":"HarmoDT: Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning","venue":"cs.LG","work_id":"d106ba04-8cda-4384-8268-6a5aab0f4618","year":2024},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:13.143440Z"},"links":{"cited_paper":"/paper/2405.18080","citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:bf6aa8ede069d8977c188688f80f99cf60a7930a42603e756c57100def462d6e","observation_id":"c1fd07ea-0051-4ac4-97ee-5d344ac90e01","resolution":{"observed_at":"2026-08-07T12:35:14.975476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14972","last_updated":"2025-07-04T08:13:58Z","snapshot_observed_at":"2026-07-06T19:36:19.567469Z","submitted_at":"2024-10-19T04:31:54Z","title":"MENTOR: Mixture-of-Experts Network with Task-Oriented Perturbation for Visual Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14972","snapshot_observed_at":"2026-08-07T12:35:13.229953Z","title":"Mentor: Mixture-of-experts network with task-oriented perturbation for visual rein- forcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:13.229953Z"},"links":{"cited_paper":"/paper/2410.14972","citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:e1304e1f75a526692ac485a8d73c6e020d7b1aa3460f931bbc08abc3e8e76e6e","observation_id":"491630cc-e785-4f44-8c35-d7c214675a63","resolution":{"observed_at":"2026-08-07T12:35:13.229953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T12:35:13.315263Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:13.315263Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:f1989f36d461c86e7d7ae45fbdc1c080a2d180ba4698465088fb8f49c5670f1c","observation_id":"adabe198-b1d7-4dc5-a23c-cd13232e3708","resolution":{"observed_at":"2026-08-07T12:35:13.315263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T12:35:13.487253Z","title":"Offline rein- forcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:13.487253Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:4046b0c520180185d1e80bca8f36bb9bdb328c29b9d9a304e721fc07202cd70c","observation_id":"c59a1b14-129c-4f4c-bb18-50ade672fde3","resolution":{"observed_at":"2026-08-07T12:35:13.487253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08609","last_updated":"2024-06-26T16:50:01Z","snapshot_observed_at":"2026-08-06T08:46:28.213785Z","submitted_at":"2024-02-13T17:18:56Z","title":"Mixtures of Experts Unlock Parameter Scaling for Deep RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08609","snapshot_observed_at":"2026-08-07T12:35:13.564548Z","title":"K., Precup, D., and Castro, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:13.564548Z"},"links":{"cited_paper":"/paper/2402.08609","citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:2bcb470673003821cb11327e04465d8cc7f995687a18a6a790a9aab119355bee","observation_id":"aec23ad6-b798-4e70-80b2-758c11dcea5c","resolution":{"observed_at":"2026-08-07T12:35:13.564548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-08T03:18:33.595658Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-07T12:35:13.654964Z","title":"G., Novikov, A., Barth-Maron, G., Gimenez, M., Sulsky, Y ., Kay, J., Springenberg, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:13.654964Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:328d678cfffcb52c9c6941fe4c548885da5bff5cba20f48db8b4ff0e2a5cb8b4","observation_id":"3678ca9a-82e2-4d80-a191-7c26c438dba8","resolution":{"observed_at":"2026-08-07T12:35:13.654964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.06784","last_updated":"2022-02-11T12:46:43Z","snapshot_observed_at":"2026-08-05T10:35:49.233307Z","submitted_at":"2018-10-16T01:43:51Z","title":"ProMP: Proximal Meta-Policy Search","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.06784","snapshot_observed_at":"2026-08-07T12:35:13.765993Z","title":"Promp: Proximal meta-policy search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:13.765993Z"},"links":{"cited_paper":"/paper/1810.06784","citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:ce7a3b04b3413a05d2dc5a0f667d6c2ee5ac6a3c0c95006351a5a8ef3e1cb530","observation_id":"d7265020-c221-4cef-9738-fccb202a0634","resolution":{"observed_at":"2026-08-07T12:35:13.765993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-07T12:35:13.860623Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:13.860623Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:1900a8f6a03b3711533b3b208af26ebe251f8e7bb776a224ef099db5d2f09d1f","observation_id":"3a1ca864-cf3d-4ad8-bfeb-1bb65cd6e5d3","resolution":{"observed_at":"2026-08-07T12:35:13.860623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T12:35:13.961550Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:13.961550Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:1e3ea520c519f92a5270f80c2613d24c213c6dec1dd65ec3696b848e6f2c9c58","observation_id":"2b36b0e9-bb24-401d-8b6f-dc40103a9cc9","resolution":{"observed_at":"2026-08-07T12:35:13.961550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:16.444927Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"70a600fb-3c29-4b31-b1d8-cb13e1fe1b51","year":2012},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:14.039171Z"},"links":{"citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:b6e2f33f05d1dd3548154e1ed828c021e32ad5617687b14cd10a34014741cc9c","observation_id":"55313269-fe9c-48c5-8669-0975a8de8021","resolution":{"observed_at":"2026-08-07T12:35:16.556325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:16.206039Z","title":"Gradient surgery for multi-task learning","venue":null,"work_id":"237a7f0d-ef3f-4aa5-bd3d-0d0953ece569","year":2018},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:14.179604Z"},"links":{"citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:04f45605b4e92643fbb3208b54b8eb2cc13c820f8eb3b6d98c302edd8e71416d","observation_id":"1df36ed0-c404-4177-9bce-7ad80c6ed786","resolution":{"observed_at":"2026-08-07T12:35:16.313783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:15.998152Z","title":null,"venue":null,"work_id":"84dfabba-e00c-4eeb-818c-c99f28c34dec","year":2018},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:14.241860Z"},"links":{"citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:a23ffd5a2560b00ba97ea1e991025f6625b6e144f8bb99e71e039a4af7698ddf","observation_id":"a4ff5cff-50a1-4265-bd6c-9be30a2a879b","resolution":{"observed_at":"2026-08-07T12:35:16.105061Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:15.306390Z","title":"Specifically, MTDT concatenates an embedding z and a state s as the input tokens, where z is the encoding of task ID","venue":null,"work_id":"f673b72f-47a7-44e3-bcfc-d69180697cb9","year":2022},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:14.541414Z"},"links":{"citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:3a18ff042983192e6141298d0b64ec30fe10e67bcd239abeccbe67be640cb4bd","observation_id":"a6de40cf-6d40-4ef9-9fa8-58304b696205","resolution":{"observed_at":"2026-08-07T12:35:15.434093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:15.117450Z","title":null,"venue":null,"work_id":"186a04a2-251c-4694-b766-e6cdbafc5750","year":2024},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:14.607554Z"},"links":{"citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:c6bf53b8769de462c084d40b6b1c9a1a2a5e181a11fd89c2a5ae855ba07a20a8","observation_id":"ac75b570-90ea-4498-9817-371139bcd9eb","resolution":{"observed_at":"2026-08-07T12:35:15.187832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:14.117474Z","title":"Vaswani, A","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:14.117474Z"},"links":{"citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:2a4d6bfbae8781223f716c78d6876587cba0b5f93957640832995f44d1dd778d","observation_id":"8f98689c-31fd-415b-9586-303d31cb0c54","resolution":{"observed_at":"2026-08-07T12:35:14.117474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16828","snapshot_observed_at":"2026-08-07T12:35:13.006265Z","title":"Td-mpc2: Scalable, ro- bust world models for continuous control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:13.006265Z"},"links":{"cited_paper":"/paper/2310.16828","citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:647976648747de14fcf022aa9aac547181fbf0627253beca1373b64641a1653f","observation_id":"3cd48894-bd5d-48fa-b2b2-8ae8f1ba6026","resolution":{"observed_at":"2026-08-07T12:35:13.006265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09561","last_updated":"2024-01-17T19:31:21Z","snapshot_observed_at":"2026-08-09T18:34:15.384054Z","submitted_at":"2024-01-17T19:31:21Z","title":"Sharing Knowledge in Multi-Task Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09561","snapshot_observed_at":"2026-08-07T12:35:12.837762Z","title":"Sharing knowledge in multi-task deep rein- forcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:12.837762Z"},"links":{"cited_paper":"/paper/2401.09561","citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:ccb993f4f4b1365c7c61623d339f3161e0ffc0a02e7d2f2c72fb88052ae2554c","observation_id":"6bdd67e9-d369-45f6-b848-1100e2971cc9","resolution":{"observed_at":"2026-08-07T12:35:12.837762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:12.695169Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:12.695169Z"},"links":{"citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:ab99f0c1e5b7bf6afe989167dfe60dbe72602bc15db9618e0b4f07cb11320734","observation_id":"f9ba0b2f-03ca-4529-87c1-5b0b862d5916","resolution":{"observed_at":"2026-08-07T12:35:12.695169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-07T12:35:13.393018Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:13.393018Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:ad97808d4885eb5eac6b3127d3ab2337d0366df2a3aae3ef5706c6ac8a91200b","observation_id":"338a3872-7299-4d8d-b0c0-3af546ca05ae","resolution":{"observed_at":"2026-08-07T12:35:13.393018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11385","last_updated":"2024-05-05T16:04:52Z","snapshot_observed_at":"2026-07-06T16:49:41.895773Z","submitted_at":"2023-11-19T18:09:25Z","title":"Multi-Task Reinforcement Learning with Mixture of Orthogonal Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11385","snapshot_observed_at":"2026-08-07T12:35:13.079539Z","title":"Multi-task rein- forcement learning with mixture of orthogonal experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:13.079539Z"},"links":{"cited_paper":"/paper/2311.11385","citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:127d3035af54842730109aa458eeb962f21bdc12cd44aa8c7b7083d45ddf1482","observation_id":"998767c1-e8e4-42ac-935d-36bbe357f3fd","resolution":{"observed_at":"2026-08-07T12:35:13.079539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:16.674385Z","title":"Loramoe: Alleviating world knowledge forgetting in large language models via moe-style plugin","venue":null,"work_id":"29100114-8a09-46d7-83bf-ba07fc1669ce","year":1932},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:12.916188Z"},"links":{"citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:451c4a1275ebcc1aabd33f5fc4451ff4872f8275c38f396bc149135741bff356","observation_id":"213688c6-2ada-451b-8f1b-8a205f367258","resolution":{"observed_at":"2026-08-07T12:35:16.842676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T15:40:29.502616Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 3 inbound Pith citation observations for arXiv:2505.24378."}