{"as_of":"2026-08-18T08:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e0078674e66b16adbe8aee2eab8acb9532108eeaadd7d7113c116fcd58ba753b","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:49:59.794278Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.22310/citation-record","integrity":"/paper/2509.22310/integrity","json":"/paper/2509.22310/citation-record.json","paper":"/paper/2509.22310"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:50:00.149090Z","title":"degenerate","venue":null,"work_id":"f638abf4-f104-4277-bdea-d27d411e808f","year":2017},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.794278Z"},"links":{"citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:1e726b251339ce4999345a85c60c236ba17098d10f0f6cae40a2655a67b3fff3","observation_id":"6a9ca6ba-bd01-49f2-80b8-778104f2140b","resolution":{"observed_at":"2026-08-15T15:50:00.153254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02999","last_updated":"2018-10-22T16:11:14Z","snapshot_observed_at":"2026-08-14T19:38:16.450214Z","submitted_at":"2018-03-08T08:29:38Z","title":"On First-Order Meta-Learning Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02999","snapshot_observed_at":"2026-08-15T15:49:59.695466Z","title":"On first-order meta-learning algorithms.arXiv preprint arXiv:1803.02999,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.695466Z"},"links":{"cited_paper":"/paper/1803.02999","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:9b189a022b59a0dfc1bdb2a971162b08df2f9cdf379dcc57ca8da0060371a2c4","observation_id":"4e85b819-979a-406e-9ec7-9ea4bb07a619","resolution":{"observed_at":"2026-08-15T15:49:59.695466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07113","snapshot_observed_at":"2026-08-15T15:49:59.711210Z","title":"Solving rubik’s cube with a robot hand.arXiv preprint arXiv:1910.07113,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.711210Z"},"links":{"cited_paper":"/paper/1910.07113","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:05febffc2acb6e4bddc442245e0385d8e65074189e0db3e706f49056bed89c5a","observation_id":"1deb65c4-9b8e-40c6-8485-f3d51ecd5df9","resolution":{"observed_at":"2026-08-15T15:49:59.711210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-15T15:49:59.718704Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.718704Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:93462cf21f8993e7cabe03ba11e69b66ea2a647bdfd2edf1e865747655fe9a0f","observation_id":"b28df3d7-f8de-4139-9a13-3594f750127c","resolution":{"observed_at":"2026-08-15T15:49:59.718704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-15T15:49:59.722543Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning.arXiv preprint arXiv:1910.00177,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.722543Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:b709a8076db5a03aa8a99d5e37e34ef71b7d176bf460bd1f8ad3cf87b2326c7d","observation_id":"1ceecf3a-9e06-4f0c-85de-24865542deba","resolution":{"observed_at":"2026-08-15T15:49:59.722543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-15T15:49:59.726441Z","title":"Offline reinforcement learning with implicit Q- learning.arXiv preprint arXiv:2110.06169,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.726441Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:121916a54817b60d4c9d542eae5bbccab05d437f389f0f895720f9a47a9389f1","observation_id":"3a83e20b-e3e1-4619-b4f5-4167e284c1ce","resolution":{"observed_at":"2026-08-15T15:49:59.726441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.09157","last_updated":"2020-02-12T15:29:39Z","snapshot_observed_at":"2026-08-09T17:12:58.580827Z","submitted_at":"2019-09-19T16:30:42Z","title":"Rapid Learning or Feature Reuse? Towards Understanding the Effectiveness of MAML","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.09157","snapshot_observed_at":"2026-08-15T15:49:59.730352Z","title":"Rapid learning or feature reuse? towards understanding the effectiveness of MAML.arXiv preprint arXiv:1909.09157,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.730352Z"},"links":{"cited_paper":"/paper/1909.09157","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:a78a2f27934e338f6701ebd7e1cf64ec3a20c2bed3ac5b0cb09ea435e4e8c156","observation_id":"05c43a16-7500-433b-adfa-5bdbf776c883","resolution":{"observed_at":"2026-08-15T15:49:59.730352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-15T15:49:59.742716Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention.arXiv preprint arXiv:2303.16199,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.742716Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:8bb10bca32f59553d48fa3b18b1b373fb9636fa22b5e2fcba019dc50e075a145","observation_id":"414ac2dd-1cdd-4af4-b619-c4e96c4c8cc5","resolution":{"observed_at":"2026-08-15T15:49:59.742716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:59.746322Z","title":"BitFit: Simple parameter-efficient fine- tuning for transformer-based masked language-models.arXiv preprint arXiv:2106.10199,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.746322Z"},"links":{"citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:287455e4ecc9e2d14aefb9326144a3ea670505d442b889bdfd43dc74a6207011","observation_id":"292373e9-f99b-4da4-810e-9247c6fa5f60","resolution":{"observed_at":"2026-08-15T15:49:59.746322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06600","last_updated":"2023-04-13T15:06:28Z","snapshot_observed_at":"2026-08-16T15:40:40.001946Z","submitted_at":"2023-04-13T15:06:28Z","title":"Lossless Adaptation of Pretrained Vision Models For Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06600","snapshot_observed_at":"2026-08-15T15:49:59.749675Z","title":"Lossless adaptation of pretrained vision models for robotic manipulation.arXiv preprint arXiv:2304.06600,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.749675Z"},"links":{"cited_paper":"/paper/2304.06600","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:261f2931c091fbd28e2f433e9188b6b34ceda6fb12e0132475139e324db2c76d","observation_id":"2ac2e632-91cf-4f6d-87b4-7fadc3e7afd5","resolution":{"observed_at":"2026-08-15T15:49:59.749675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.07626","last_updated":"2018-12-18T20:01:41Z","snapshot_observed_at":"2026-08-14T17:41:37.239502Z","submitted_at":"2018-12-18T20:01:41Z","title":"Universal Successor Features Approximators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.07626","snapshot_observed_at":"2026-08-15T15:49:59.753524Z","title":"Universal successor features approximators.arXiv preprint arXiv:1812.07626,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.753524Z"},"links":{"cited_paper":"/paper/1812.07626","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:6042341ae6b0668e92f335dc1199c107d54ad6dabe37b5ce15945817719fa940","observation_id":"3086fa2c-6aa3-46e0-b15f-0a51c63f3e23","resolution":{"observed_at":"2026-08-15T15:49:59.753524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.00102","last_updated":"2017-07-31T23:36:18Z","snapshot_observed_at":"2026-08-14T20:44:04.945295Z","submitted_at":"2017-07-31T23:36:18Z","title":"Advantages and Limitations of using Successor Features for Transfer in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.00102","snapshot_observed_at":"2026-08-15T15:49:59.757366Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.757366Z"},"links":{"cited_paper":"/paper/1708.00102","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:03a0290b1423e3643b114d0b16200a2e6092a3a99c0c1bb06b156717c13ebf4f","observation_id":"741d5ac3-a158-4028-83ef-8c6e7ea260c1","resolution":{"observed_at":"2026-08-15T15:49:59.757366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.01118","last_updated":"2019-01-11T20:26:59Z","snapshot_observed_at":"2026-08-14T19:40:02.936661Z","submitted_at":"2018-03-03T07:13:43Z","title":"Some Considerations on Learning to Explore via Meta-Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.01118","snapshot_observed_at":"2026-08-15T15:49:59.761012Z","title":"Stadie, Ge Yang, Rein Houthooft, Xi Chen, Yan Duan, Yuhuai Wu, Pieter Abbeel, and Ilya Sutskever","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.761012Z"},"links":{"cited_paper":"/paper/1803.01118","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:d3d10dabc97c0bca6e0f41d712be6a35f08f13f81d457c0bbdfe198b244d85dc","observation_id":"9477da09-850c-4b91-bf38-89168baef5ea","resolution":{"observed_at":"2026-08-15T15:49:59.761012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01215","last_updated":"2020-07-07T15:49:16Z","snapshot_observed_at":"2026-08-15T09:31:37.022852Z","submitted_at":"2019-09-25T19:28:33Z","title":"ES-MAML: Simple Hessian-Free Meta Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01215","snapshot_observed_at":"2026-08-15T15:49:59.764887Z","title":"ES-MAML: Simple hessian-free meta learning.arXiv preprint arXiv:1910.01215,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.764887Z"},"links":{"cited_paper":"/paper/1910.01215","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:9132ab8ca1d9d176ad8fa8f4f5e7678be6ae0db9e8ca69a2c5240f4ebaad9001","observation_id":"26847317-8382-4273-971e-fb3937ac9729","resolution":{"observed_at":"2026-08-15T15:49:59.764887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.08348","last_updated":"2020-02-27T19:40:21Z","snapshot_observed_at":"2026-08-11T22:18:09.221124Z","submitted_at":"2019-10-18T11:44:59Z","title":"VariBAD: A Very Good Method for Bayes-Adaptive Deep RL via Meta-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.08348","snapshot_observed_at":"2026-08-15T15:49:59.768452Z","title":"VariBAD: A very good method for Bayes-adaptive deep RL via meta- learning.arXiv preprint arXiv:1910.08348,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.768452Z"},"links":{"cited_paper":"/paper/1910.08348","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:46c59e5a5f713fb1779b9b7d9af2558cbb80041aa08fcb2f53a1336f631e8ef9","observation_id":"c9e7e083-7a17-48c6-a939-29950eedd8a7","resolution":{"observed_at":"2026-08-15T15:49:59.768452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08028","last_updated":"2025-05-29T14:17:01Z","snapshot_observed_at":"2026-08-16T16:01:25.565982Z","submitted_at":"2023-01-19T12:01:41Z","title":"A Tutorial on Meta-Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08028","snapshot_observed_at":"2026-08-15T15:49:59.772066Z","title":"A survey of meta-reinforcement learning.arXiv preprint arXiv:2301.08028,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.772066Z"},"links":{"cited_paper":"/paper/2301.08028","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:8435331c1a19980c99d0926b79ed798c6d3cfde85ff2a4a13d40fe81cff16e9f","observation_id":"828391e7-c6ee-418c-8edf-340adefe9786","resolution":{"observed_at":"2026-08-15T15:49:59.772066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.09529","last_updated":"2017-06-29T00:54:47Z","snapshot_observed_at":"2026-08-14T20:50:56.570615Z","submitted_at":"2017-06-29T00:54:47Z","title":"Learning to Learn: Meta-Critic Networks for Sample Efficient Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.09529","snapshot_observed_at":"2026-08-15T15:49:59.775920Z","title":"Hospedales, and Yongxin Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.775920Z"},"links":{"cited_paper":"/paper/1706.09529","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:e0202f78ba44eb22e95502b8079cfd0225bad278431f46e4aa375f256398669d","observation_id":"b23d4ff5-a654-4fd2-92da-040e0ae7a8fe","resolution":{"observed_at":"2026-08-15T15:49:59.775920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.01905","last_updated":"2018-01-31T09:05:10Z","snapshot_observed_at":"2026-08-15T07:00:51.264695Z","submitted_at":"2017-06-06T18:09:29Z","title":"Parameter Space Noise for Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.01905","snapshot_observed_at":"2026-08-15T15:49:59.783118Z","title":"Chen, Xi Chen, Tamim Asfour, Pieter Abbeel, and Marcin Andrychowicz","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.783118Z"},"links":{"cited_paper":"/paper/1706.01905","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:bdf0c524036836879bb3a38f32fb481019e83edaedc2e8e1a8a820586577383b","observation_id":"95864adc-3203-4c64-8dba-bbcdb68dde2d","resolution":{"observed_at":"2026-08-15T15:49:59.783118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-15T15:49:59.786714Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.786714Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:eaf6fb1af9da30fd67320c1b4e4a8f7c1e57cb2cd752546d4793ae09a3421327","observation_id":"da34e2a3-9d08-40aa-b1df-f3980800a6b0","resolution":{"observed_at":"2026-08-15T15:49:59.786714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:50:00.161266Z","title":"In meta-test, the agent is evaluated atθ= 1.5π, that is,x= 3 cosθ,y= 3 sinθ","venue":null,"work_id":"c79b3ce1-5319-4072-9730-68e56cc9fe66","year":2000},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.790252Z"},"links":{"citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:324aa8d3c61fd68798c9949b960a72a825c93b6903106514cdf5a6006c7a5094","observation_id":"ac7fa0b2-8f80-474d-90df-718b9516b643","resolution":{"observed_at":"2026-08-15T15:50:00.166748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.09186","last_updated":"2019-09-19T18:43:56Z","snapshot_observed_at":"2026-08-06T10:34:26.281716Z","submitted_at":"2019-09-19T18:43:56Z","title":"Revisit Policy Optimization in Matrix Form","version":1},"cited_work":{"arxiv_id":"1909.09186","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.09186","snapshot_observed_at":"2026-08-15T15:50:00.132543Z","title":"Revisit Policy Optimization in Matrix Form","venue":"cs.LG","work_id":"fae01b89-1d07-48f1-ae30-a0953e91a7d6","year":2019},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.686659Z"},"links":{"cited_paper":"/paper/1909.09186","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:0aa627fda1822eea05574740006086925699af5056806b2c69135c9e9b7a0759","observation_id":"973ae3f2-e8bb-4640-aa38-2310ccc672c9","resolution":{"observed_at":"2026-08-15T15:50:00.138816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02779","last_updated":"2016-11-10T01:17:36Z","snapshot_observed_at":"2026-08-14T21:31:19.001119Z","submitted_at":"2016-11-09T00:13:29Z","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02779","snapshot_observed_at":"2026-08-15T15:49:59.703482Z","title":"Bartlett, Ilya Sutskever, and Pieter Abbeel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.703482Z"},"links":{"cited_paper":"/paper/1611.02779","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:9cf24b1167f439d323975734d661207438c6d7eaf5d701d5b9783a074ac5774d","observation_id":"1aef2f06-c341-481c-9fe6-06b30aa21ddc","resolution":{"observed_at":"2026-08-15T15:49:59.703482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.03141","last_updated":"2018-02-25T04:55:20Z","snapshot_observed_at":"2026-08-14T20:48:28.347456Z","submitted_at":"2017-07-11T06:21:31Z","title":"A Simple Neural Attentive Meta-Learner","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.03141","snapshot_observed_at":"2026-08-15T15:49:59.691118Z","title":"A simple neural attentive meta-learner.arXiv preprint arXiv:1707.03141,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.691118Z"},"links":{"cited_paper":"/paper/1707.03141","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:4de710f2fdebffd00c479c1cb98b7e290fbe82bac4e2d01b9acfe2c7a2c47150","observation_id":"136b4f67-5e1c-4156-9b51-c756204b629b","resolution":{"observed_at":"2026-08-15T15:49:59.691118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05763","last_updated":"2017-01-23T12:38:24Z","snapshot_observed_at":"2026-08-16T15:30:43.419006Z","submitted_at":"2016-11-17T16:29:11Z","title":"Learning to reinforcement learn","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05763","snapshot_observed_at":"2026-08-15T15:49:59.699119Z","title":"Wang, Zeb Kurth-Nelson, Dhruva Tirumala, Hubert Soyer, Joel Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.699119Z"},"links":{"cited_paper":"/paper/1611.05763","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:3b147d2816332dc678fcbec5fe3b3c2278eaea9cad226cd9323b2d159023dd48","observation_id":"74f6ec7a-7cbf-47d2-90d4-83ad4c2c0aba","resolution":{"observed_at":"2026-08-15T15:49:59.699119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-08-13T14:13:07.807518Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-15T15:49:59.707291Z","title":"Dota 2 with large scale deep reinforcement learning.arXiv preprint arXiv:1912.06680,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.707291Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:14be88c7eda82ac329c266049d00f68d7607b111197f67ec24edc35db1f5ddfc","observation_id":"21437c3d-b1cd-4bcc-8ecb-08a9d841156a","resolution":{"observed_at":"2026-08-15T15:49:59.707291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:50:00.175574Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"0e024a62-6cde-439c-8253-2c12eacf9861","year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.714968Z"},"links":{"citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:e7af69f14ab84e44c999a76a37422c117ca9c6d0335c2ce4c3856953d6b1490f","observation_id":"01db3086-9d60-49cb-b969-5ed2172b8e29","resolution":{"observed_at":"2026-08-15T15:50:00.180795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11466","last_updated":"2023-06-06T05:58:11Z","snapshot_observed_at":"2026-08-16T16:22:27.724490Z","submitted_at":"2022-10-20T17:59:15Z","title":"Surgical Fine-Tuning Improves Adaptation to Distribution Shifts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11466","snapshot_observed_at":"2026-08-15T15:49:59.738570Z","title":"Chen, Fahim Tajwar, Ananya Kumar, Huaxiu Yao, Percy Liang, and Chelsea Finn","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.738570Z"},"links":{"cited_paper":"/paper/2210.11466","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:f5a372bcb4dc09b91fd208fd3a88b3c9ca5aba81a0f4d529efa46e11cc65fdd8","observation_id":"a0314d63-cc19-4a94-818a-629cd1cd223c","resolution":{"observed_at":"2026-08-15T15:49:59.738570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10054","last_updated":"2022-02-21T09:03:34Z","snapshot_observed_at":"2026-08-16T20:16:33.870271Z","submitted_at":"2022-02-21T09:03:34Z","title":"Fine-Tuning can Distort Pretrained Features and Underperform Out-of-Distribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10054","snapshot_observed_at":"2026-08-15T15:49:59.734533Z","title":"Fine- tuning can distort pretrained features and underperform out-of-distribution.arXiv preprint arXiv:2202.10054,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.734533Z"},"links":{"cited_paper":"/paper/2202.10054","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:48127bc0b7994454ccf0c7094a829de9aec2f6016f8f6b416668d4354ad65543","observation_id":"a21779bf-7180-49c6-9252-5ea53c32fa28","resolution":{"observed_at":"2026-08-15T15:49:59.734533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09561","last_updated":"2024-01-17T19:31:21Z","snapshot_observed_at":"2026-08-16T14:26:40.104363Z","submitted_at":"2024-01-17T19:31:21Z","title":"Sharing Knowledge in Multi-Task Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09561","snapshot_observed_at":"2026-08-15T15:49:59.779619Z","title":"Sharing knowl- edge in multi-task deep reinforcement learning.arXiv preprint arXiv:2401.09561,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:59.779619Z"},"links":{"cited_paper":"/paper/2401.09561","citing_paper":"/paper/2509.22310"},"observation_digest":"sha256:9255ee81a01c5097cce4624326c59cbe6af263a4ce778fcb6d721a20bfe7708f","observation_id":"6c9b0a5a-8041-40a8-a9c6-d9eb14e3526f","resolution":{"observed_at":"2026-08-15T15:49:59.779619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.22310","last_updated":"2026-07-31T14:04:41Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T15:31:34.134735Z","submitted_at":"2025-09-26T13:14:03Z","title":"Adaptive Policy Backbone via Shared Network"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2509.22310."}