{"as_of":"2026-08-14T10:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3a5385acf7456d8a41b24e129f4355ef123de66c170fe944b887078e86d5e3f","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:55:39.186629Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:43:20.198877Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:58:57.542814Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14811","snapshot_observed_at":"2026-08-06T22:43:20.198877Z","title":"Self-composing policies for scalable continual reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21129","last_updated":"2026-06-02T15:41:02Z","snapshot_observed_at":"2026-08-08T12:00:27.664098Z","submitted_at":"2025-06-26T10:10:41Z","title":"Curriculum-Adapted Robust Reinforcement Learning for UAV Deconfliction in Adversarial Environments","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:43:20.198877Z"},"links":{"cited_paper":"/paper/2506.14811","citing_paper":"/paper/2506.21129"},"observation_digest":"sha256:4f808c5f8b9a134049fbf6e3b63d6be1b6df6383a5449110ac0bfbbce6d1a160","observation_id":"6ae13a21-2126-4b58-a649-085c98d14515","resolution":{"observed_at":"2026-08-06T22:43:20.198877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.14811","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14811","snapshot_observed_at":"2026-07-03T20:58:57.542814Z","title":"Self-composing policies for scalable continual reinforcement learning,","venue":null,"work_id":"9ec44974-d9fe-4078-9aea-059e8f74b602","year":null},"citing_paper":{"arxiv_id":"2606.17493","last_updated":"2026-06-16T04:03:50Z","snapshot_observed_at":"2026-08-03T11:16:49.366052Z","submitted_at":"2026-06-16T04:03:50Z","title":"When Robots Sleep: Offline Skill Consolidation for Shared-Policy Robot Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T01:04:01.317563Z"},"links":{"cited_paper":"/paper/2506.14811","citing_paper":"/paper/2606.17493"},"observation_digest":"sha256:b8f79d49ed11824cbbd9f8b8c8fdd9a6d36cf90defc59baca30fe77c56d0a778","observation_id":"cd4eb217-c347-4179-bb53-fdc3cfd694b9","resolution":{"observed_at":"2026-07-03T20:58:57.544492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14811/citation-record","integrity":"/paper/2506.14811/integrity","json":"/paper/2506.14811/citation-record.json","paper":"/paper/2506.14811"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.841129Z","title":"P., Piot, B., Kapturowski, S., Sprechmann, P., Vitvitskyi, A., Guo, Z","venue":null,"work_id":"a0174f99-45f9-4e09-8ef5-889011c12aa8","year":2020},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.026047Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:369c039df8a1fbf930a63954ac474b0a07f1c4c1df1cbceec54a56c1b52a74f1","observation_id":"4be8b203-e0fb-4c71-8697-77f2f8a2ce5d","resolution":{"observed_at":"2026-08-07T10:55:39.844779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.526950Z","title":"Therefore, the computational cost of the internal policy is constant and independent of the number of modules (i.e., number of tasks), Tint(n) = O(1).9 Total Complexity","venue":null,"work_id":"f3796a89-afaa-4213-8d48-2e1e90074c14","year":2016},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.153365Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:c5802aac327b4e66a1c1218745937b558d7aabb02706dba95e873fe9c3e389a6","observation_id":"29d1ae43-8179-4f64-84fb-f5ad099f7a0e","resolution":{"observed_at":"2026-08-07T10:55:39.530805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.514541Z","title":"9For the sake of simplicity, this definition of the internal policy ignores possible activation and normalization layers","venue":null,"work_id":"454d2d0c-4c3e-4038-b773-90df4684c75e","year":2020},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.157501Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:e47e9dee2d5de39b67b3eeae6ab7444c08ac6a5571bd0267dbf5d62d7c48c287","observation_id":"21cc310c-e4f7-4b09-a6c0-1410f23e4681","resolution":{"observed_at":"2026-08-07T10:55:39.518424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.312065Z","title":null,"venue":null,"work_id":"c760341f-c57a-4fe1-8bc7-c82920969025","year":2021},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.186629Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:3e5e2c28564f76a4554381115cab63a123586029555eea092fcf8733571cac30","observation_id":"7d9e6bba-2c93-477c-9eaf-78918cfc303b","resolution":{"observed_at":"2026-08-07T10:55:39.318128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.462230Z","title":null,"venue":null,"work_id":"03709571-3522-43d2-87db-f7f1cdca1eb8","year":2020},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.168332Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:14cf6f8ea887bb5d3dfccf260e3ed6f49cf6436a67a0c86bc27bf682b028b33f","observation_id":"43f60adf-e129-40b9-b512-02b32f0f0990","resolution":{"observed_at":"2026-08-07T10:55:39.478802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.784201Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"334ba35c-ba23-417c-8d7b-264ffd5dd514","year":2021},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.051687Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:34825255298e5efa60cadf8d0e2b17ee310008a6e3006ad8b8ef6c4e6a064102","observation_id":"92e3bb62-861f-408c-b619-21bf06002c47","resolution":{"observed_at":"2026-08-07T10:55:39.788091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.409997Z","title":"Finally, note that the diagonal of the matrix has no especially positive transfer values","venue":null,"work_id":"076e8d2d-9e2a-4634-a621-707a9cb01b81","year":2021},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.171801Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:2fc3b934df1ac2c1f834a599feef1de495e88cd88c6070a95cc6b9f108249f2f","observation_id":"f5af5f3d-0b1a-4818-a396-6ef6ff47680b","resolution":{"observed_at":"2026-08-07T10:55:39.429837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.738292Z","title":"DARLA: Improving zero-shot transfer in reinforcement learning","venue":null,"work_id":"4351629e-9017-4156-9145-17dd39035daf","year":2017},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.065896Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:3e68daf75988b7307aa4a9179b4fd5bee9282bedcfb83ac0e32f15140418996e","observation_id":"317d1efb-d88a-4b17-a8bc-4acfd852c627","resolution":{"observed_at":"2026-08-07T10:55:39.742282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.714931Z","title":"A., Milan, K., Quan, J., Ramalho, T., Grabska-Barwinska, A., et al","venue":null,"work_id":"07bde809-9d5e-45b9-8281-61da06dcbd82","year":2017},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.073608Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:532039bad39980258f8b4a655e935a5bfdb21d9fdafab12d1f2c9b99e9c587be","observation_id":"34695499-3440-48c5-af70-84f4bfedb10b","resolution":{"observed_at":"2026-08-07T10:55:39.718636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.691273Z","title":"and Lazebnik, S","venue":null,"work_id":"b938bad3-9f3d-4810-9a2b-ce2e5d258524","year":2018},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.080755Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:ca49656cad2be659160ec8cf93778397119767d3c4948e7da214059609f9711e","observation_id":"1d659b91-6234-4ad0-a7b6-199a0bf6b0c5","resolution":{"observed_at":"2026-08-07T10:55:39.694872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.679950Z","title":"and Cohen, N","venue":null,"work_id":"749c1732-0da7-4bfd-9a00-6ab167ceae5e","year":1989},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.084153Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:1d6720956bd9306dbca92d14f0021d31c79d155d9341bfee72574f138f98a091","observation_id":"b1880b98-c986-479a-807b-d8a5e7f7e7b4","resolution":{"observed_at":"2026-08-07T10:55:39.683418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.668362Z","title":"A., van Seijen, H., and EATON, E","venue":null,"work_id":"3ad7a64c-73ea-472d-bb05-24692c3e74fc","year":2022},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.087500Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:ff0a3e4d360b6def13b977f44c45ef884c253b353ae9882f96a34983add59566","observation_id":"667d9567-5c7f-4e7d-99c0-c3f727a7ed7b","resolution":{"observed_at":"2026-08-07T10:55:39.671874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T10:55:39.090901Z","title":"DINOv2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.090901Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:14b31d3f3da83fb8df322d421bca832d9b1b35c6704ddf91e9e73a7a8ae28324","observation_id":"abf8d190-968e-4e5e-bdc5-332a66797733","resolution":{"observed_at":"2026-08-07T10:55:39.090901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.656749Z","title":"Routing net- works: Adaptive selection of non-linear functions for multi-task learning","venue":null,"work_id":"7e227e3f-38bf-43cf-83d8-549be1bcc285","year":2018},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.094846Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:e3981bed9aa7b568e1cc506f7ce6d102e3b5c5c8745990ef50215cc451d6b3f4","observation_id":"b373c6e9-68e2-495b-9dca-23d67dc39192","resolution":{"observed_at":"2026-08-07T10:55:39.660530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12774","last_updated":"2019-04-29T15:32:14Z","snapshot_observed_at":"2026-07-06T07:49:15.217918Z","submitted_at":"2019-04-29T15:32:14Z","title":"Routing Networks and the Challenges of Modular and Compositional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.12774","snapshot_observed_at":"2026-08-07T10:55:39.098469Z","title":"Rout- ing networks and the challenges of modular and compo- sitional computation","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.098469Z"},"links":{"cited_paper":"/paper/1904.12774","citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:e344504ebd040b2b6e6a71aec993d368ddb2aea8e58afa01c293aa741ac2414f","observation_id":"cfa1ce0d-f908-4a27-975a-5f9289193564","resolution":{"observed_at":"2026-08-07T10:55:39.098469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06295","last_updated":"2016-01-07T18:43:03Z","snapshot_observed_at":"2026-07-06T04:37:06.738855Z","submitted_at":"2015-11-19T18:38:47Z","title":"Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06295","snapshot_observed_at":"2026-08-07T10:55:39.102242Z","title":"A., Colmenarejo, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.102242Z"},"links":{"cited_paper":"/paper/1511.06295","citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:124caf7d2e19cec4ae9520d9333bfbdf37a1790313ae6250eb252eb953b2bbeb","observation_id":"0746266a-c85f-4f8b-9142-dda724f93ded","resolution":{"observed_at":"2026-08-07T10:55:39.102242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T10:55:39.113642Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.113642Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:bd975625e88172cef7b69392742b68c192d319e1fc995300c0d70aa68d060452","observation_id":"da3f200e-103e-4462-a5b4-ac87ac9a71cb","resolution":{"observed_at":"2026-08-07T10:55:39.113642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.633034Z","title":"V ., Montone, G., and O’Regan, J","venue":null,"work_id":"634794b6-12a7-4aab-8b75-299569f3dd72","year":2015},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.117234Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:68f284f9020c085c06870becec6a0a4bf5ca16f66c16d412d076465651e73ea1","observation_id":"c7818e6b-4ab2-4712-af14-45ad343e455b","resolution":{"observed_at":"2026-08-07T10:55:39.636813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.01753","last_updated":"2019-02-21T01:17:31Z","snapshot_observed_at":"2026-08-10T09:06:00.813932Z","submitted_at":"2019-01-07T11:28:36Z","title":"Paired Open-Ended Trailblazer (POET): Endlessly Generating Increasingly Complex and Diverse Learning Environments and Their Solutions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.01753","snapshot_observed_at":"2026-08-07T10:55:39.124267Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.124267Z"},"links":{"cited_paper":"/paper/1901.01753","citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:4ed2f9803e207f7cd7d4e633506f259c4e129a3db89b1241b65005cb506e934b","observation_id":"0d88f8cf-b4f8-4749-b2d1-37c7a231577c","resolution":{"observed_at":"2026-08-07T10:55:39.124267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.609358Z","title":"Continual World: A robotic benchmark for continual reinforcement learning","venue":null,"work_id":"2b90b8f5-f92b-4bce-95f8-8cf26a12456b","year":2021},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.128218Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:6a592557d1f1c26ee30f1b718ad440c95d4dc79888d8c198f9f93c66c5cb6b6e","observation_id":"2b2bef20-85a1-4998-9847-c983e7a125c1","resolution":{"observed_at":"2026-08-07T10:55:39.613338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.597217Z","title":"Disentangling transfer in continual reinforce- ment learning","venue":null,"work_id":"1eeabac4-df96-4db9-a6ec-53870066afb8","year":2022},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.131580Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:dff51a2b6d49b66a941c38789955c8c87528db64d467676826c9a84e6dc576e0","observation_id":"db873ac4-15e5-46c8-b2ee-299fc137e60c","resolution":{"observed_at":"2026-08-07T10:55:39.600999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.585587Z","title":"Supermasks in superposition","venue":null,"work_id":"06c78d23-8e9c-48b4-96f3-198885c0cac9","year":2020},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.135082Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:3257700bbab3debe2f463d4bc255b32f41d8579e47910eca64baa573e124585a","observation_id":"0be4bb6a-e033-4289-8d30-9dfa8b22ba9c","resolution":{"observed_at":"2026-08-07T10:55:39.589259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.573452Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":"3a136306-1901-4bb1-a425-b59ae15b4817","year":2023},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.138636Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:7cbc14996e238fe0d99604758a0478ef621783ff31b18fd5df2a49f2be09d01e","observation_id":"36588c15-1180-4e78-8b3f-0c2f3a36d725","resolution":{"observed_at":"2026-08-07T10:55:39.577244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.562088Z","title":null,"venue":null,"work_id":"de6fdd67-9002-488e-9572-cb34d1aca284","year":2018},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.142435Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:c9e38ea19e297a14a81ec5203b53efdbf96350f6edd7096cadd91ed40a515f1a","observation_id":"15547404-9f2a-4fe1-ad86-8cce9832ae89","resolution":{"observed_at":"2026-08-07T10:55:39.565574Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.550404Z","title":"Gradient surgery for multi-task learning","venue":null,"work_id":"4c11a027-09ea-41f8-851e-3d0a936ddad3","year":2020},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.146103Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:a2a1a4aeeb4571c293b00b8bc06c84f68337082129d6f8165167485b65d9a3b9","observation_id":"869064b6-bead-4ec4-9e81-efe63dee22ae","resolution":{"observed_at":"2026-08-07T10:55:39.554336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.539011Z","title":null,"venue":null,"work_id":"1fb14e99-ea70-4da4-beb3-2c8b222708ab","year":2023},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.149785Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:5049d50b1d0a14bd601234fe3c66f2b69a9a16abe4a20b009a886361fd388131","observation_id":"6c868104-f8c8-4cbd-b35c-f38e7c2a5702","resolution":{"observed_at":"2026-08-07T10:55:39.542556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.502770Z","title":null,"venue":null,"work_id":"64da1f17-6542-4441-9cee-597daab3fb26","year":2020},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.161145Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:d8b0f4f9ecc95fdf712931de7401ccaddcf510d2277b2ee944e6efe242d7a468","observation_id":"cdbc379b-2fa6-4fc8-8f39-c6290181e1db","resolution":{"observed_at":"2026-08-07T10:55:39.506391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.490016Z","title":"Trucks are longer vehicles, and thus, more difficult to avoid","venue":null,"work_id":"8e915eb5-6909-4991-bc33-a33b2146727f","year":2023},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.164840Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:facf7f21baa0ca32e6414b6b28c331ae96a514844378140de9a0154341beb9c5","observation_id":"0345a13f-de38-45e8-b284-cea6ba45f785","resolution":{"observed_at":"2026-08-07T10:55:39.494181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.357323Z","title":"Figure D.2c provides the FTr matrix of the last sequence, Freeway","venue":null,"work_id":"229453df-f264-4eb8-8453-56d381764f0d","year":2022},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.175216Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:30d42941e473dabbc4434bdf6457bbf836eb1da81f906b03c4f934214e76dd63","observation_id":"0b094072-7127-4a85-94a4-20fc1d88beb7","resolution":{"observed_at":"2026-08-07T10:55:39.378668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.342403Z","title":"All methods share the same common hyperparameters in every task sequence","venue":null,"work_id":"6f7ffbb3-6a52-4406-83df-fdbbdda6e48e","year":2020},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.178681Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:0f03adc5f969ad9284421d909ea6972c3afc4f039bd2dd306dfb3f992edb8036","observation_id":"08374901-c3a0-459e-865a-8deda8b0d0ee","resolution":{"observed_at":"2026-08-07T10:55:39.347211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.328723Z","title":null,"venue":null,"work_id":"c7b07574-505d-4140-aa01-5827d8370a84","year":2021},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":512,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.182401Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:91e9315c358ab9c9591c8cc5d2a9cb32b54aa4cf7a3c2c519252926c501433f1","observation_id":"e28708de-c8ff-486f-8755-3ffb3c06e354","resolution":{"observed_at":"2026-08-07T10:55:39.333468Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.702670Z","title":"Conflict- averse gradient descent for multi-task learning","venue":null,"work_id":"568812e0-6adf-459a-9216-9585dcab25bd","year":2021},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":1952,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.077162Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:1ce2fe4b592e75b2083fe08be96741db7a15b4990a3c9e517dad139131eeafc0","observation_id":"03d52f89-da45-4ca9-aa3e-968d08590255","resolution":{"observed_at":"2026-08-07T10:55:39.706409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.772782Z","title":"Building a subspace of policies for scalable continual learning","venue":null,"work_id":"d7e271e0-dbcb-43be-bbe1-94db1a3a91c1","year":2023},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.055459Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:b6c41798206ad8e83e02a2d60b67f47328cd8fab3a6885ef7c765d01d4853a06","observation_id":"993a1326-8f2f-417a-84b5-566c30dfb297","resolution":{"observed_at":"2026-08-07T10:55:39.776482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.807597Z","title":"D., Juraf- sky, D., et al","venue":null,"work_id":"db13433b-e8cb-4b7c-b7b3-22dfd248a898","year":2019},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.039394Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:ec9d5e8d0dddd28afe0687007d127aae44113d0c0176daa3059ec4c9a85b7727","observation_id":"a94b8a4a-42ed-40ac-8340-94c1eac3f064","resolution":{"observed_at":"2026-08-07T10:55:39.811117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.818811Z","title":"Curriculum learning","venue":null,"work_id":"11e17729-e1b4-4cd6-8aba-4ae430cbe9e2","year":2009},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.034501Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:1f59f47ed46544c9b876405c05625b81eb2e6032b8ea5136947fc68c0344ce75","observation_id":"a8b89b48-f42c-401b-8d0b-1156bdeaed33","resolution":{"observed_at":"2026-08-07T10:55:39.822258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.04671","last_updated":"2022-10-22T14:34:44Z","snapshot_observed_at":"2026-08-14T06:05:49.699878Z","submitted_at":"2016-06-15T08:20:51Z","title":"Progressive Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.04671","snapshot_observed_at":"2026-08-07T10:55:39.106161Z","title":"A., Rabinowitz, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.106161Z"},"links":{"cited_paper":"/paper/1606.04671","citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:684acbbc02154cbb0fc07c8ef6be3da59a4c8834ab8c93da9808936a1abb6187","observation_id":"a011d90e-6011-427b-a4aa-4868b87dc841","resolution":{"observed_at":"2026-08-07T10:55:39.106161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.644853Z","title":"A., Veˇcer´ık, M., Roth¨orl, T., Heess, N., Pascanu, R., and Hadsell, R","venue":null,"work_id":"99983e8a-21a9-47af-aa45-fa1fdc765b04","year":2017},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.110024Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:721e9498ec24cb217725a57842f56d7ef285aa2dca6185d276599798460f14f0","observation_id":"7744fc9b-bf68-445d-95e7-a0aef631af76","resolution":{"observed_at":"2026-08-07T10:55:39.648531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.749975Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforce- ment learning with a stochastic actor","venue":null,"work_id":"a5519dc2-c08f-4843-8ee0-ce3d614d1446","year":2018},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.062617Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:8e129e80b79156b95709e6f52b861ae59b24cd0c8ba90521f220c9282b5e9350","observation_id":"208f7a10-c9d9-4c64-9bd9-f8a3d831883a","resolution":{"observed_at":"2026-08-07T10:55:39.753568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.13166","last_updated":"2018-10-31T09:15:02Z","snapshot_observed_at":"2026-08-01T00:06:57.854696Z","submitted_at":"2018-10-31T09:15:02Z","title":"Don't forget, there is more than forgetting: new metrics for Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.13166","snapshot_observed_at":"2026-08-07T10:55:39.047610Z","title":"Don’t forget, there is more than forgetting: new metrics for continual learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.047610Z"},"links":{"cited_paper":"/paper/1810.13166","citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:4d37fe358770ca5588ff435763a5a7a9959df4c11ae636460f3bed56be59d8c7","observation_id":"626cc428-a2d3-44ef-8a06-2ebd839fbf4a","resolution":{"observed_at":"2026-08-07T10:55:39.047610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.795901Z","title":"W., Heess, N., Osindero, S., and Pascanu, R","venue":null,"work_id":"442bd338-2af7-4b5a-81ad-f674fb3f12b7","year":2018},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.043751Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:0ece6b34025359700c03986e94126812a4e208b6c9257792205cc3537fc6cd1a","observation_id":"12c29cdb-6be0-44a5-9ffa-3db05fe64d27","resolution":{"observed_at":"2026-08-07T10:55:39.799539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.829864Z","title":null,"venue":null,"work_id":"c64c6733-be67-449b-835b-a8f835461cb3","year":2023},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.030531Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:638ce4521ac80f6e3c16cb6f6f4eb69cdb5dcceae5763aa91a09f71932544020","observation_id":"eaa7c3c6-0804-454c-8758-75ec424bab0f","resolution":{"observed_at":"2026-08-07T10:55:39.833522Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.621561Z","title":"N., Kaiser,Ł., and Polosukhin, I","venue":null,"work_id":"fd04b481-cd31-4eb8-8606-7a4c8cc91de8","year":2017},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.120540Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:f4fc9c0eaeb9cc69841f567161c9e0e83db8248effc1e25f06cf6e00562d8f4a","observation_id":"8e1bfe15-7c74-46a1-bc8b-e363508d15d1","resolution":{"observed_at":"2026-08-07T10:55:39.625070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.726894Z","title":"Compacting, picking and growing for unforgetting continual learning","venue":null,"work_id":"1fdc8427-5ab6-42cc-9e5d-77cc907ad28f","year":2019},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.069719Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:266e27bfe0737957c15b8b17ef8988172fe0b58616e9a00cc7479e6bbf2fb7f3","observation_id":"a3fdf65c-1d57-4c0c-99c8-c73b6c679a50","resolution":{"observed_at":"2026-08-07T10:55:39.730466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:39.761399Z","title":"G., Menick, J., Munos, R., and Kavukcuoglu, K","venue":null,"work_id":"a6111499-8b0f-4800-928f-cdff47518952","year":2017},"citing_paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:39.059141Z"},"links":{"citing_paper":"/paper/2506.14811"},"observation_digest":"sha256:a3622df792e55249404c33240e608a790d0a8b3a06a26e96edf20e9ef075a1db","observation_id":"40921fb1-adaa-4519-bde1-bd44063d3215","resolution":{"observed_at":"2026-08-07T10:55:39.764931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14811","last_updated":"2025-06-04T15:12:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T07:54:48.769021Z","submitted_at":"2025-06-04T15:12:15Z","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2506.14811."}