{"as_of":"2026-07-23T12:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4fa2c8e4751f09af51e402995d7296afc65e9e83de47e84bde787243bf859baa","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T19:24:04.574344Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-23T06:31:01.910684+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.02159/citation-record","integrity":"/paper/2605.02159/integrity","json":"/paper/2605.02159/citation-record.json","paper":"/paper/2605.02159"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:12:55.573349Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"4a8cb744-3e2a-4af3-999a-45783c7e2032","year":2015},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:70ff3057edcfd56b31f1b92b5e3858840e0ed8e239de05d51cc2e9c975963956","observation_id":"2dcd05b3-45ed-4b75-a274-73ff85304b96","resolution":{"observed_at":"2026-05-26T03:01:33.917538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mastering the game of Go without human knowledge","venue":null,"work_id":"62c825e7-18a0-4af1-afba-1963a23c5a75","year":2017},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:059681c69f57ccfbd1b9656ec325761a399d568492aaa4c81739483623346ce0","observation_id":"62bb8c33-8fca-4077-94f4-13a9bf917b31","resolution":{"observed_at":"2026-05-26T03:01:33.911932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06295","last_updated":"2016-01-07T18:43:03Z","snapshot_observed_at":"2026-07-06T04:37:06.738855Z","submitted_at":"2015-11-19T18:38:47Z","title":"Policy Distillation","version":2},"cited_work":{"arxiv_id":"1511.06295","doi":"10.48550/arxiv.1511.06295","metadata_source":"pith","pith_arxiv_id":"1511.06295","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Policy Distillation","venue":"cs.LG","work_id":"19e844ce-da43-4244-b2fd-0cef95384b68","year":2015},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"cited_paper":"/paper/1511.06295","citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:c677afb383a09a6536f78383e7e8dc75b29cfc2daf7f1ea11981fb1218ba92e5","observation_id":"898c361a-ba48-4833-9624-e925ed2c6aec","resolution":{"observed_at":"2026-05-09T05:55:30.231690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5555/3306127.3331795","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Context-aware policy reuse","venue":null,"work_id":"2bce5d6d-8b45-49dd-8088-7a5fd2e355c8","year":2019},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:798e5788b610f293a78410c339434cec88735ba754a03824162e9161dde2ab9b","observation_id":"424c9021-af0d-46db-a6cd-6dd297e8f575","resolution":{"observed_at":"2026-05-08T19:29:05.471106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient bayesian policy reuse with a scalable observation model in deep reinforcement learning","venue":null,"work_id":"2e4287eb-d0cd-4b1a-add3-58bb70cfc21c","year":2024},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:6c2631f487a1d7ef0e6d421a9ccd2ea21cc595fc7adc457072968886282de3f6","observation_id":"09aeaef8-53e9-4d76-ab63-f1a9dfa21c9f","resolution":{"observed_at":"2026-05-26T03:01:33.932636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model-based reinforcement learning with probabilistic ensemble terminal critics for data-efficient control applications","venue":null,"work_id":"c1656c2d-f608-4c05-9e9f-23c9f67444d3","year":2024},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:75cc7a25008c790d339a67891c25b170732c184d3b1f619306dd721cb6b4bde3","observation_id":"57c7b723-d9d4-49b8-844e-418020c9cc92","resolution":{"observed_at":"2026-05-26T03:01:33.892264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FedDOVe: A federated deep Q-learning-based offloading for vehicular fog computing","venue":null,"work_id":"d16a0b6d-8db5-4fb9-8a13-a752d2531959","year":2023},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:64e69d74e74e3a531820618ccf675bae297bb162deca9a03b9f469cb31aa40d3","observation_id":"8a5c373b-efd2-48c4-936c-6a3152e16e0e","resolution":{"observed_at":"2026-05-26T03:01:33.944483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Federated reinforcement learning framework for mobile robot navigation using ROS and gazebo","venue":null,"work_id":"f8ab4e99-26b3-4aa9-8b1b-75a6c8c480f0","year":2025},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:913feaaa508f3739bc74066ab549c366dd8821e58662b42cf8ea8809a05f93ea","observation_id":"625371cc-99db-460a-a3f8-42e2f6851413","resolution":{"observed_at":"2026-05-26T03:01:33.940208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transfer learning for reinforcement learning domains: A survey","venue":null,"work_id":"09f80b0e-0d88-4cc5-8107-d6acf03c58d4","year":2009},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:83cad0bf8bcec1be4a382bc6c9af6190d8d21889a2fd39b3299ef0d009e1663a","observation_id":"84ed5440-4191-4c96-b11e-4dda6cb89933","resolution":{"observed_at":"2026-05-26T03:01:33.877506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sim-to-real transfer in deep reinforcement learning for robotics: A survey","venue":null,"work_id":"b59934ba-44d3-40df-9530-f03cd04bb2e5","year":2020},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:b16b279196539ebed0758c916e608e7f2c21e2e86f0701c6e9294d07a28b5691","observation_id":"f1708d71-4a22-43ac-8126-c7cdcb43a562","resolution":{"observed_at":"2026-05-26T03:01:33.904614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on transfer reinforcement learning","venue":null,"work_id":"dc5ab4e2-339c-41ae-8649-654d2cf78004","year":2025},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:0ba82406309be8fe83168e6ae4a7eb1a02dab553a68cc021da8513fecc6c74d9","observation_id":"b3bfbebe-4bf7-4da9-a8c2-e9169598cc6a","resolution":{"observed_at":"2026-05-26T03:01:33.888904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Importance prioritized policy distillation","venue":null,"work_id":"846af659-539f-42ad-a429-dffdd7a758ca","year":2022},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:ceb02d3e11bb9d2b0e5aab05e74bbe5dbe7cc46db3e85858d901f560bdb80889","observation_id":"ac9ec023-1889-4481-822b-083db532c5e5","resolution":{"observed_at":"2026-05-26T03:01:33.959670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online policy distillation with decision-attention","venue":null,"work_id":"6c44cd29-24ec-41d8-b032-21ab9b4085bc","year":2024},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:f74ecad53c3111798e8ac1f304a0b54d9d919491a5bcfab56a1bf785a654e661","observation_id":"91de22cc-7038-4135-b68b-3535e83e23d1","resolution":{"observed_at":"2026-05-26T03:01:33.895758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Probabilistic policy reuse for safe rein- forcement learning","venue":null,"work_id":"a676490e-5d6a-4b15-adf6-8ee50044e59f","year":2018},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:9e6699a9eb7c0905a911c6058bc7825bcabfbfd4a07038c44541e78e54ee0b87","observation_id":"cc44dd9b-da6e-43dc-ba9c-b81a0e6a5a61","resolution":{"observed_at":"2026-05-26T03:01:33.948925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy transfer via skill adaptation and composition","venue":null,"work_id":"341679a0-b45a-41e7-865f-e7549b332cf2","year":2022},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:191ca36e0e74dcc2ac3d6904b48e98f0d06c95679615a0945919a85ed075fc3f","observation_id":"72cf85ad-380f-495b-9bdd-eea41a2b3a49","resolution":{"observed_at":"2026-05-26T03:01:33.956442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transfer reinforcement learning based on gaussian process policy reuse","venue":null,"work_id":"844d811c-6779-435c-a111-c71fd7d8d3ce","year":2023},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:a8db630ff5df56cd2ff5f3b86afbc45762dd4d01db19a978fbf3f28edfc6cdd7","observation_id":"9a6f5fb6-fbd1-4ec5-b5b2-e609551f54bc","resolution":{"observed_at":"2026-05-26T03:01:33.936586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safe adaptive policy transfer reinforcement learning for distributed multiagent control","venue":null,"work_id":"f3180b0e-e42b-43b9-a716-ab38273f9933","year":1939},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:a38886218037244c8348ed0c1b709623b174f1927445b31b4ac121fb8e9ad982","observation_id":"395cfb41-45e4-45d7-8348-9a21c60215bc","resolution":{"observed_at":"2026-05-26T03:01:33.927512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Combining pre-trained models for enhanced feature representation in reinforcement learning","venue":null,"work_id":"9849b93a-4557-4995-9609-7b88dee975de","year":2025},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:3680c51b6550eac9650c613b3672665ac9e465b13195b1fedaf2981844536ebf","observation_id":"cf5c622e-75ed-474d-a2ad-5d391c70d17c","resolution":{"observed_at":"2026-05-26T03:01:33.881768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The PRISMA 2020 statement: an updated guideline for reporting systematic reviews","venue":null,"work_id":"24949145-24fd-4db4-93e0-ab398ce3ee25","year":2020},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:9bf862a1b36128e03b9dce164060d6b6ba6b495312f88fb6657564b9f7af7237","observation_id":"b3d3b3bd-53d2-487c-af70-ed71c8814ece","resolution":{"observed_at":"2026-05-26T03:01:33.921673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parallel reinforcement learning: a framework and case study","venue":null,"work_id":"3d232fac-ef5e-44d4-806f-2c9f87f8543b","year":2018},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:86ae0673b7f83daf6f6a82da8f0cf79917a3b4165d6df43cc99fb872fab38acd","observation_id":"3df149d1-beea-422c-a5be-585ba198f041","resolution":{"observed_at":"2026-05-26T03:01:33.952915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy distillation and value matching in multiagent reinforcement learning","venue":null,"work_id":"167c5960-3fc3-4c49-8219-f334e9181799","year":2019},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:4ccd8f5981b6cf592ca29e53891e8a26d6d96822b262eacd7c73463e91197ba2","observation_id":"8a93cf03-1d56-492c-89df-bc5c2e46204e","resolution":{"observed_at":"2026-05-26T03:01:33.907657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Leaders and collaborators: Address- ing sparse reward challenges in multi-agent reinforcement learning","venue":null,"work_id":"c4fa3d67-4d2c-4e70-a652-af084c736eb5","year":1976},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:f81d0ae6a246bd3cb52755b748c1a06e9ac67dc29b6923594bf26f12f9a43ce3","observation_id":"cbd5881f-28e7-42b4-8687-97a61a3a865c","resolution":{"observed_at":"2026-05-26T03:01:33.885627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A hybrid ensemble framework for adversarial robustness in deep reinforcement learning","venue":null,"work_id":"f9f43cd1-757e-41a9-8a0b-294aa7b60be3","year":2025},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:ed5cf30010fe9dc2b0fd49656deeb9d23514af284b297599cc30fc8a77b02b10","observation_id":"05cbf563-16a2-4662-8b1c-c91d5ccebc9c","resolution":{"observed_at":"2026-05-26T03:01:33.900467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PEARL: FPGA-based reinforcement learning acceleration with pipelined parallel environments","venue":null,"work_id":"3e89559e-d040-472e-98f1-d4d2e7ed680c","year":2025},"citing_paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:04.574344Z"},"links":{"citing_paper":"/paper/2605.02159"},"observation_digest":"sha256:46f2b27ab09218af4bae991e1e80fcb031d1a893b020aa40bab87ffbf21f43fd","observation_id":"44c4ab00-64e0-470c-80cb-3c77b6083ba8","resolution":{"observed_at":"2026-05-26T03:01:33.963500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.02159","last_updated":"2026-05-04T02:37:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T02:37:55Z","title":"Combining Trained Models in Reinforcement Learning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"thesis":"As of 23 July 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2605.02159."}