{"as_of":"2026-08-08T13:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e01a89bfb3ea9550dc2d89a08493bdf2de1936e2a8f51aff3a5617ba190580b0","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:06:27.128981Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.06615/citation-record","integrity":"/paper/2507.06615/integrity","json":"/paper/2507.06615/citation-record.json","paper":"/paper/2507.06615"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:26.120493Z","title":"Dynamic programming","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.120493Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:82d3e880dfef405d05f4ad885006fe59897810750b9040cec90b26b8ba6d0d5f","observation_id":"6956b067-8341-46e0-bcbd-64795b02225e","resolution":{"observed_at":"2026-08-06T19:06:26.120493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-06T19:06:26.142902Z","title":"OpenAI Gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.142902Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:e7213c31c59b60ac12e2f4170a950144c36d448bcadb5c3c969281da9363b1d0","observation_id":"af101913-8a09-4c41-8e5b-c7de8da6b9f2","resolution":{"observed_at":"2026-08-06T19:06:26.142902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.745673Z","title":"Multitask learning","venue":null,"work_id":"03114718-e864-4a79-9c16-9e6cf203be68","year":1997},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.236390Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:397386e9dfe96b692d756e862f19430d1e92b942ffb9f12c3486b781bedab33d","observation_id":"34431820-cad1-4701-beac-8212532aa7fc","resolution":{"observed_at":"2026-08-06T19:06:27.750463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.729111Z","title":"Gradnorm: Gradient normalization for adaptive loss balancing in deep multitask networks","venue":null,"work_id":"8dc3341f-73a9-4aae-8e96-dc701fde435e","year":2018},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.320478Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:44908929c811c51810d1d3789e3de4f895c35d4efd175e7e912193acd1b1b119","observation_id":"0c35eeb8-bef0-40c6-9f1b-7770423608ce","resolution":{"observed_at":"2026-08-06T19:06:27.734718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.709816Z","title":"Multi-task reinforcement learning with task representation method","venue":null,"work_id":"89ff0442-89e6-4c5c-95f7-2c15c47cd32c","year":2022},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.413057Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:091dd77665ab6e0a89ff340cb28431ebc07a9a398f121e07adbc815ddece7346","observation_id":"d248c66f-4a2b-44e9-91d2-24c7eca148c3","resolution":{"observed_at":"2026-08-06T19:06:27.716411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-06T11:56:09.577967Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-06T19:06:26.517932Z","title":"Soft actor-critic for discrete action settings","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.517932Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:5770543eaadc54d441f422a693a0123d4cd3b4311068806ac3fe24c8a65289cf","observation_id":"9de1f464-3e53-4755-8767-6d82f0270712","resolution":{"observed_at":"2026-08-06T19:06:26.517932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.691176Z","title":"Divide- and-conquer reinforcement learning","venue":null,"work_id":"28886f51-38b4-422f-b5e7-0a830c49a0de","year":2018},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.614414Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:20a4939bdde9bfbdceaef979e2a81b5f9e25c0ccda4a79f66786818cef1f0519","observation_id":"ead5de88-ef60-4ba9-b730-12769cb6e820","resolution":{"observed_at":"2026-08-06T19:06:27.696517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.673281Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":"8f5fcd9d-9df2-4e54-bd8c-b52eb90d1f4e","year":2017},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.746446Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:b938197bf6c4e16b9cd7b1f2fefa23ae758a327b0a9f7884dd8b378564873c30","observation_id":"6ef8dc4f-3342-4c2c-86c4-449f807a9ccb","resolution":{"observed_at":"2026-08-06T19:06:27.678620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.650998Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"89c100da-0cfd-4eec-baa0-8b6fd62ce5c7","year":2018},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.791807Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:4dca3f0d16f9f459e821112260ca2e2f6f735f054bd08efd568e56f32f9aed33","observation_id":"16bb38e4-780d-4e03-91d3-dec7f354261c","resolution":{"observed_at":"2026-08-06T19:06:27.655915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.635054Z","title":"Not all tasks are equally difficult: Multi-task deep reinforcement learning with dynamic depth routing","venue":null,"work_id":"42a7a28b-8009-42a0-99ad-07a1b3a1cb15","year":2024},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.925117Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:8b292df0680cf77d027951e6d277a7ff43b2271bfffd480e370c63983b4c9330","observation_id":"0ebc75cf-1afd-4094-845d-af7ef6f61713","resolution":{"observed_at":"2026-08-06T19:06:27.640033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.618677Z","title":"Benchmark environments for multitask learning in continuous domains","venue":null,"work_id":"ac904941-2d66-440e-b500-37f252bdf258","year":2017},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.001434Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:bc066fbafcc87104cb1cc1102573d56a35fe7a185e27a77df41283174893d002","observation_id":"4eb6ac94-69b8-4c8a-abea-48aed0d715bf","resolution":{"observed_at":"2026-08-06T19:06:27.623634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.019997Z","title":"End-to-end training of deep visuomotor policies","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.019997Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:565928a3491a439e9d6b4d423d57734ca1f0012e95688d002c5de03657fd97a4","observation_id":"a8939339-cf84-4fdc-9900-350b4174c8ef","resolution":{"observed_at":"2026-08-06T19:06:27.019997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.584444Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":"867234e4-fc98-4bf7-96d4-427c793700d4","year":2016},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.025033Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:64040714db7e9889fd0ca9d656fac012590336e7d9bc2ab5beee4da4047f1afa","observation_id":"2176921b-bc88-4841-b2a8-0ba171809721","resolution":{"observed_at":"2026-08-06T19:06:27.590920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.568796Z","title":"Conflict-averse gradient descent for multi-task learning","venue":null,"work_id":"a4531eca-add6-4ac6-a4e3-a5eae71fc5b0","year":2021},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.029335Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:20f491347481c98f6b429828b757690fa4e729e4120504fa1c66101053844eec","observation_id":"87174cbe-8b2a-4034-bce1-3a1152b3dbc6","resolution":{"observed_at":"2026-08-06T19:06:27.573810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.548727Z","title":"Q- functionals for value-based continuous control","venue":null,"work_id":"45382fc9-1a5a-406c-8e10-0a9155682ee4","year":2023},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.034309Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:d55db3bb61c548708b11e675e739a2a25eb7fe65eb18ba97b1cd1e84fa6f5f84","observation_id":"2b49c235-0949-4445-82fb-b8b63b001962","resolution":{"observed_at":"2026-08-06T19:06:27.553417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.533106Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":"0879044f-369f-4a74-987c-4a536a8fe349","year":2015},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.038650Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:649827087a63ddd8bb4129dcbadc1dd3fadf34d015b23d9ee220d51c7323db47","observation_id":"1db05804-1920-4860-8fee-fadb7139911b","resolution":{"observed_at":"2026-08-06T19:06:27.537789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.510850Z","title":"Overcoming exploration in reinforcement learning with demonstrations","venue":null,"work_id":"342e8556-e511-469d-b68d-267126563da5","year":2018},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.042996Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:1b899041d7e5d1b63613162e10b4b1a73c30a65cf74ed784f842409c9cfc8e97","observation_id":"4f258522-cbea-488b-970d-d9e46d6f86fa","resolution":{"observed_at":"2026-08-06T19:06:27.516705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.489554Z","title":"Markov Decision Processes: Discrete Stochastic Dynamic Programming","venue":null,"work_id":"6025817d-0813-4a92-80bc-9c47baa9ca0d","year":2014},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.047261Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:fa934685f89aaae6c46095864b8c92a2b19c1393cb90d57c4540a4e2d42b1b1e","observation_id":"163539aa-9b26-4d44-94bf-750e50195f4e","resolution":{"observed_at":"2026-08-06T19:06:27.494440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05098","last_updated":"2017-06-15T21:38:12Z","snapshot_observed_at":"2026-08-04T14:30:44.904839Z","submitted_at":"2017-06-15T21:38:12Z","title":"An Overview of Multi-Task Learning in Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05098","snapshot_observed_at":"2026-08-06T19:06:27.051585Z","title":"An overview of multi-task learning in deep neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.051585Z"},"links":{"cited_paper":"/paper/1706.05098","citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:f0b7300741d2cbc8f21dc2c93d574474dec5a65b6c5c5f9a847cdd6b601e1ab1","observation_id":"2194e526-57fb-41da-a89e-54786c8fc73d","resolution":{"observed_at":"2026-08-06T19:06:27.051585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.473717Z","title":"Hierarchical and interpretable skill acqui- sition in multi-task reinforcement learning","venue":null,"work_id":"e020bbb6-1d70-4a54-bc0d-1036ec5646a1","year":2018},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.056121Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:0cd6c580117feedd4735cefef5de7ad420edc9a0973a8f22437d53765825754f","observation_id":"4bef9725-1cdc-4db8-b924-a907e05a1350","resolution":{"observed_at":"2026-08-06T19:06:27.478520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.457681Z","title":"Multi-task reinforcement learning with context- based representations","venue":null,"work_id":"8d7d4030-0c1f-43ed-9b23-4c7fba4dbdf3","year":2021},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.060861Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:431c0f94664811df7e7a4fb228afcf202d270a71b3826414b46d35af91e97ed2","observation_id":"f460c02b-9ff7-401b-b39c-8a451cc4b64f","resolution":{"observed_at":"2026-08-06T19:06:27.462446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.442224Z","title":"PaCo: Parameter- compositional multi-task reinforcement learning","venue":null,"work_id":"76e88749-2f06-4ab1-a4e4-4925486eec2b","year":2022},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.065190Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:aab64d52d378ebef809338434a57d284684692ded300cf1e9ac522cd0dc98a8c","observation_id":"8f79f070-122f-407e-b8fc-4b0d5f47fbe5","resolution":{"observed_at":"2026-08-06T19:06:27.447306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.427694Z","title":"Czarnecki, John Quan, James Kirkpatrick, Raia Hadsell, Nicolas Heess, and Razvan Pascanu","venue":null,"work_id":"68bcb8d6-d4df-4c1f-8ed3-0f7807e5bffe","year":2017},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.069827Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:98ae8af7c19259416a168c1295fd3f7a646e1b8e72f10f4e633c57217c03e642","observation_id":"2b9f67cb-074c-445a-83ca-e899be6f3b62","resolution":{"observed_at":"2026-08-06T19:06:27.432196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.412455Z","title":"MuJoCo: A physics engine for model-based control","venue":null,"work_id":"ee23e7df-7cba-4812-8b32-9e2676046d51","year":2012},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.074908Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:97ba6fa91c98971094600ba622c5e72008fcb673afe6ea249a59b81d38a3bbeb","observation_id":"158b1812-c2ad-4633-84a0-8b8e28132152","resolution":{"observed_at":"2026-08-06T19:06:27.417318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.394837Z","title":"A survey of multi-task deep reinforcement learning","venue":null,"work_id":"cdf9960d-9432-4318-ae7e-0eebd992f75a","year":2020},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.080098Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:1fa74b5c6b91a424d7b88c17b14abd1fb2b5b16171f76c698f5cbbf1d4437908","observation_id":"efcaf77a-b41a-4b39-b64b-899e88b3409e","resolution":{"observed_at":"2026-08-06T19:06:27.399752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.379410Z","title":"Disentan- gling transfer in continual reinforcement learning","venue":null,"work_id":"cb0f4764-b76f-48e4-8586-904303cb0a97","year":2022},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.085271Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:46d4e88a28f65b24ec117d3d53ba23d98ed72644bf9aed038e8aa5b6ae7ad41b","observation_id":"2f491275-5314-4ac8-ae9a-aca732c37924","resolution":{"observed_at":"2026-08-06T19:06:27.384113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.363136Z","title":"Multi-task reinforcement learning with soft modularization","venue":null,"work_id":"370503dc-35e5-4508-99d5-84287cc04478","year":2020},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.089372Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:a93cbefca66d53ab7566d54c87b425b2d52edb8274ff90a59f485b77dfb256e3","observation_id":"8f63fe28-5d59-4ced-b086-b51e99ab9290","resolution":{"observed_at":"2026-08-06T19:06:27.367994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.345399Z","title":"Mastering complex control in MOBA games with deep reinforcement learning","venue":null,"work_id":"b99e0394-d0b0-4a01-a019-9d057cf756ae","year":2020},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.094458Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:98d32d1a1a29213a5d264b0f3d712de3b9e1d97526b7b207f7275f944f4491ce","observation_id":"e64095ba-b40e-49bf-82fa-fdc5b6a898cc","resolution":{"observed_at":"2026-08-06T19:06:27.350804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.329000Z","title":"Conservative data sharing for multi-task offline reinforcement learning","venue":null,"work_id":"0c038f0a-86c5-4f7c-b72b-92c7546764d0","year":2021},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.099348Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:03c53fbd2590cdb163be78cf36a6cad529e7e714b38ec935768374ad88dd9b8d","observation_id":"42273352-30d9-4d66-b59b-9720cee13b2d","resolution":{"observed_at":"2026-08-06T19:06:27.333739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.311127Z","title":"Gradient surgery for multi-task learning","venue":null,"work_id":"8c8593fd-a22c-4bab-ac6b-0c599a64cfcb","year":2020},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.104218Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:71906f313d4a87bf044886216a96e291ee7858061abc9807ca033736fd516a1c","observation_id":"6980ee7d-36ad-44b6-8cc9-56000f31aaa3","resolution":{"observed_at":"2026-08-06T19:06:27.316401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.294461Z","title":"Meta-World: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"56e8ea53-02c6-4ed7-b609-9b8c28fa8b29","year":2020},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.108928Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:b07b0fd0c40944718810ad9639e0b5148bbdb36f13323103f8b90a63e28274e0","observation_id":"f910f7ae-4f18-40d3-a21a-d8be669fb90d","resolution":{"observed_at":"2026-08-06T19:06:27.299987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00671","last_updated":"2025-04-28T23:27:21Z","snapshot_observed_at":"2026-08-07T20:30:29.441295Z","submitted_at":"2023-02-01T18:58:20Z","title":"QMP: Q-switch Mixture of Policies for Multi-Task Behavior Sharing","version":3},"cited_work":{"arxiv_id":"2302.00671","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.00671","snapshot_observed_at":"2026-08-06T19:06:27.169509Z","title":"QMP: Q-switch Mixture of Policies for Multi-Task Behavior Sharing","venue":"cs.LG","work_id":"c194aeb4-3aac-4ada-a45b-7c1a86af0b9d","year":2023},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.113427Z"},"links":{"cited_paper":"/paper/2302.00671","citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:11ca8ab4196c4975758de7059b1614549b6f097b4db4a892a51d728625080875","observation_id":"ac343e8c-760f-49a8-ba43-6f5424df160a","resolution":{"observed_at":"2026-08-06T19:06:27.177284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.276779Z","title":"CUP: Critic-guided policy reuse","venue":null,"work_id":"21fa4fea-b845-47d7-8406-c4ea4473eee4","year":2022},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.118550Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:958385419e0766c2464f2bb8d71e907de4aad1b8aa4a46e6991b31f205bdb5bb","observation_id":"471e7da7-456e-48e7-941e-bb1777e50947","resolution":{"observed_at":"2026-08-06T19:06:27.282117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.260627Z","title":"t+K−1X t′=t γt′−t (Ri(st′, at′) +αiH(πi(·|st′))) # + γKEst+K∼Pi h ˆQ˜g i (st+K, i) i = Eat′ ∼πi,st′+1∼Pi","venue":null,"work_id":"fc0ed0fc-b588-4f39-8ad6-6a083eebc193","year":2021},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.123453Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:0bb8eb27f6c7a9e52c300569c35e0a38b53e2a0339ec32eee17d9a6161c0b458","observation_id":"25376279-8414-45bf-8121-e2fe020ec629","resolution":{"observed_at":"2026-08-06T19:06:27.265399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.245059Z","title":"Under the initial episode length setting of 150 timesteps, 42 tasks achieve a success rate exceeding 90%","venue":null,"work_id":"03d2128d-d395-4202-8b0a-e6424316b7b8","year":null},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.128981Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:4695d55db5df2ae80e0360d236c39efb5967b7443402a12e2ad9555229b28ab1","observation_id":"ef72a0e4-770a-45bb-ab68-b30d2601b72d","resolution":{"observed_at":"2026-08-06T19:06:27.250052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T18:56:48.206530Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2507.06615."}