{"as_of":"2026-08-08T03:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:724738610b0b55ad72660df6b7999a964b67b32244ed87a7aeb31d3f7134acae","coverage":[{"denominator":118,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:58:54.542081Z","state":"measured"},{"denominator":109,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":109,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:39:05.516882Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T23:09:12.737900Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-08-06T04:39:05.516882Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:05.516882Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:7748e4c5335b2feb586515554118a967451200665064a40ac161e7a8ee2cbbd6","observation_id":"bc77ead2-1f30-42fd-9916-5280d93a49ee","resolution":{"observed_at":"2026-08-06T04:39:05.516882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-08-03T06:26:50.060301Z","title":"Mnih, V ., Badia, A","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2601.23075","last_updated":"2026-06-23T21:44:31Z","snapshot_observed_at":"2026-08-03T06:17:20.457387Z","submitted_at":"2026-01-30T15:24:34Z","title":"RN-D: Discretized Categorical Actors for On-Policy Reinforcement Learning","version":2},"reference_index":1937,"source":"pdf_text","source_observed_at":"2026-08-03T06:26:50.060301Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2601.23075"},"observation_digest":"sha256:d42ab6d35a63b78ade148aa2fb7b1031e7625ad371b60171c8db48e858c53fb4","observation_id":"0b865dce-dccd-424b-8539-56b73b144627","resolution":{"observed_at":"2026-08-03T06:26:50.060301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2505.23150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":"c5878a7d-e0b1-4609-a5bd-5b7abc87de3a","year":2025},"citing_paper":{"arxiv_id":"2603.04333","last_updated":"2026-05-08T20:08:31Z","snapshot_observed_at":"2026-07-31T16:31:42.095039Z","submitted_at":"2026-03-04T17:51:30Z","title":"What Does Flow Matching Bring To TD Learning?","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T16:32:29.432272Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2603.04333"},"observation_digest":"sha256:ce8194901598e5e27aa4376d4ffaef6ffb1b11ab48c19f468ac34f6c175a7e7f","observation_id":"60621c76-8d7e-4e50-99fc-2dba385bb7b0","resolution":{"observed_at":"2026-05-15T16:36:17.973880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2505.23150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":"c5878a7d-e0b1-4609-a5bd-5b7abc87de3a","year":2025},"citing_paper":{"arxiv_id":"2604.04539","last_updated":"2026-05-15T07:15:36Z","snapshot_observed_at":"2026-08-02T17:13:51.910717Z","submitted_at":"2026-04-06T09:03:41Z","title":"FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T20:04:56.512544Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2604.04539"},"observation_digest":"sha256:46be430b9df7e14effd369fcdb90da5e2b2687f481a92d04eeb1b7310c19d79f","observation_id":"888cc10a-ff82-4837-a3e4-b20e78351f66","resolution":{"observed_at":"2026-05-10T22:15:49.716390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2505.23150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":"c5878a7d-e0b1-4609-a5bd-5b7abc87de3a","year":2025},"citing_paper":{"arxiv_id":"2604.04539","last_updated":"2026-05-15T07:15:36Z","snapshot_observed_at":"2026-08-02T17:13:51.910717Z","submitted_at":"2026-04-06T09:03:41Z","title":"FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T17:08:31.770889Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2604.04539"},"observation_digest":"sha256:86a21a3ad83bfc52e6a4e306fe6af02c44d72c8ac26136a1260608d791bb7e03","observation_id":"9c5a25c9-0ec3-42b4-81d1-2f0be6bf0658","resolution":{"observed_at":"2026-05-19T17:12:41.363803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2505.23150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":"c5878a7d-e0b1-4609-a5bd-5b7abc87de3a","year":2025},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-06T08:24:06.705324Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T05:33:19.038889Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:407002ee392878b209e5bf94a375536dd37bdaa37af463e8aec17c16e1f88094","observation_id":"309e830e-b3ea-45f2-9ca8-588e9c61e2ee","resolution":{"observed_at":"2026-05-12T05:36:24.607354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2505.23150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":"c5878a7d-e0b1-4609-a5bd-5b7abc87de3a","year":2025},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-06T08:24:06.705324Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T06:27:38.643667Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:c277b9f228215e5d7d5253672bfd0101edd0eb2cca64d88aad77b1f77894fdd7","observation_id":"2664d873-3fe7-4957-8bac-b87353feff58","resolution":{"observed_at":"2026-05-13T06:32:24.804374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2505.23150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":"c5878a7d-e0b1-4609-a5bd-5b7abc87de3a","year":2025},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-06T08:24:06.705324Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T23:04:12.943222Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:e5e2d886bc9c7b58546bd57c8962f2b79d2b479f183ce95dbccad4e4114f01fc","observation_id":"85285cc0-7eaf-4f1f-be3b-64a47fdd07a0","resolution":{"observed_at":"2026-05-20T23:09:12.743772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2505.23150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":"c5878a7d-e0b1-4609-a5bd-5b7abc87de3a","year":2025},"citing_paper":{"arxiv_id":"2605.11711","last_updated":"2026-05-12T08:02:34Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:02:34Z","title":"Debiased Model-based Representations for Sample-efficient Continuous Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T07:09:01.132424Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2605.11711"},"observation_digest":"sha256:a70b7dff3617276e119c5240afed174b8682d9f207c0c4a25fe850d673924d62","observation_id":"08c63a93-2769-4044-b758-df2313d4dca4","resolution":{"observed_at":"2026-05-13T07:12:28.425885Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23150/citation-record","integrity":"/paper/2505.23150/integrity","json":"/paper/2505.23150/citation-record.json","paper":"/paper/2505.23150"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:58:44.854747Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:44.854747Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:d11e1d54ba8838b8176161043a62588a99d5f5ec6901fe8d495dcd72322ea08d","observation_id":"c403830a-7572-46f5-8a4c-4e8f99131eac","resolution":{"observed_at":"2026-08-07T12:58:44.854747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:44.967526Z","title":"Provable benefits of representational transfer in reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:44.967526Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:844ab77512346c28cc31c86e4439ff81d35a615823a6f88809f68dfab6c82fc0","observation_id":"80c9da86-63a7-4a64-b95f-3a0d48e2c8c8","resolution":{"observed_at":"2026-08-07T12:58:44.967526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.019350Z","title":"S., Courville, A., and Bellemare, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.019350Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:ee21dbbb9005dc28c300e77e280ee6eb58e0cb776ca6840c14e8ef4aea1d0cad","observation_id":"713717d6-e6bd-4c9d-96bd-c26975730a9d","resolution":{"observed_at":"2026-08-07T12:58:45.019350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.121469Z","title":"S., Courville, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.121469Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:0adce891dc4f301c101e36f67fa8725f1904fff1b088fdfe4e7ee55c56c7e885","observation_id":"97a075bd-184a-4409-aee0-3305870ecba4","resolution":{"observed_at":"2026-08-07T12:58:45.121469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.197775Z","title":"Hindsight experience replay.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.197775Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:e9e2466dcf305dc5d3f77d24f5c6ccf9c1ff538f084dc4276c91475e141ab8e6","observation_id":"7da3fa4c-e85c-4342-99ec-4195f8b9d31f","resolution":{"observed_at":"2026-08-07T12:58:45.197775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.269538Z","title":"M., Baker, B., Chociej, M., Jozefowicz, R., McGrew, B., Pachocki, J., Petron, A., Plappert, M., Powell, G., Ray, A., et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.269538Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:8e4f13d208a5bc01747b29b8174809248a3cd3adc8b12be28313367990425b78","observation_id":"bf984bb8-9e57-4b9d-b244-bc6220398bcc","resolution":{"observed_at":"2026-08-07T12:58:45.269538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.345247Z","title":"Video pretraining (vpt): Learning to act by watching unlabeled online videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.345247Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:32cfa87268bde477f81bc64e2a23be9389374baffe8acc8c9a171213df51d243","observation_id":"74c0d758-659e-43e9-ab11-00f55115d6d5","resolution":{"observed_at":"2026-08-07T12:58:45.345247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.433639Z","title":"J., Smith, L., Kostrikov, I., and Levine, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.433639Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:3bf64fffbdbde95edf44f7c81bb74a6a473231c9cc9e4bed40fc09ddeadfaad0","observation_id":"98169282-9aa4-4dae-8152-7ca68d2c59fc","resolution":{"observed_at":"2026-08-07T12:58:45.433639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.571178Z","title":"J., Schaul, T., van Hasselt, H","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.571178Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:13f72394fd6497f5e2b571543106d46f53d5c478b661065c432bb1ce09a900f3","observation_id":"3b1b6998-d6db-4859-ba31-625e5dc47236","resolution":{"observed_at":"2026-08-07T12:58:45.571178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.663223Z","title":"G., Naddaf, Y ., Veness, J., and Bowling, M","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.663223Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:706e129989cabfd9ebddaf8e831935f83feb6971366e099c622641f95ac601e2","observation_id":"d9949fcb-109c-4545-853c-02164a0e7727","resolution":{"observed_at":"2026-08-07T12:58:45.663223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.750044Z","title":"G., Dabney, W., and Munos, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.750044Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:75d4853da25e38522221c84b48d1245376cb36e89272bdba960102e4bf31fb46","observation_id":"c5f64815-4508-4e5a-ac03-e3cbf631d284","resolution":{"observed_at":"2026-08-07T12:58:45.750044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.804154Z","title":"Dynamic Programming","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.804154Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:275f05c1175368a575288f7a8152b011dbc07651ebea211c43c55f9a4d312b9f","observation_id":"08d1053d-46cb-4f71-880d-78bc3dd62be7","resolution":{"observed_at":"2026-08-07T12:58:45.804154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.874874Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.874874Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:c24ae50f12e6162e9a795f6c1aadd5737732ce5c6aae67130c5fe9feacf9f936","observation_id":"2486c5fb-c6b4-443c-8cdf-fd42dd633eb4","resolution":{"observed_at":"2026-08-07T12:58:45.874874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.968173Z","title":"P., and Weinberger, K","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.968173Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:95f8974b51bb93f14528189a0bd4702ca05db41bfd3d09ac9f00db2dd7e8b609","observation_id":"93b4fe42-9f73-4d76-82fa-1430bf502f95","resolution":{"observed_at":"2026-08-07T12:58:45.968173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.065866Z","title":"J., Leary, C., Maclaurin, D., Necula, G., Paszke, A., VanderPlas, J., Wanderman-Milne, S., et al","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.065866Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:96163fb45936e33a760bf72516b59a92facbbbe9972bb33093d1ae27cca015c3","observation_id":"68d41d36-8aae-423b-996d-11f1b1fdfef7","resolution":{"observed_at":"2026-08-07T12:58:46.065866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T12:58:46.158225Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.158225Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:870fdf34e8c649c9ac24e07338d5c8ab6e3093b69bf2f7dc0c9322d69967f80c","observation_id":"63c3a67c-9aca-4c18-9056-0c246c26dc54","resolution":{"observed_at":"2026-08-07T12:58:46.158225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.274336Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.274336Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:32353f7d612514f4d12b318f8887ed76421b60fdc70520535e670586b24cbc0d","observation_id":"778f8cbc-d862-4bf3-b45f-d40d66689849","resolution":{"observed_at":"2026-08-07T12:58:46.274336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.379002Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.379002Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:d89951a47a0ff4867c745f248476214b800e535079f0a6a93604ae986b6f3744","observation_id":"c8a57e69-4a22-4384-9865-e7bbadf3fcad","resolution":{"observed_at":"2026-08-07T12:58:46.379002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.445275Z","title":"A system for general in-hand object re-orientation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.445275Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:47477d83a48380070d8cbba571cd649c31bb8ff1a8ccea858249034511951fe6","observation_id":"8bfdf1d4-ebbf-4fa2-969a-3b77060d52cf","resolution":{"observed_at":"2026-08-07T12:58:46.445275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.566082Z","title":"Gradnorm: Gradient normaliza- tion for adaptive loss balancing in deep multitask networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.566082Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:2548f1ab69c534da9966c6af5fddcd514d637dd4a16b87b9a7ca21908754d1b5","observation_id":"5c71d3a6-7cbf-4467-85f6-f06c0eb2f829","resolution":{"observed_at":"2026-08-07T12:58:46.566082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.662012Z","title":"Just pick a sign: Optimizing deep multitask models with gradient sign dropout","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.662012Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:22b24b749ae007a0a2f525ee2f5e08036efca4903e2178840554d14f26d2c19b","observation_id":"b133e83c-fc66-447e-8f32-286d8c5f2621","resolution":{"observed_at":"2026-08-07T12:58:46.662012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.707628Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.707628Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:b676f752e3f307e8079ff0314f53a24b57d5ac4a2da87b5212c1bc0f2516956c","observation_id":"725d0859-c737-4840-9e5f-ba3f83d84306","resolution":{"observed_at":"2026-08-07T12:58:46.707628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.750339Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.750339Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:a0cbfcb3136bb4fd9043c5d749250e8f4355ce84be0c499d04b0f5d9fc846a68","observation_id":"e5752454-cbfc-4efa-9bae-76e8fa6c8afe","resolution":{"observed_at":"2026-08-07T12:58:46.750339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.835161Z","title":"Better exploration with optimistic actor critic","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.835161Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:ed353d549dd61a6ace0b4205c6ccc315ac1ff66b800f79f3b445649ef53ea161","observation_id":"f173b2ca-f1b5-45e1-a98b-0ac0ff439627","resolution":{"observed_at":"2026-08-07T12:58:46.835161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.867259Z","title":"Magnetic control of tokamak plasmas through deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.867259Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:f4d557609f2769cca4af4f1fd73f3e11b05c0df25fe17c761ab6e6a3ecb533ab","observation_id":"a9579dbe-bdc1-4982-8b39-ed18dca7ba0f","resolution":{"observed_at":"2026-08-07T12:58:46.867259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.915785Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.915785Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:c1fdb6539c24357bb75d47ab8793e0037d235a0d7ec4de0d43eca55763e40bce","observation_id":"544c6b33-a6c6-45fd-ac93-60cd1d1f1f1d","resolution":{"observed_at":"2026-08-07T12:58:46.915785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.009204Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.009204Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:cf33d49923ad444c844180f5baaa4e0b21c86a6ac8e4e19b265bdc1812557b73","observation_id":"cedc50c4-c18d-4625-9599-87af9b1a4611","resolution":{"observed_at":"2026-08-07T12:58:47.009204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.060172Z","title":"S., Lynch, C., Chowdhery, A., Ichter, B., Wahid, A., Tompson, J., Vuong, Q., Yu, T., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.060172Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:7196a0af6f756b6079aa87a39bc58f536753e8e566bcd3efe6248e833acd03b4","observation_id":"e88b3017-0087-4ffc-864a-353bd7bbd744","resolution":{"observed_at":"2026-08-07T12:58:47.060172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.128470Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.128470Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:283374c62496c51e24460553521b9bba4aa1ff67c73088b07ee782d22b34b6f9","observation_id":"8156fac5-839e-4306-9452-eb846bba34f8","resolution":{"observed_at":"2026-08-07T12:58:47.128470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.227015Z","title":"A., Chebotar, Y ., Xiao, T., Irpan, A., Levine, S., Castro, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.227015Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:ae6a18237d625294d5929f282122cd7aee5f7b4d542679837a697610f4710f11","observation_id":"a990062a-6dba-4f00-b38e-c2f4518b63d4","resolution":{"observed_at":"2026-08-07T12:58:47.227015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.334044Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.334044Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:6ee1786f97b428d96d324cb1f6cc609280379b0b547f59e4a196548323815542","observation_id":"ba3cede9-4995-41b8-a536-f8b58699f1f3","resolution":{"observed_at":"2026-08-07T12:58:47.334044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.398149Z","title":"and Gu, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.398149Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:3b261a7117a97fb3cd7a38685951df59316d6ee967399925f689d35d5e4a4bbb","observation_id":"5e78924f-1e27-4136-9ecb-d46590b3ef89","resolution":{"observed_at":"2026-08-07T12:58:47.398149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.450522Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.450522Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:e2c142a6d7cc57fbb015aae29989bf98722aab61ff74efb5058750e7c2bd5a07","observation_id":"b3f8af50-5032-4c35-8ef3-b0e167b5c22f","resolution":{"observed_at":"2026-08-07T12:58:47.450522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.514281Z","title":"S., Precup, D., and Meger, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.514281Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:bca657aab86f4766c21c366046296d75bac2106566c98c03daa624407cadbe3f","observation_id":"ad6cab91-fa5f-41a7-bd2b-995743cf13f6","resolution":{"observed_at":"2026-08-07T12:58:47.514281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.599219Z","title":"Divide-and-conquer reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.599219Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:f73bb6fc30837a7ded9504e833a48bac074457809ed661a602c011c4c4226513","observation_id":"3f5c7ad6-7ec2-46ff-b60d-2c762b03bdd6","resolution":{"observed_at":"2026-08-07T12:58:47.599219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.702018Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.702018Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:a6df5219998596d63aadacadbab13c7c1a5db9bbff33fb17579c2fed86c183ef","observation_id":"11695065-eb2b-43bf-8acd-b1b64740f6bb","resolution":{"observed_at":"2026-08-07T12:58:47.702018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-07T12:58:47.810738Z","title":"Mastering diverse domains through world models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.810738Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:642bfdd455207887f96d3005e53d7cccedb2b032f75a4fc680b7b5ee74b35dab","observation_id":"9b11e6db-448c-4902-ad8b-699cd749dc7e","resolution":{"observed_at":"2026-08-07T12:58:47.810738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16828","snapshot_observed_at":"2026-08-07T12:58:47.926005Z","title":"Td-mpc2: Scalable, robust world models for continuous control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.926005Z"},"links":{"cited_paper":"/paper/2310.16828","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:68fbcb478ce9a4647b3c7652bb5f29acb0bd6a99b8010e739c5756902d4e6333","observation_id":"dcd824f7-6396-4ee8-87f5-7728212e1b21","resolution":{"observed_at":"2026-08-07T12:58:47.926005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.989117Z","title":"R., Millman, K","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.989117Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:02b1592d14181b8f5a1e40716838120132cfcc6c33578da22a89776522be526b","observation_id":"ee899869-f4ac-402a-bf1a-243769f12730","resolution":{"observed_at":"2026-08-07T12:58:47.989117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.058887Z","title":"T., Wang, Z., Heess, N., and Riedmiller, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.058887Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:bedeac297ccb4275f1ffb0d10478dfda4dd2cee2a6d4cb46f45ceaa442816d86","observation_id":"83679e9d-c067-4d62-96aa-c79d0a711e38","resolution":{"observed_at":"2026-08-07T12:58:48.058887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.115400Z","title":"Efficient multi-task reinforcement learning with cross-task policy guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.115400Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:c8e1bf4f31266038443dd2c4b846d15e5fa8f8d6f1fa004104d10b3ef28b114a","observation_id":"0e9bb63e-08e0-494c-bd15-61e1e3d3a57a","resolution":{"observed_at":"2026-08-07T12:58:48.115400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-07T12:58:48.198228Z","title":"B., Dhariwal, P., Gray, S., et al","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.198228Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:baf019d253fd7ee55b576617dc4a2248fc9ee289029e6ee7fb1aa61272a78570","observation_id":"b8e672c4-b654-4d62-9126-c99e3324d0bc","resolution":{"observed_at":"2026-08-07T12:58:48.198228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.306053Z","title":"Multi-task deep reinforcement learning with popart","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.306053Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:816b6754c7f6f5bbd25cc20a710585ea15dd8c81a9089720a3c2783dd9b2669e","observation_id":"aa26013b-9414-44dd-8134-fb1b1af1cdd2","resolution":{"observed_at":"2026-08-07T12:58:48.306053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T12:58:48.423350Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.423350Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:91ffa178ec3375796946dc193eab04d48617c4112f32c944e729f800d316d2ac","observation_id":"e10abf86-0652-4874-9896-dc073ebdf597","resolution":{"observed_at":"2026-08-07T12:58:48.423350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.535699Z","title":"Otter: A vision-language-action model with text-aware visual feature extraction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.535699Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:326884c2c17938543ba3f487237608f79adf9adf97569e93198bedc4e62e29e2","observation_id":"da2ff812-3cf0-4a19-a9f0-32166cf81636","resolution":{"observed_at":"2026-08-07T12:58:48.535699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03062","last_updated":"2021-11-04T17:59:56Z","snapshot_observed_at":"2026-08-07T23:36:51.059335Z","submitted_at":"2021-11-04T17:59:56Z","title":"Generalization in Dexterous Manipulation via Geometry-Aware Multi-Task Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03062","snapshot_observed_at":"2026-08-07T12:58:48.664444Z","title":"Generalization in dexterous manipulation via geometry-aware multi-task learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.664444Z"},"links":{"cited_paper":"/paper/2111.03062","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:101497b051a7fca340085e0e4025e5fe4f40bd077b4a7f905c34f1d100bcfde0","observation_id":"1d70b86f-53ea-46b7-86c0-9f050d402e4c","resolution":{"observed_at":"2026-08-07T12:58:48.664444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.794678Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.794678Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:0b3d6e6822de9d03c5f2045b70f6e38870d464ee2ed44c8a44552413b3d964b7","observation_id":"433abc24-6485-4cf0-9535-847bfb6ac080","resolution":{"observed_at":"2026-08-07T12:58:48.794678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:06.429686Z","title":"H., Czechowski, K., Erhan, D., Finn, C., Kozakowski, P., Levine, S., et al","venue":null,"work_id":"640e257c-74e4-4c46-a6bc-ad7ec72ee56b","year":2019},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.918826Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:643ead6ef99f8ddde419b0f03ab014220177eb56b82c5ff530c6b3ce0f988d3b","observation_id":"1c78482a-fe9b-43f3-9780-a093bedcb51a","resolution":{"observed_at":"2026-08-07T12:59:06.510973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T12:58:49.042717Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.042717Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:9b07b6e49c8456fc1541222d84c848814c088c86a56e87d1c1bfe6e3a0dbefe4","observation_id":"a618c6a6-b9fc-42b8-81af-bfefb5440eaa","resolution":{"observed_at":"2026-08-07T12:58:49.042717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:06.281714Z","title":"Champion-level drone racing using deep reinforcement learning","venue":null,"work_id":"701a51be-ba4f-4a2d-94be-015fcf200886","year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.165271Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:3df96854bf09b96159462c5b221f122e5ebd844863ca011a260b9594863518db","observation_id":"5a2632db-b1fc-431f-b978-3e0be2c69394","resolution":{"observed_at":"2026-08-07T12:59:06.350502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T12:58:49.306614Z","title":"J., Pertsch, K., Karamcheti, S., Xiao, T., Balakrishna, A., Nair, S., Rafailov, R., Foster, E., Lam, G., Sanketi, P., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.306614Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:c7a960b102e8d0519fd2adccb5905e1f3c51d7f057047039e376b8d4f0af79da","observation_id":"9dd9a88f-9958-4e08-a061-06a00151d3e1","resolution":{"observed_at":"2026-08-07T12:58:49.306614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:06.110084Z","title":"and Ba, J","venue":null,"work_id":"66da588d-d1a8-4f65-ab94-11db53d9d2c1","year":2015},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.440203Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:49bf0ecb37a6ebca3095f90a88ff515e21326a5435f4271877b69e48946f8b19","observation_id":"82ba696b-a068-4fdc-942f-828e6bd8b89a","resolution":{"observed_at":"2026-08-07T12:59:06.176243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:05.926602Z","title":"C., Lo, W.-Y ., et al","venue":null,"work_id":"316d7d77-21a0-4581-a6ff-05d44a619223","year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.554910Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:ff320e0c9c796623b8a86b1afa2d67d5e5a1b550a5f99c65e23417c578b05aeb","observation_id":"25391644-5245-47ae-a423-bd5dfe19e699","resolution":{"observed_at":"2026-08-07T12:59:06.005942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:05.735044Z","title":null,"venue":null,"work_id":"3a7ea151-8ebd-4cf2-a35d-f0b56ff0c607","year":2000},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.704891Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:5622f09cbd08eaa73b8090afa88d87d69df86b35f569a8ebd082bd869ccd0d69","observation_id":"dabe2b8f-9758-4483-88a5-a239cd795e92","resolution":{"observed_at":"2026-08-07T12:59:05.816415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13649","last_updated":"2021-03-07T16:37:37Z","snapshot_observed_at":"2026-08-04T06:44:16.616319Z","submitted_at":"2020-04-28T16:48:16Z","title":"Image Augmentation Is All You Need: Regularizing Deep Reinforcement Learning from Pixels","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13649","snapshot_observed_at":"2026-08-07T12:58:49.816226Z","title":"Image augmentation is all you need: Regularizing deep reinforcement learning from pixels","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.816226Z"},"links":{"cited_paper":"/paper/2004.13649","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:58ac9a40c28a886766aa3ae10d05b6624d3318b65e1ba2da883a88ab93585d38","observation_id":"0b377d3d-6be3-4aa6-b19d-e7f2245a7783","resolution":{"observed_at":"2026-08-07T12:58:49.816226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04716","last_updated":"2021-12-09T06:01:01Z","snapshot_observed_at":"2026-08-06T22:36:35.996391Z","submitted_at":"2021-12-09T06:01:01Z","title":"DR3: Value-Based Deep Reinforcement Learning Requires Explicit Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04716","snapshot_observed_at":"2026-08-07T12:58:49.941083Z","title":"DR3: Value- Based Deep Reinforcement Learning Requires Explicit Regularization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.941083Z"},"links":{"cited_paper":"/paper/2112.04716","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:0bdb5b410a86d1c2fe1b597522b1c5a443f31fa05a81327c0be68837b1e75ed3","observation_id":"e0fce54b-56f3-4e46-9d78-a750c2e7257d","resolution":{"observed_at":"2026-08-07T12:58:49.941083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.04034","last_updated":"2021-07-08T17:59:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-08T17:59:59Z","title":"RMA: Rapid Motor Adaptation for Legged Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.04034","snapshot_observed_at":"2026-08-07T12:58:50.021389Z","title":"Rma: Rapid motor adaptation for legged robots","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.021389Z"},"links":{"cited_paper":"/paper/2107.04034","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:adae5dc78ab91ec373359ae8266816947cdf11228072ff63de79fc541861d8b7","observation_id":"b92fdb5d-b34e-42b9-9dd8-0b79474c4011","resolution":{"observed_at":"2026-08-07T12:58:50.021389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:05.542004Z","title":"Offline q-learning on diverse multi-task data both scales and generalizes","venue":null,"work_id":"776447ae-adb4-4954-aa80-f61202ad8190","year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.084622Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:7c0105061771ca4337a224a0fb046cd1175a56c282d82b9fc0705bf2e8cf8e6e","observation_id":"b7b884ea-e9b5-4d08-8c9d-2d6a9dafe2a9","resolution":{"observed_at":"2026-08-07T12:59:05.630424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:05.300940Z","title":"Reinforcement learning with augmented data","venue":null,"work_id":"3fedd4a0-b06e-4b69-82d3-81e0e8d19c54","year":2020},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.148267Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:8efd2c2e1afe2b4d29b1abb0acc41b3ad73e797f9963d72dd9acad4030a6012f","observation_id":"e53f8be0-5c13-4972-8dd5-fe5ce4b48e33","resolution":{"observed_at":"2026-08-07T12:59:05.433016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09754","last_updated":"2025-05-29T15:02:38Z","snapshot_observed_at":"2026-07-06T19:32:28.772012Z","submitted_at":"2024-10-13T07:20:53Z","title":"SimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09754","snapshot_observed_at":"2026-08-07T12:58:50.224254Z","title":"J., Subramanian, K., Wurman, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.224254Z"},"links":{"cited_paper":"/paper/2410.09754","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:1a28818d8d45bee0ee4400eaf7a61ee5383bcf076ce806d3725a2d021441f823","observation_id":"6e598f6e-02ff-41e2-80f0-7de53dca1f64","resolution":{"observed_at":"2026-08-07T12:58:50.224254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15280","last_updated":"2025-05-29T14:58:32Z","snapshot_observed_at":"2026-08-07T17:59:24.158127Z","submitted_at":"2025-02-21T08:17:24Z","title":"Hyperspherical Normalization for Scalable Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15280","snapshot_observed_at":"2026-08-07T12:58:50.269251Z","title":"Hyperspherical normalization for scalable deep reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.269251Z"},"links":{"cited_paper":"/paper/2502.15280","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:13d543ceb82b3613467095bc430320a635b1c8cd238b281b29ec4e98c56a8b3e","observation_id":"0ac955de-f366-46dd-950e-f7f7e1d1f34f","resolution":{"observed_at":"2026-08-07T12:58:50.269251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:05.110477Z","title":"End-to-end training of deep visuomotor policies","venue":null,"work_id":"c47c2b73-99e7-4f29-96f8-1c6ac538b236","year":2016},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.321875Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:2cdd120c8ae1b734b222d55a09a653097bafcf0641c20a1efaaae91cf3033c39","observation_id":"ae14b0df-74e1-4d93-bc6c-6e594c8ee1ac","resolution":{"observed_at":"2026-08-07T12:59:05.163798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T12:58:50.379474Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.379474Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:da4bd9d92a63055742b1ef74c16d180b4cf822a53596d89b9b2bf018573081f8","observation_id":"ba682875-3697-4628-a572-3f871e74de31","resolution":{"observed_at":"2026-08-07T12:58:50.379474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:04.882735Z","title":"Conflict-averse gradient descent for multi-task learning","venue":null,"work_id":"36de019d-0db9-4352-9394-7228240284a5","year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.436638Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:35e7fc570d25eb2415ec96d7f64134e15a962f6d65117e3a7e8d3f5a213d90f5","observation_id":"391030fa-4064-41f5-a09d-32a19b9a97b0","resolution":{"observed_at":"2026-08-07T12:59:05.001905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:04.609240Z","title":"Moka: Open-vocabulary robotic manipulation through mark-based visual prompting","venue":null,"work_id":"9ba3a4e0-ba70-47c8-ac78-7b5c5d584186","year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.496763Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:ac610c9521c3bba18374d5f905d97d32b2496aebd97556dff12f6db0bda352f6","observation_id":"ff021dd4-6f61-420c-ad80-4985741505ef","resolution":{"observed_at":"2026-08-07T12:59:04.743852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:04.385936Z","title":"Scaling laws for fine-grained mixture of experts","venue":null,"work_id":"bf081c12-257e-4888-8169-ef333c33668f","year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.558081Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:f9f0e747f4fc129757e1133b5caeaacb8c2799318bfad24cc5c7f78b79c0513a","observation_id":"91825c01-af53-4a35-827c-03fa771c2fe6","resolution":{"observed_at":"2026-08-07T12:59:04.481489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-07T12:58:50.612205Z","title":"S., Gao, T., Sampaio, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.612205Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:779d99be879911a7b90e0142cb91f7003829a9aa6319babbd7fa7a22a536b9a6","observation_id":"a5446eea-762d-424c-bc91-e942572d7a78","resolution":{"observed_at":"2026-08-07T12:58:50.612205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-07-06T07:21:19.842962Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-07T12:58:50.670391Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.670391Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:80330b1e12898b27c0798a46aae17cd32a78458aa0699173640b2a9503c930bb","observation_id":"2a72955a-105a-4fd6-824e-1a6f81559308","resolution":{"observed_at":"2026-08-07T12:58:50.670391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:04.129530Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":"de4652a7-a81c-4252-96ee-ea91726aa9fd","year":2015},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.729363Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:6fd03dbff69e6848073cf6de523e43193c2f7f5c258b291c2cd14f66295d029a","observation_id":"0add11d2-7c60-4e76-9f95-c193c5bd944f","resolution":{"observed_at":"2026-08-07T12:59:04.257681Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:03.885615Z","title":"P., Mirza, M., Graves, A., Lillicrap, T., Harley, T., Silver, D., and Kavukcuoglu, K","venue":null,"work_id":"ed14ab66-19ea-49f6-a34c-ac43d8a0ab90","year":1928},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.786249Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:0a8bde9c131663340fd6eb89c315f28e2ffc89aa77e3140bc5463f9d9f1cbe8c","observation_id":"b5a37fcc-0fb6-4ddd-b758-ab4199734896","resolution":{"observed_at":"2026-08-07T12:59:03.997563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:03.679659Z","title":"Tactical optimism and pessimism for deep reinforcement learning","venue":null,"work_id":"d501c947-2f7d-4722-9bce-be1b1ab093d6","year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.835032Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:d33d8404d164d869ae5bec276b28ddd26b85c9cf0b387cd0205d79557c929d72","observation_id":"abafc6a0-52de-4d8d-a1fa-c3a640fc15c7","resolution":{"observed_at":"2026-08-07T12:59:03.761137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:03.460114Z","title":"and Cygan, M","venue":null,"work_id":"ea6a27cf-8bea-42a0-acc8-d6977340a6c8","year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.913669Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:bc0633aa3ad94c6527488e16d8ccd1817e8de6a762c6ad74947498849c1f1311","observation_id":"8f320d94-7ca4-4ed6-b067-77c05124fbfe","resolution":{"observed_at":"2026-08-07T12:59:03.545410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-08-07T12:58:51.075651Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.075651Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:faf220973c0dd6f154cef95055ef88c48cc65056d5e62f3154d113986be572cb","observation_id":"19548d37-4bec-43bc-af16-66f226479d82","resolution":{"observed_at":"2026-08-07T12:58:51.075651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16158","last_updated":"2024-12-03T08:42:49Z","snapshot_observed_at":"2026-08-07T12:11:17.938787Z","submitted_at":"2024-05-25T09:53:25Z","title":"Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16158","snapshot_observed_at":"2026-08-07T12:58:51.287792Z","title":"Bigger, regularized, optimistic: scaling for compute and sample-efficient continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.287792Z"},"links":{"cited_paper":"/paper/2405.16158","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:baf152b79c1585f7f48cfc7ee25c6a6a120aaad34fd5b4734875703021319fe5","observation_id":"b79eba20-6d7e-4ddb-b599-54112b534780","resolution":{"observed_at":"2026-08-07T12:58:51.287792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:03.258850Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"08f07840-0baa-4a01-ba5c-c5ef44d56f66","year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.408062Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:f7aa8a34c54052178e20b8a370187bc58f977503e11ad9c182706d3bc83ec353","observation_id":"cc34fa6c-1f32-40c8-b836-35a24ae65bc6","resolution":{"observed_at":"2026-08-07T12:59:03.335629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:51.565324Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.565324Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:59f564da82e3b4ce891ac0710b249e2a3c7f749d0c3b0ce558c7b320ec756bfb","observation_id":"08140eb0-776a-4c7a-be59-1307dba4a575","resolution":{"observed_at":"2026-08-07T12:58:51.565324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06342","last_updated":"2016-02-22T19:59:40Z","snapshot_observed_at":"2026-08-02T01:15:11.394264Z","submitted_at":"2015-11-19T20:17:27Z","title":"Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06342","snapshot_observed_at":"2026-08-07T12:58:51.719632Z","title":"L., and Salakhutdinov, R","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.719632Z"},"links":{"cited_paper":"/paper/1511.06342","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:0972fc2d40016beeb10fed32a5ac5788355eb2317978a3c6335578224d18ae1a","observation_id":"3bba43ec-1eaa-4744-9ece-92d7769e9d23","resolution":{"observed_at":"2026-08-07T12:58:51.719632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09329","last_updated":"2024-10-28T23:33:19Z","snapshot_observed_at":"2026-08-02T19:31:23.537664Z","submitted_at":"2024-06-13T17:07:49Z","title":"Is Value Learning Really the Main Bottleneck in Offline RL?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09329","snapshot_observed_at":"2026-08-07T12:58:51.847608Z","title":"Is value learning really the main bottleneck in offline rl? arXiv preprint arXiv:2406.09329, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.847608Z"},"links":{"cited_paper":"/paper/2406.09329","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:58e2f2f5780e87e9cacda8b52970788051ce24e75c010a582ba4f1baee9300d2","observation_id":"d4eaee66-7207-4e20-a551-212ec8395e2c","resolution":{"observed_at":"2026-08-07T12:58:51.847608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02538","last_updated":"2025-05-25T22:15:41Z","snapshot_observed_at":"2026-08-07T08:16:36.494826Z","submitted_at":"2025-02-04T18:04:05Z","title":"Flow Q-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02538","snapshot_observed_at":"2026-08-07T12:58:51.955281Z","title":"Flow q-learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.955281Z"},"links":{"cited_paper":"/paper/2502.02538","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:b1147700af31be900ed04d7cb95b51b53551339649b110a32595a29d41cae47a","observation_id":"f4dbe154-c0a7-4194-aec4-404adbed9de7","resolution":{"observed_at":"2026-08-07T12:58:51.955281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:52.070645Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.070645Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:7ed0f15541fe5789dd6a1c872576b2d483f197f56400779639260ed9fbf9f2f1","observation_id":"8b01f985-6863-4184-b4fd-d48391dbff62","resolution":{"observed_at":"2026-08-07T12:58:52.070645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:03.020045Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":"aac2e264-218b-46ff-b483-ddda1d175cfd","year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.157484Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:df28039795919127ad12096a871c9bc104544548837ae32e5dc755d4b5260aa9","observation_id":"5c9ea69e-97fa-4277-973e-b05b52d26d1f","resolution":{"observed_at":"2026-08-07T12:59:03.113363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:02.814595Z","title":"Efficient off-policy meta- reinforcement learning via probabilistic context variables","venue":null,"work_id":"bd6d9c11-36a4-44c3-b4ef-4b39ad269cd2","year":2019},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.275833Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:87d39e3667935b576efc02e00af31f1e87236cc79f33cdb0373573c90a2f2efe","observation_id":"1f3c6d5b-3fbd-431d-b5ed-0507340cfac5","resolution":{"observed_at":"2026-08-07T12:59:02.900845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-08T03:18:33.595658Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-07T12:58:52.357891Z","title":"G., Novikov, A., Barth-Maron, G., Gimenez, M., Sulsky, Y ., Kay, J., Springenberg, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.357891Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:beaf0084fa6cae78ffd2f682b93134ae8aa697ceb2117ce9d448e7d26903096f","observation_id":"0935f476-d90e-4a90-ab89-f9845ff239e6","resolution":{"observed_at":"2026-08-07T12:58:52.357891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06295","last_updated":"2016-01-07T18:43:03Z","snapshot_observed_at":"2026-07-06T04:37:06.738855Z","submitted_at":"2015-11-19T18:38:47Z","title":"Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06295","snapshot_observed_at":"2026-08-07T12:58:52.473229Z","title":"A., Colmenarejo, S","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.473229Z"},"links":{"cited_paper":"/paper/1511.06295","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:7c1e6afe132232b28ff043f91f264f62ce14f67613b1a7c111e5c9e17227e8d6","observation_id":"fe4849cb-8398-425d-b46a-d6a609b6f0a4","resolution":{"observed_at":"2026-08-07T12:58:52.473229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-05T01:44:07.276914Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04327","snapshot_observed_at":"2026-08-07T12:58:52.599976Z","title":"Value-based deep rl scales predictably","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.599976Z"},"links":{"cited_paper":"/paper/2502.04327","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:6e833d15f2081047d7d73c167bf0e2387f070ead0c3d3c2807ae470496b4eb18","observation_id":"c54498a5-69f8-4676-9eeb-e9dc48e64daa","resolution":{"observed_at":"2026-08-07T12:58:52.599976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:02.581156Z","title":"D., Courville, A., and Bachman, P","venue":null,"work_id":"d3636655-68ce-402c-8104-4d6dcbbfc87a","year":2020},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.687060Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:a2537f49dff3f3f2711fe20b5a1104244eb237af46f65fd312fc05418c53e4c3","observation_id":"312c1e26-ea4e-4218-b376-37e15e0b2dfc","resolution":{"observed_at":"2026-08-07T12:59:02.700604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:02.333447Z","title":null,"venue":null,"work_id":"dc077be4-5a64-4ec4-82f7-a0f380abd1c7","year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.799338Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:3c11898f93e9c62836f59961c8ca5b9296447e3decd8dd77a4069279b0f42567","observation_id":"2bf15b1f-6df2-48bb-9ed5-19c29a58c920","resolution":{"observed_at":"2026-08-07T12:59:02.436833Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:02.076431Z","title":"and Koltun, V","venue":null,"work_id":"72149335-f50c-4e36-9971-bb6f053691bd","year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.948108Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:bdb3e106943d33d2107c0e208ab962cd00166906614064cde37e1ae409fe7666","observation_id":"980db95b-203d-45db-9dc7-f0f6d759858c","resolution":{"observed_at":"2026-08-07T12:59:02.224585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10506","last_updated":"2024-06-18T18:11:07Z","snapshot_observed_at":"2026-08-04T05:16:12.953751Z","submitted_at":"2024-03-15T17:45:44Z","title":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10506","snapshot_observed_at":"2026-08-07T12:58:53.082154Z","title":"Humanoidbench: Simu- lated humanoid benchmark for whole-body locomotion and manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:53.082154Z"},"links":{"cited_paper":"/paper/2403.10506","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:02c9fadab1ccb1415a567532a864d642accfcb82713e23adad34152c479444af","observation_id":"26518396-25da-4193-9b3b-c8c1a5ad8717","resolution":{"observed_at":"2026-08-07T12:58:53.082154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:01.774639Z","title":null,"venue":null,"work_id":"5f53017d-f8c1-4808-9c8a-c0b8d92f653a","year":1953},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:53.239036Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:4e3d2f9f0ad2ce2b697005676d05c0150021c417ef6fe51dc16ff7885bad98cd","observation_id":"2d99e650-1b44-4599-ae47-53f38f3ab586","resolution":{"observed_at":"2026-08-07T12:59:01.908957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:01.443620Z","title":"Deterministic policy gradient algorithms","venue":null,"work_id":"266345a3-624f-4e53-83f4-8e20a705aa81","year":2014},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:53.386932Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:68cee51a2753b8001be09021620ba64f313debb521b67c6d68217026590cce55","observation_id":"d63ad454-a067-4c4b-8a9c-4c038b1d35fd","resolution":{"observed_at":"2026-08-07T12:59:01.644985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:53.487874Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:53.487874Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:d303ebe043815f169243847120b54002a1309409682fb16092b5003f00fd6acc","observation_id":"6390f0ca-ea85-4fef-9b4a-b50d88db26b9","resolution":{"observed_at":"2026-08-07T12:58:53.487874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:01.134423Z","title":"Multi-task reinforcement learning with context-based representations","venue":null,"work_id":"7b88aee2-349b-48c6-b25d-529eb5813bd2","year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:53.631167Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:81d63c51561ac2ee91f73133c2adacece2ba6c356fff4d6475e19d9b235bee4d","observation_id":"efe21a7b-af83-4aea-b805-06006d46249a","resolution":{"observed_at":"2026-08-07T12:59:01.310812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:00.817060Z","title":"T., Abdolmaleki, A., Zhang, J., Groth, O., Bloesch, M., Lampe, T., Brakel, P., Bechtle, S","venue":null,"work_id":"64b33252-50d0-4765-bf3b-e1da76633dbe","year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:53.780565Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:ab4df1f0b2d9ee6acd334b424c6c7f9101bf3a8167b2f777577b03f6e75e4fc3","observation_id":"c9aa705f-9b4b-44d3-a5c5-4b0ef5788f1a","resolution":{"observed_at":"2026-08-07T12:59:00.982770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:00.563658Z","title":"Paco: Parameter-compositional multi-task reinforcement learning","venue":null,"work_id":"a1a79568-c6d9-431f-b7f8-0da5e2bc8adc","year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:53.893424Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:a691ebc0f56695024a599eeed86182c83f3955c126cd7a1369662980a12a37f4","observation_id":"517bebf6-d433-4734-b018-4b8d1cc626b7","resolution":{"observed_at":"2026-08-07T12:59:00.682511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:54.004334Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:54.004334Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:bace1ffccbea35d60874258262b265c3302a6eb3c975b6fac28c871a19811055","observation_id":"3638475a-9732-4c67-a418-49cf4febf075","resolution":{"observed_at":"2026-08-07T12:58:54.004334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T12:58:54.169006Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:54.169006Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:10801d73820bc1fceeeb306720246d140d40b00b3a274e294d5b1af4b5d0f3a4","observation_id":"f4797f4a-225b-42be-bab4-c83fa7fde7b1","resolution":{"observed_at":"2026-08-07T12:58:54.169006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:58:54.270164Z","title":"M., Hauth, A., Millican, K., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:54.270164Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:770e3e195fc6cd788bef36a26067657ec1a899fff5b1b4ee17632f81d66d8784","observation_id":"9ad56e27-cc51-49c5-973b-9397858f3258","resolution":{"observed_at":"2026-08-07T12:58:54.270164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-07T12:58:54.408075Z","title":"M., Ghosh, D., Walke, H., Pertsch, K., Black, K., Mees, O., Dasari, S., Hejna, J., Kreiman, T., Xu, C., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:54.408075Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:a1c864ab16f27875405180e38941cc796a19d6eada49e11d8182ee436443f1dd","observation_id":"13c97a2e-7c15-4072-ada9-4c0f675e3410","resolution":{"observed_at":"2026-08-07T12:58:54.408075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:00.248000Z","title":"M., Quan, J., Kirkpatrick, J., Hadsell, R., Heess, N., and Pascanu, R","venue":null,"work_id":"cc577163-cc36-4c41-9faf-e5286e99bb02","year":2017},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:54.542081Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:f13e3e7038d1a0a2eefb159d0bf89d4f013f752f2a881bc2859d7847083d38ac","observation_id":"4abc9372-2b55-4050-b912-923702c19438","resolution":{"observed_at":"2026-08-07T12:59:00.375399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":118},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 118 outbound references and 9 inbound Pith citation observations for arXiv:2505.23150."}