{"as_of":"2026-08-18T10:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6d815eea21922020a3e3bbca79798b4ee8fc0223be9c765864919ba2c5023b7","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T02:55:51.213516Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:32:45.565975Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T00:32:48.529904Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"cited_work":{"arxiv_id":"2602.09580","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.09580","snapshot_observed_at":"2026-08-06T00:32:48.529904Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","venue":"cs.RO","work_id":"e1d876ac-e14e-48c7-a75f-12b033447211","year":2026},"citing_paper":{"arxiv_id":"2608.01205","last_updated":"2026-08-02T12:42:20Z","snapshot_observed_at":"2026-08-17T03:46:01.250814Z","submitted_at":"2026-08-02T12:42:20Z","title":"ReBRAC-v2: The Return of the King","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T00:32:45.565975Z"},"links":{"cited_paper":"/paper/2602.09580","citing_paper":"/paper/2608.01205"},"observation_digest":"sha256:6be4c376eeaca2c421520fe051d6e2064c62d0a7c4983f00771c80fc243fd431","observation_id":"590b2b17-5457-4ccd-8bf8-1bbbe2747d93","resolution":{"observed_at":"2026-08-06T00:32:48.617933Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.09580/citation-record","integrity":"/paper/2602.09580/integrity","json":"/paper/2602.09580/citation-record.json","paper":"/paper/2602.09580"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.11096","last_updated":"2023-01-30T11:28:55Z","snapshot_observed_at":"2026-08-16T16:14:42.774975Z","submitted_at":"2022-11-20T21:57:10Z","title":"Let Offline RL Flow: Training Conservative Agents in the Latent Space of Normalizing Flows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11096","snapshot_observed_at":"2026-08-03T02:53:09.350819Z","title":"Let offline rl flow: Training conservative agents in the latent space of normalizing flows.arXiv preprint arXiv:2211.11096, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:09.350819Z"},"links":{"cited_paper":"/paper/2211.11096","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:ff50e62976c255aafa0f2e17c8cbbff51700ebd15cab6fbdc49ae450a74937a8","observation_id":"71f5a7c8-9934-4277-96bb-3ad95448799d","resolution":{"observed_at":"2026-08-03T02:53:09.350819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:53:13.860281Z","title":"Policyflow: Policy optimization with con- tinuous normalizing flow in reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:13.860281Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:26626a66bf981e263ee0ae1adce939a342bbd685f196304f8f02970e9d272936","observation_id":"ff7f9489-32a4-40a1-9647-c987f1b41fc4","resolution":{"observed_at":"2026-08-03T02:53:13.860281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:53:13.971382Z","title":"Efficient online reinforcement learning with offline data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:13.971382Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:697e69e05c23e99d514f57afc67e2bd5abc9295a50e25e5c4a52229f263edfa6","observation_id":"12daca46-37f1-4bfd-9924-be0669bb7637","resolution":{"observed_at":"2026-08-03T02:53:13.971382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11802","last_updated":"2022-11-21T19:10:27Z","snapshot_observed_at":"2026-08-16T16:14:24.609732Z","submitted_at":"2022-11-21T19:10:27Z","title":"Improving TD3-BC: Relaxed Policy Constraint for Offline Learning and Stable Online Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11802","snapshot_observed_at":"2026-08-03T02:53:14.061010Z","title":"Improving td3-bc: Relaxed policy constraint for offline learning and stable online fine-tuning.arXiv preprint arXiv:2211.11802, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:14.061010Z"},"links":{"cited_paper":"/paper/2211.11802","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:826b8ae93b705a30fdd13689b729b1f33cee84c356bd40b6709b1d624ee7f21e","observation_id":"89260a7d-7d73-4d9d-ad97-af1777d7af74","resolution":{"observed_at":"2026-08-03T02:53:14.061010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-03T02:53:14.198220Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:14.198220Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:ec458819f6809848d49fffc14a36ee63ef180efc22ea84486d41987b911a284a","observation_id":"134c3080-53b2-4137-a4ed-2487c59a5ee3","resolution":{"observed_at":"2026-08-03T02:53:14.198220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07339","last_updated":"2025-12-05T07:35:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T01:01:59Z","title":"Real-Time Execution of Action Chunking Flow Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07339","snapshot_observed_at":"2026-08-03T02:53:14.320957Z","title":"Real-time execution of action chunking flow policies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:14.320957Z"},"links":{"cited_paper":"/paper/2506.07339","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:e55af88c84f04913ab8c953ce407a8196b16107ef4abcf74acbf1aa9e9ea6247","observation_id":"a5c4e392-2cbf-4046-acad-e4846cb7a160","resolution":{"observed_at":"2026-08-03T02:53:14.320957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-03T02:53:14.422579Z","title":"arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:14.422579Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:e4c99c01fb61477383e1fa4790343161d0c8fdf1c77dda6bcf9de6d2e3233e89","observation_id":"83687396-7544-44cf-bb93-1ad1efd7008f","resolution":{"observed_at":"2026-08-03T02:53:14.422579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:53:14.534069Z","title":"Training-time action conditioning for efficient real-time chunking.arXiv preprint arXiv:2512.05964, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:14.534069Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:f8183cfa50777b2a31d83567c5c74196fc195182ac0e06fe2de9c6e3f6f314e0","observation_id":"6e26714a-8ea8-4a19-ad4c-c53fa5e82bb5","resolution":{"observed_at":"2026-08-03T02:53:14.534069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:53:14.657367Z","title":"Maximum entropy reinforcement learning via energy-based normal- izing flow.Advances in Neural Information Processing Systems, 37:56136–56165, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:14.657367Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:41de0216391c3b7fd3c9add52beb9e01551e6df2674284024e79845f044f3b49","observation_id":"6a3fab07-8f2d-4c36-a29d-e9187697319d","resolution":{"observed_at":"2026-08-03T02:53:14.657367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-03T02:53:14.720586Z","title":"Diffusion policy: Visuomotor policy learning via ac- tion diffusion.CoRR, abs/2303.04137, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:14.720586Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:0dc3ab6ba72c1ef6dac199ed7e8dd3edcd47c3169410bfd3378ffa8ad23baba9","observation_id":"5942f5c4-574f-4c0f-a565-d6662b0c52e2","resolution":{"observed_at":"2026-08-03T02:53:14.720586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:53:14.798378Z","title":"Christoph, Maximilian Eberlein, Filippos Katsimalis, Arturo Roberti, Aristotelis Sympetheros, Michel R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:14.798378Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:81db7c8d554a01b90bce8f1de6ced662d7ce46be07850dde2f3579b854bb274e","observation_id":"f94950b0-12ea-4937-8ee5-1a02012d7efa","resolution":{"observed_at":"2026-08-03T02:53:14.798378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:53:14.889076Z","title":"The ingredients for robotic diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:14.889076Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:fabf198c0019d3b2316e6344c5165432ff2e3201da3234746ed29b9679d57f0c","observation_id":"a747729d-4a95-45ed-88db-adfbc1648481","resolution":{"observed_at":"2026-08-03T02:53:14.889076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1605.08803","last_updated":"2017-02-27T23:21:10Z","snapshot_observed_at":"2026-08-10T10:35:06.780085Z","submitted_at":"2016-05-27T21:24:32Z","title":"Density estimation using Real NVP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.08803","snapshot_observed_at":"2026-08-03T02:53:14.957963Z","title":"Density estimation using real nvp.arXiv preprint arXiv:1605.08803, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:14.957963Z"},"links":{"cited_paper":"/paper/1605.08803","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:ced9528fa6aa84b0126d9304db58af1e91cb87d1a3092c6f504a7ee95f55b55e","observation_id":"45651882-016c-40a2-b295-56a05dc2604f","resolution":{"observed_at":"2026-08-03T02:53:14.957963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:53:15.069207Z","title":"Hyperparameters in reinforcement learning and how to tune them","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:15.069207Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:ddfbd1eca3d09531bac36fd9bc673b87c9860b627ca597a3feae3ccc5daeb4bf","observation_id":"187113fe-a7d7-49d0-aed3-d7a03f715ffb","resolution":{"observed_at":"2026-08-03T02:53:15.069207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-08-16T14:12:12.612018Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-03T02:53:15.129472Z","title":"Stop regressing: Training value functions via clas- sification for scalable deep rl.arXiv preprint arXiv:2403.03950, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:15.129472Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:1b3dc1323c42ccf9f60bb2c3b3d07761b32d408344e8e4e90ae68ff472f44d07","observation_id":"94defd6d-5c96-4f7e-98bd-d0d42e4ee0a4","resolution":{"observed_at":"2026-08-03T02:53:15.129472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-16T08:32:46.407746Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-03T02:53:15.220023Z","title":"D4rl: Datasets for deep data-driven reinforcement learning.arXiv preprint arXiv:2004.07219, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:15.220023Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:73356b1722cdffb871738ce7aa3113076baffcde2ca07e610a640a8e9868ab2e","observation_id":"eb39c09e-d1d7-408d-b62c-421242145b72","resolution":{"observed_at":"2026-08-03T02:53:15.220023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:53:15.310444Z","title":"A minimalist approach to offline reinforcement learning.Advances in neural information processing systems, 34:20132–20145, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:15.310444Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:ea3a53c1c0b1a8efd84280147c53cb1854b77f0071a6160e94bc92c27180f4e7","observation_id":"5ef6e14c-dc7e-4a70-ab23-36db250a459e","resolution":{"observed_at":"2026-08-03T02:53:15.310444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23527","last_updated":"2026-06-25T14:27:54Z","snapshot_observed_at":"2026-08-17T20:03:08.072659Z","submitted_at":"2025-05-29T15:06:22Z","title":"Normalizing Flows are Capable Models for Continuous Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23527","snapshot_observed_at":"2026-08-03T02:53:15.393499Z","title":"Normalizing flows are capable models for RL.CoRR, abs/2505.23527,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:15.393499Z"},"links":{"cited_paper":"/paper/2505.23527","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:4cbb4364de7984e5612d55a944924d9ca8d86913d7a1f7b48a13992d6124bd58","observation_id":"bf4a6611-997d-4015-a63d-f5cec87709c2","resolution":{"observed_at":"2026-08-03T02:53:15.393499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:53:15.614836Z","title":"Dextreme: Transfer of agile in-hand manipulation from simulation to reality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:15.614836Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:aee44b5df9761f4b0b9625379f55fb2999f7f085ae3410f63a45a9c02d6a3af2","observation_id":"4d7be578-7f31-4367-bd8f-da5e8e5f3d1e","resolution":{"observed_at":"2026-08-03T02:53:15.614836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-03T02:53:15.761858Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:15.761858Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:e4a4b4c06dd8a13be86f2b563cdc1ce15c5a14cf81f6586c0c488ba3d572e110","observation_id":"a333b06e-2776-48d0-90fe-79f3c6a0eb65","resolution":{"observed_at":"2026-08-03T02:53:15.761858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-17T03:52:51.850185Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-03T02:53:15.824747Z","title":"Imitation bootstrapped reinforcement learning.arXiv preprint arXiv:2311.02198, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:15.824747Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:b2e7ea31018f1228dfbde9d75df6308c71dfcb537eb37701701a408b1f387a43","observation_id":"91e03d56-ccaa-484a-b157-72e9ca970545","resolution":{"observed_at":"2026-08-03T02:53:15.824747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:53:15.934757Z","title":"Improving regres- sion performance with distributional losses","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:15.934757Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:ed719879b72cfc90f4ce43689843dd3fa076212bd4448fa7bd2f20a7fd88e979","observation_id":"64f6d4f7-0c47-4f64-bd65-6d5255821333","resolution":{"observed_at":"2026-08-03T02:53:15.934757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-03T02:53:16.108040Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:16.108040Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:f8e3eb4c31a071c86926851b9528055390de9798e2e5264cd6bce78f95e07bb8","observation_id":"30299ff5-a561-4b6e-865d-6883cb23ea8c","resolution":{"observed_at":"2026-08-03T02:53:16.108040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T02:53:16.234139Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:16.234139Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:a74c6fa1bf68440e27e778a1d862a9b93851adb84f8940c130406c7042240683","observation_id":"2e14a9a8-b0db-46fd-917c-51ac4d7493bd","resolution":{"observed_at":"2026-08-03T02:53:16.234139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:53:16.382202Z","title":"Learning stable normalizing-flow control for robotic manipulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:16.382202Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:e1e90f69360fca41ee3be0d8553d6ff868c0b5a313892ebab1846a5ae31b04af","observation_id":"f26b2260-8424-481d-ac56-423caba05b27","resolution":{"observed_at":"2026-08-03T02:53:16.382202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15129","last_updated":"2024-12-19T18:09:42Z","snapshot_observed_at":"2026-08-13T15:21:05.914777Z","submitted_at":"2024-12-19T18:09:42Z","title":"Jet: A Modern Transformer-Based Normalizing Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15129","snapshot_observed_at":"2026-08-03T02:53:16.466532Z","title":"Jet: A modern transformer-based normalizing flow.arXiv preprint arXiv:2412.15129, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:16.466532Z"},"links":{"cited_paper":"/paper/2412.15129","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:03e2dfd0507b3c00a7b0f8fced9af2f9276e49cd0755e326abbb9fecc7dc0d40","observation_id":"d1ab1d5a-5e1d-4232-bf97-38c71ff2fd44","resolution":{"observed_at":"2026-08-03T02:53:16.466532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-03T02:53:16.595689Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:16.595689Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:5ba031676b6777d7de5247766caa71903e02a7d57190aa6b83d176afe87fa7d5","observation_id":"dfddc979-3e71-4b82-8edf-f7c9a5014c74","resolution":{"observed_at":"2026-08-03T02:53:16.595689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07969","last_updated":"2026-05-11T17:12:21Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:48:03Z","title":"Reinforcement Learning with Action Chunking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07969","snapshot_observed_at":"2026-08-03T02:54:49.105148Z","title":"Re- inforcement learning with action chunking.CoRR, abs/2507.07969, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T02:54:49.105148Z"},"links":{"cited_paper":"/paper/2507.07969","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:4bf7635d62b796b2e93edf6e20101cb0bc6e61a5aed7f1e99bc47dad6604d3a8","observation_id":"cb5c1dcf-ab6a-48c8-b39a-f522c8b1eef6","resolution":{"observed_at":"2026-08-03T02:54:49.105148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:48.801820Z","title":"Normalizing flows are capable visuo- motor policy learning models.CoRR, abs/2509.21073,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:48.801820Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:03da7bc891423c5404a217a38c2f28a4427ebd6673bf91bcbe5f7c2f29f41f8e","observation_id":"bc4abe7c-823f-45ca-893d-2ae1382e9783","resolution":{"observed_at":"2026-08-03T02:55:48.801820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-03T02:55:50.506340Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.506340Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:079bf56aabc5e1b161a55cf785c222c5b5e73c3b7d8d37bfbad8218491df76e5","observation_id":"d647d90e-6476-481e-9cc3-114012608dcb","resolution":{"observed_at":"2026-08-03T02:55:50.506340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.482338Z","title":"URL https: //doi.org/10.48550/arXiv.2509.21073","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.482338Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:80d4171e7d95ce75139a2f92cb3a1fe0807b646ea71e9e7c7b07afcd3adcbf71","observation_id":"2b23b7f2-c533-4a63-9e5c-7620726bcad0","resolution":{"observed_at":"2026-08-03T02:55:50.482338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-08-14T11:25:08.505775Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-08-03T02:55:50.531636Z","title":"What matters in learning from offline human demon- strations for robot manipulation.arXiv preprint arXiv:2108.03298, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.531636Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:b23bdb359a38081813bd80763917b39386135c584102973a1335067b6983a859","observation_id":"767181dc-f935-436c-9d52-85a1ee797869","resolution":{"observed_at":"2026-08-03T02:55:50.531636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.518390Z","title":"SERL: A software suite for sample-efficient robotic reinforcement learn- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.518390Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:7f84f44a40f3e678fc103786820fe52b79ce5228cf7824433bfa7398b147403c","observation_id":"fc9be043-e688-4165-9f1f-c951e2eef4cb","resolution":{"observed_at":"2026-08-03T02:55:50.518390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-16T00:33:32.243656Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-08-03T02:55:50.559508Z","title":"Flow matching policy gradients","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.559508Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:1c0ecc015a1ea79545e91ccefcd427f511738bdf56f90d8d72ce67689ad080d8","observation_id":"02cc83af-386b-48db-be1b-38a7ae9bbf7a","resolution":{"observed_at":"2026-08-03T02:55:50.559508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.543047Z","title":"Leveraging exploration in off-policy algorithms via normalizing flows","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.543047Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:b584d221d2d0ff35587054bc1fd0948e6400cf63c423a707f83c88812bd8a32b","observation_id":"e31bb1ab-0fed-4fb7-883a-42c63f121258","resolution":{"observed_at":"2026-08-03T02:55:50.543047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.589068Z","title":"Carlson, Ji Yuan Feng, Ani- mesh Garg, Renato Gasoto, Lionel Gulich, Yijie Guo, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.589068Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:e7361548594396ac1484702a4849715415167660b72c2fcd9bdeb53f56b89933","observation_id":"6649bd35-e02d-4ddf-859c-a06a5b86b06e","resolution":{"observed_at":"2026-08-03T02:55:50.589068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.573986Z","title":"Learning robust perceptive locomotion for quadrupedal robots in the wild.Science robotics, 7(62):eabk2822, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.573986Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:ceccf1b2530fff9f77defa07158229291e2d1f90bc2155d2427da83999af6948","observation_id":"c3a26140-9227-4249-b3fd-0736035272b3","resolution":{"observed_at":"2026-08-03T02:55:50.573986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.636256Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning.Advances in Neural Information Processing Systems, 36:62244–62269, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.636256Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:bfa6065639e2479264784b7fb33bae5dbd4486a8df62895e8b33aee596bd21dc","observation_id":"2ac006e3-666f-42cf-a077-61ed8f3fa571","resolution":{"observed_at":"2026-08-03T02:55:50.636256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04831","last_updated":"2025-11-06T21:43:02Z","snapshot_observed_at":"2026-08-16T09:41:41.700782Z","submitted_at":"2025-11-06T21:43:02Z","title":"Isaac Lab: A GPU-Accelerated Simulation Framework for Multi-Modal Robot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04831","snapshot_observed_at":"2026-08-03T02:55:50.596303Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.596303Z"},"links":{"cited_paper":"/paper/2511.04831","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:4211bafdd6da30071a856e9320e11d2ec0437dd862af9de9f23cb452630bb0dc","observation_id":"33d8fbbf-c451-4060-87cd-b3e92511b24e","resolution":{"observed_at":"2026-08-03T02:55:50.596303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-03T02:55:50.617366Z","title":"Awac: Accelerating online reinforce- ment learning with offline datasets.arXiv preprint arXiv:2006.09359, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.617366Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:9016293786e8c684ee9fe9f9c98be9cdb54ce5cf27752011617786de1e7a7fc1","observation_id":"2a937616-fd18-4884-9240-d248620516d5","resolution":{"observed_at":"2026-08-03T02:55:50.617366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.681810Z","title":"Ren, Justin Lidard, Anthony Simeonov, Lars Lien Ankile, Pulkit Agrawal, Anirudha Majumdar, Benjamin Burchfiel, Hongkai Dai, and Max Simchowitz","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.681810Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:98128492ee414f89ea54780d915da04140571c8303ea870bfe71166b870ff72f","observation_id":"d0971a15-1b6b-4324-a45d-07078c50e519","resolution":{"observed_at":"2026-08-03T02:55:50.681810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-03T02:55:50.650040Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.650040Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:3541456f651213b4e86d57a59e187dc13167ed18d1b89258739064923c3ee196","observation_id":"e267106a-ecde-48ca-95ae-4e260bf5761d","resolution":{"observed_at":"2026-08-03T02:55:50.650040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-16T13:05:48.031658Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-03T02:55:50.664859Z","title":"Ogbench: Benchmarking offline goal- conditioned rl.arXiv preprint arXiv:2410.20092, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.664859Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:65cdc6ec2beffe152b56c61471c64eafd95200d979b3b2d31f51cc2a58e7cf54","observation_id":"51faad8d-45e9-4094-90c7-8d8b21cb8b97","resolution":{"observed_at":"2026-08-03T02:55:50.664859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10448","last_updated":"2022-07-24T06:08:35Z","snapshot_observed_at":"2026-08-17T20:37:58.332418Z","submitted_at":"2022-02-21T18:59:59Z","title":"Robotic Telekinesis: Learning a Robotic Hand Imitator by Watching Humans on Youtube","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10448","snapshot_observed_at":"2026-08-03T02:55:50.724671Z","title":"Robotic telekinesis: Learning a robotic hand imita- tor by watching humans on youtube.arXiv preprint arXiv:2202.10448, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.724671Z"},"links":{"cited_paper":"/paper/2202.10448","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:f65b303398334981017e816a6a1ad1a8aa04a97db24b200231df60e77605bf72","observation_id":"2ca42462-879a-4a24-9864-af2cf281f538","resolution":{"observed_at":"2026-08-03T02:55:50.724671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.698532Z","title":"Variational infer- ence with normalizing flows","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.698532Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:6c6a180d768f60e60c8e02fd5e6c76f612a6ae611696242c0f81cf6fa838b0cb","observation_id":"65bbef3c-086a-460f-9520-f26c9dbd42bb","resolution":{"observed_at":"2026-08-03T02:55:50.698532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10771","last_updated":"2025-09-13T01:31:43Z","snapshot_observed_at":"2026-08-15T11:57:23.658887Z","submitted_at":"2025-09-13T01:31:43Z","title":"RSL-RL: A Learning Library for Robotics Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.10771","snapshot_observed_at":"2026-08-03T02:55:50.711955Z","title":"Rsl-rl: A learning library for robotics research.arXiv preprint arXiv:2509.10771, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.711955Z"},"links":{"cited_paper":"/paper/2509.10771","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:8b3d9773abd4a1f61ed5c1362a68fe10000380c80a58c12952e60cb0f8423dea","observation_id":"b216fdfb-4ac4-42a6-9bf3-d87a189c4e08","resolution":{"observed_at":"2026-08-03T02:55:50.711955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.775706Z","title":"Corl: Research-oriented deep offline reinforcement learning library.Advances in Neural Information Processing Systems, 36:30997–31020, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.775706Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:d3b637a5cd2a9902e9c4bae7aeacc72596f57437ba2fde482f94408c3171bee5","observation_id":"2d0b1dff-94ec-4416-bd03-a2b1cb757831","resolution":{"observed_at":"2026-08-03T02:55:50.775706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07860","last_updated":"2022-08-16T17:37:36Z","snapshot_observed_at":"2026-08-16T16:38:51.702743Z","submitted_at":"2022-08-16T17:37:36Z","title":"A Walk in the Park: Learning to Walk in 20 Minutes With Model-Free Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.07860","snapshot_observed_at":"2026-08-03T02:55:50.745366Z","title":"A walk in the park: Learning to walk in 20 minutes with model-free reinforcement learning.arXiv preprint arXiv:2208.07860, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.745366Z"},"links":{"cited_paper":"/paper/2208.07860","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:3f9585783774f5818ef54ede66fed6cca2e057964328c39fc51c36c483ae24bf","observation_id":"d0b0b0e8-b22e-47a1-9907-9cab4e547686","resolution":{"observed_at":"2026-08-03T02:55:50.745366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.760001Z","title":"Revisiting the minimalist ap- proach to offline reinforcement learning.Advances in Neural Information Processing Systems, 36:11592– 11620, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.760001Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:df4a7e992cb3334629390ba5f01c5562e034489a468c8a0c0e65ca4f61793ec4","observation_id":"0168f7c0-7023-473c-87d9-a1a1789ed304","resolution":{"observed_at":"2026-08-03T02:55:50.760001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.816881Z","title":"Nina: Normalizing flows in action","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.816881Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:8ee3195f9c81bc26622f747e828f187a1749000820f3430c48e01d14d00476f4","observation_id":"6f52746c-7015-44de-af1f-81e3c9ebd024","resolution":{"observed_at":"2026-08-03T02:55:50.816881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06309","last_updated":"2024-11-16T14:03:22Z","snapshot_observed_at":"2026-08-16T13:44:32.661832Z","submitted_at":"2024-06-10T14:25:11Z","title":"Is Value Functions Estimation with Classification Plug-and-play for Offline Reinforcement Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06309","snapshot_observed_at":"2026-08-03T02:55:50.791145Z","title":"Is value functions estimation with classification plug-and-play for offline reinforcement learning?arXiv preprint arXiv:2406.06309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.791145Z"},"links":{"cited_paper":"/paper/2406.06309","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:ad10c24d07ae7cf26aebf37d6b02c709aabf52df02aef5a629666eabce93e4fb","observation_id":"4729479e-c980-4099-87b2-4c67855cfe07","resolution":{"observed_at":"2026-08-03T02:55:50.791145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07606","last_updated":"2024-11-21T14:35:28Z","snapshot_observed_at":"2026-08-17T23:25:14.330429Z","submitted_at":"2024-09-11T20:35:29Z","title":"The Role of Deep Learning Regularizations on Actors in Offline RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07606","snapshot_observed_at":"2026-08-03T02:55:50.805349Z","title":"The role of deep learning regularizations on actors in offline rl.arXiv preprint arXiv:2409.07606, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.805349Z"},"links":{"cited_paper":"/paper/2409.07606","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:ae1c6ba0bb1f2e32a2afcfe070fa98bab5de3fe980d76f42635670f3c8cec953","observation_id":"3535bd9b-0478-4cba-b316-ca9feb83c891","resolution":{"observed_at":"2026-08-03T02:55:50.805349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-08-01T16:34:39.855742Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-08-03T02:55:50.838179Z","title":"3d diffusion policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.838179Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:053b4952030c5107cb3d5c4d61c096eff588802aa6a27ea2c9c9e342f266577d","observation_id":"1f7cb961-c0d0-4379-b261-37d78ea6daa1","resolution":{"observed_at":"2026-08-03T02:55:50.838179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.849119Z","title":"Re- inflow: Fine-tuning flow matching policy with online re- inforcement learning.arXiv preprint arXiv:2505.22094, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.849119Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:835d37957e88f7573b6b0d9e0d6c917d25a76080c0e98dc8c3723a1b22181a8d","observation_id":"8b5c9968-f73a-480f-b37d-4c87eed3a36c","resolution":{"observed_at":"2026-08-03T02:55:50.849119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-03T02:55:50.885750Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware.arXiv preprint arXiv:2304.13705, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.885750Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:31c93c0f2dc1b60f96dd7c2a002542ee030acc2e40d08cddd3988a2c11575526","observation_id":"c6038aa9-3332-468f-aa0a-a0954fcbbbed","resolution":{"observed_at":"2026-08-03T02:55:50.885750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.902474Z","title":"Places: A 10 million image database for scene recognition.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.902474Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:6b695d0e7a9c0bb9392006f3d07bf2a83261fb81cc00590d909898cf8efad175","observation_id":"a3f72e00-7350-479e-9e50-c4c872928428","resolution":{"observed_at":"2026-08-03T02:55:50.902474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.916327Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.916327Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:2b3e2fe3b555f8c012081727be4914053f9de2d12fe0e93a92df0880b97effac","observation_id":"768baa4b-6f19-4446-8581-765c9f66e3e0","resolution":{"observed_at":"2026-08-03T02:55:50.916327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.933772Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.933772Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:521c72da5baf88e1c77236fe2a68db9e8779a6a6046a26917a7aa58ef15141ac","observation_id":"ab80c5b9-8273-476b-b9a1-b54141ae3b04","resolution":{"observed_at":"2026-08-03T02:55:50.933772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.953491Z","title":"Human finger postures are retargeted to the robotic hand joint angles using an energy-based retargeting method [44]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.953491Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:b2cc5a0dd8c7c84eee28a345be5e1f3feb5af112d8879b4280eecbd5359aa214","observation_id":"affab780-9386-439a-96ba-5607fb615fdf","resolution":{"observed_at":"2026-08-03T02:55:50.953491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:50.975256Z","title":"7, the policy uses 1 step of observation and 3 steps of prefix actions following the observation and predicts a subsequent chunk of 10 steps of actions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.975256Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:aa7b962a7769a637d5b3a4de2e2736c4b48fbda8fffb5e0af43f0d06441e3bfb","observation_id":"e6d297ea-9b93-40b4-8a1b-11e90619c03d","resolution":{"observed_at":"2026-08-03T02:55:50.975256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:51.003893Z","title":"Specifically, we define 2 distinct test positions for the scissors and 5 distinct test positions for the tape holder","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:51.003893Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:ff3203d29c7fd9a9504221e957fedb513b35d71fd6a97982e4147bc100968e2e","observation_id":"6360661f-e133-420d-9e70-173538616bbf","resolution":{"observed_at":"2026-08-03T02:55:51.003893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:51.027469Z","title":"Both the training and the inference runs on a desktop with NVIDIA RTX 4090 GPU","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:51.027469Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:7e7c4e459a1741cd553d645728bbb3924fa049ff7a8c6e7ca0e64e5bf69a0060","observation_id":"07f07909-04f5-40b4-bc27-04e44090ca1c","resolution":{"observed_at":"2026-08-03T02:55:51.027469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:51.051740Z","title":"To estimate the cube pose, which is provided as input to the policy, we follow the same approach as in [19]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:51.051740Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:c42d982b57c80c8b4bd5c02d8e5289594f1eae8653ff4464870eaf704a98fbe3","observation_id":"f45c0e19-b4cf-4a67-a97b-7c84a80477b5","resolution":{"observed_at":"2026-08-03T02:55:51.051740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:51.084056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:51.084056Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:62d6933b9c881ba26d56e8c290c51fa1e9b04eded286ac2a6be2e0f5a0a6a95c","observation_id":"dc414a15-295c-4c68-90ff-4dc5f0e9c7cd","resolution":{"observed_at":"2026-08-03T02:55:51.084056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:51.101800Z","title":"a) Simulation setup.:Each environment instance con- tains an Orca hand and a rigid cube object placed above a small kinematic platform","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:51.101800Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:273555e5e40d165afc5306526b00a7cce3a66aa59ee7a8d4fb53f8bd9425fd06","observation_id":"dff513ce-de18-4b93-883f-610c1d6aaf1e","resolution":{"observed_at":"2026-08-03T02:55:51.101800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:51.119781Z","title":"We follow the principle as in [35], with adaptation to chunked actions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:51.119781Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:30d03d08964c8dfec4f4b29babd1685030929779fd8a3747ab27f5ad25b2116f","observation_id":"6d88abaf-e633-4efb-a125-183709fecb98","resolution":{"observed_at":"2026-08-03T02:55:51.119781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:51.131685Z","title":"Each encoder follows the standard torchvision ResNet-18 up to the last convolutional stage (no global average pooling and no FC classifier)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:51.131685Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:66fd9da0b471741401ac28ffde7619622257d4bd4a2c77001123cd5c88169bfe","observation_id":"7a937a74-abad-48c1-b128-f860a1898298","resolution":{"observed_at":"2026-08-03T02:55:51.131685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:51.145346Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:51.145346Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:3c243f5a138bb262958ee69b53e002310d8c81942d76a7db70ac35f4593671f7","observation_id":"b61e70a3-9eaf-4971-8d5f-de5efe9c9842","resolution":{"observed_at":"2026-08-03T02:55:51.145346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:51.164429Z","title":"To ensure a fair comparison, the dataset, optimizer settings, data augmentation strategies, and image encoders are kept identical across all methods","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:51.164429Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:54c90034c1b0453a5c6bd6357edee9ef5a74747198db519fcc3e3f7d93f04f44","observation_id":"4217e3ab-7c1e-4728-9575-df0356122337","resolution":{"observed_at":"2026-08-03T02:55:51.164429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:51.179820Z","title":"The ablations in this subsection are per- formed on simulated RoboMimic environments (Lift, Can, and Square)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:51.179820Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:0ca14ff1fd844614c122c58fc30600dd9a1e9452c7614f0324370072596f862f","observation_id":"b4362a39-9418-4b90-a4ae-8894c4a2c262","resolution":{"observed_at":"2026-08-03T02:55:51.179820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:51.197706Z","title":"Achieving a stable grasp is par- ticularly challenging due to the absence of tactile sensing and frequent occlusion of the index finger by the thumb in wrist- mounted camera views","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:51.197706Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:0cb0a4e5254dec96c3a31035c671794ad05a9cfa5aa97be0831751bfeedb20da","observation_id":"5b171467-9343-4787-bdf5-d3ff80f53d1c","resolution":{"observed_at":"2026-08-03T02:55:51.197706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23527","last_updated":"2026-06-25T14:27:54Z","snapshot_observed_at":"2026-08-17T20:03:08.072659Z","submitted_at":"2025-05-29T15:06:22Z","title":"Normalizing Flows are Capable Models for Continuous Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23527","snapshot_observed_at":"2026-08-03T02:53:15.515710Z","title":"URL https: //doi.org/10.48550/arXiv.2505.23527","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:15.515710Z"},"links":{"cited_paper":"/paper/2505.23527","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:fc1b150a4a736e223a72c50363589713c008f501d785c9f81703ed1c79e213d6","observation_id":"5f8fd1e7-30c9-408f-ad15-7310881b896b","resolution":{"observed_at":"2026-08-03T02:53:15.515710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:55:51.213516Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":4090,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:51.213516Z"},"links":{"citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:adbfdfa18907d1e790e1cd081781e7dc76a3f2484d33f8e6648a76223a61a33c","observation_id":"15c15089-b1e3-48b2-80f7-756c7d62cee7","resolution":{"observed_at":"2026-08-03T02:55:51.213516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","latest_version":4,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":73,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 1 inbound Pith citation observation for arXiv:2602.09580."}