{"as_of":"2026-08-20T18:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f7dea89b14aa5d607015cc6a62c684d90b63feb7f398ae75f50f5e5cf0d9a93","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:56:36.541257Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21302/citation-record","integrity":"/paper/2607.21302/integrity","json":"/paper/2607.21302/citation-record.json","paper":"/paper/2607.21302"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:29.715147Z","title":"Diverse imitation learning via self-organizing generative models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:29.715147Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:3f966a261ae6d6758734e79be1d0d1b31181420544a05d173ec2c2955d1f20a3","observation_id":"341f92dd-3769-4d31-8a59-b7bf920ffaab","resolution":{"observed_at":"2026-08-01T07:56:29.715147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:29.767460Z","title":"Markov balance satisfaction improves performance in strictly batch offline imitation learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:29.767460Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:416ceb1bf2a215ef18f70f939b3ff300e16e9a625d7e9b9cf2063b0b2d07598e","observation_id":"b6a8681b-336e-43ca-80ee-7433cefb0314","resolution":{"observed_at":"2026-08-01T07:56:29.767460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12330","last_updated":"2025-02-19T08:57:34Z","snapshot_observed_at":"2026-08-20T07:58:36.141303Z","submitted_at":"2025-02-17T21:33:56Z","title":"X-IL: Exploring the Design Space of Imitation Learning Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12330","snapshot_observed_at":"2026-08-01T07:56:29.832819Z","title":"X-il: Exploring the design space of imitation learning policies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:29.832819Z"},"links":{"cited_paper":"/paper/2502.12330","citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:fd626091df6b1362ecace19c41f8ce40030e1e437f9c82e8a5bdcf561f8c38b9","observation_id":"dbcf8448-4dcf-4eda-8814-79ce693b9ed4","resolution":{"observed_at":"2026-08-01T07:56:29.832819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:29.872831Z","title":"Augmenting decision with hypothesis in reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:29.872831Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:d3cbfedb2fe5d63aa40dd3561a33454b8c547d44218cabb71a2d3d98b4ba68f6","observation_id":"c0c9f0f7-1bf0-4375-86bb-5fa0567a7e39","resolution":{"observed_at":"2026-08-01T07:56:29.872831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:29.974702Z","title":"Why so pessimistic? estimating uncertainties for offline rl through ensembles, and why their independence matters,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:29.974702Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:23931e4f886b16dfecb92e254c2556e75f32557578830de1da42858c5cdc6cdd","observation_id":"83e7b3f0-9c47-41bc-8384-a76252bf6064","resolution":{"observed_at":"2026-08-01T07:56:29.974702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:30.142701Z","title":"Epistemic bellman operators,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:30.142701Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:7a931a7fe29009f7c20874cdc8dfa07d503efde9db2e4d80b39fef9f076f0abd","observation_id":"cee8cfde-a681-4a64-b018-10afd8a8aa72","resolution":{"observed_at":"2026-08-01T07:56:30.142701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:30.302455Z","title":"Behavior priors for efficient reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:30.302455Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:66a5d758037bf64714a0e0172b5282c37ee06a00f3b85f4cf428c714502e0c7b","observation_id":"eb72262a-016a-474f-a607-9083bebed730","resolution":{"observed_at":"2026-08-01T07:56:30.302455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:30.470370Z","title":"Pre-training goal-based models for sample-efficient reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:30.470370Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:c03dd7fa164e870b7e3e96504cb05dff95634e3caf467ac7d9dabe6a96c9e638","observation_id":"3b766335-3a59-4364-ac77-73b6d6037151","resolution":{"observed_at":"2026-08-01T07:56:30.470370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13872","last_updated":"2025-02-06T09:37:25Z","snapshot_observed_at":"2026-08-16T13:13:23.455027Z","submitted_at":"2024-10-02T12:45:59Z","title":"BLEND: Behavior-guided Neural Population Dynamics Modeling via Privileged Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13872","snapshot_observed_at":"2026-08-01T07:56:30.530259Z","title":"Blend: Behavior-guided neural population dynamics modeling via privileged knowledge distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:30.530259Z"},"links":{"cited_paper":"/paper/2410.13872","citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:f6631cecb3f4dc863999e512c963ea0eff78e988aaa2ad670925d1c2dfdec12d","observation_id":"2f28a8c9-f018-48b8-ab9b-19bfaa08277a","resolution":{"observed_at":"2026-08-01T07:56:30.530259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:30.638326Z","title":"Jump-start reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:30.638326Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:9f57c9abffd3afb3d32c2827ce63b0fa7fc658c3806cfe41e1ddd363e7cc5ed8","observation_id":"b915a079-3c54-4e29-9cef-2a701c37ffc7","resolution":{"observed_at":"2026-08-01T07:56:30.638326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:30.730465Z","title":"Scaling proprioceptive-visual learning with heterogeneous pre-trained transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:30.730465Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:f7c250458c00f0cc8f82434ec20f74abf16705bf27705abd132dfa572cca45fb","observation_id":"6081f832-9100-423c-bd19-aca97dfae6e3","resolution":{"observed_at":"2026-08-01T07:56:30.730465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:30.799416Z","title":"Learn to supervise: Deep reinforcement learning-based prototype refinement for few-shot motor fault diagnosis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:30.799416Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:debd411925d934c30edaf3c6ba5881c1b13db1c88fdfd97800236481319566a5","observation_id":"346620d3-e6f3-4c03-b532-fb9a0a79556e","resolution":{"observed_at":"2026-08-01T07:56:30.799416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:30.858137Z","title":"Efficient online reinforcement learning with offline data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:30.858137Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:6c545d69204ed4e7339256cb3a5ab6dfdcff4a341f4848c1cc0da6dd52a1985a","observation_id":"94b59805-fd35-4a10-bf2b-3d3929510011","resolution":{"observed_at":"2026-08-01T07:56:30.858137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:30.925627Z","title":"Leveraging offline data in online reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:30.925627Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:e51b4a6abab03960cdfddfdd709b14876f6f5abae4edcc2164e595ddd5256b34","observation_id":"a6d2af2e-c156-48bf-8659-1371ea1dd623","resolution":{"observed_at":"2026-08-01T07:56:30.925627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13930","last_updated":"2024-02-21T16:52:26Z","snapshot_observed_at":"2026-08-20T12:25:37.712655Z","submitted_at":"2024-02-21T16:52:26Z","title":"Enhancing Reinforcement Learning Agents with Local Guides","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13930","snapshot_observed_at":"2026-08-01T07:56:30.986206Z","title":"Enhanc- ing reinforcement learning agents with local guides,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:30.986206Z"},"links":{"cited_paper":"/paper/2402.13930","citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:25e7931e505aea61e5c2004864a157bef101e6524e94645a66f28e89f366e788","observation_id":"afb0555d-6cf0-413f-8b5c-7a1f828849d6","resolution":{"observed_at":"2026-08-01T07:56:30.986206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:31.059219Z","title":"Leveraging demonstrations to improve online learning: Quality matters,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:31.059219Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:d0e037e09820ac46a980cf2d2ed13e16c25af63b4340215f3e5785f6bdcafee8","observation_id":"8506d4f5-30cb-49ef-9af4-cfcda1e306c8","resolution":{"observed_at":"2026-08-01T07:56:31.059219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:31.071799Z","title":"Iterative regularized policy optimization with imperfect demonstrations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:31.071799Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:e9c3f86cab9fd7bcd5b670ed96ea5a9c99d8ae2eb582b38c071d71d4e93b2182","observation_id":"32933b84-abbe-4abc-a2d2-22c5d7e74678","resolution":{"observed_at":"2026-08-01T07:56:31.071799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:31.074838Z","title":"Constraint- adaptive policy switching for offline safe reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:31.074838Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:febb36d30c4c05bdd371c586ccfda043e95eff23a148753da1d2e1d560872e67","observation_id":"91d4652f-f4bf-4688-9b00-7c6f2ee3783f","resolution":{"observed_at":"2026-08-01T07:56:31.074838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:31.095430Z","title":"Residual skill policies: Learning an adaptable skill-based action space for rein- forcement learning for robotics,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:31.095430Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:180094ff3459ac5d6b603f2a6f01bb0fe5e1eb9d924ab5deba210a6d74d070b9","observation_id":"3e5e2604-fdd2-4c8f-90cb-bba73b3c3757","resolution":{"observed_at":"2026-08-01T07:56:31.095430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18076","last_updated":"2025-07-11T20:30:30Z","snapshot_observed_at":"2026-08-16T13:06:31.778636Z","submitted_at":"2024-10-23T17:58:45Z","title":"Leveraging Skills from Unlabeled Prior Data for Efficient Online Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18076","snapshot_observed_at":"2026-08-01T07:56:31.151219Z","title":"Leveraging skills from unlabeled prior data for efficient online exploration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:31.151219Z"},"links":{"cited_paper":"/paper/2410.18076","citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:45c86126873650992cfb0fda3c3b13fbd91ac20e3b38f6a56ab7f074f6d261ab","observation_id":"a8653a43-5ca3-403c-9606-da4b949fe954","resolution":{"observed_at":"2026-08-01T07:56:31.151219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:31.237029Z","title":"Policy regularization with dataset constraint for offline reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:31.237029Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:d3a9f86e68661ace3333da26456ebd891be36663e40166957b9dfdfc231a0c62","observation_id":"7e6a71d8-ecec-40a5-83f5-548cde8187e0","resolution":{"observed_at":"2026-08-01T07:56:31.237029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:31.388210Z","title":"Accelerating exploration with unlabeled prior data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:31.388210Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:44a638f34da752e18e81687eeb3312188858de90a48adeb471bc3916dde956e3","observation_id":"81e955d9-8414-4ee5-a57c-db274c0f9a2d","resolution":{"observed_at":"2026-08-01T07:56:31.388210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:31.578131Z","title":"Cross-domain offline policy adaptation with optimal transport and dataset constraint,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:31.578131Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:596b0344127c0651b6e9499378ff72ad2046e18438b7211e7c480d3b7ef6f0d8","observation_id":"5d2a733e-aa25-4c28-b5b3-f7949b75cba8","resolution":{"observed_at":"2026-08-01T07:56:31.578131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:31.722979Z","title":"Policy gradient for rectangular robust markov decision processes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:31.722979Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:e54e2ea30083c683a98f6c024751a47e3f580b4cbda712cb11bd89da1500efed","observation_id":"6dc0356f-c43f-41cb-87fc-0962c26c76f9","resolution":{"observed_at":"2026-08-01T07:56:31.722979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:31.884835Z","title":"Reinforcement learning: An introduction,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:31.884835Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:d06955cc6debb971949372689dc1c8309d8bc7a14dc5ee48bff8cd4b87f57ae5","observation_id":"0ff1a6f6-c2e5-4349-98f8-215a34f9e7fb","resolution":{"observed_at":"2026-08-01T07:56:31.884835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:32.058259Z","title":"Is q-learning provably efficient?","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:32.058259Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:9fd2eccf66f5baa6e97202e90f90c7f45836e51951aab4bea79e02d16907f187","observation_id":"b62b83be-8784-46e8-a09a-9f9566b69423","resolution":{"observed_at":"2026-08-01T07:56:32.058259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:32.275765Z","title":"Actor-critic alignment for offline-to-online re- inforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:32.275765Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:2f0ae0e3bda08a5536d6a4fbcedbeb46b1a48e583402cc42d5f2bde93b225dd8","observation_id":"ea73e4e2-ee0a-4120-ac1e-bbf5940092a4","resolution":{"observed_at":"2026-08-01T07:56:32.275765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:32.412266Z","title":"Adaptive policy learning for offline-to-online reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:32.412266Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:d9d5503fd79389ff82778f80898f2903dd27798b609b87e553dcfbfa37418939","observation_id":"5feb362e-7a47-4d7a-991e-4671991e57bf","resolution":{"observed_at":"2026-08-01T07:56:32.412266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:32.531640Z","title":"Optimistic critic reconstruction and constrained fine-tuning for general offline-to-online rl,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:32.531640Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:c2e366bfa98d96402a7e7d21f67b20f22917cff9818ef491e2b10dadd970a2cf","observation_id":"21f7a3da-bb6e-4f61-94fc-e2a21133bdbc","resolution":{"observed_at":"2026-08-01T07:56:32.531640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:32.675158Z","title":"Tree-based batch mode rein- forcement learning,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:32.675158Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:f5b533652c89849244090956284d513c9ef7473e3bb7fdc74a00f821e12c34fa","observation_id":"23ab0009-a461-439e-b9bf-0698c090ced3","resolution":{"observed_at":"2026-08-01T07:56:32.675158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:32.794597Z","title":"Mildly conservative q-learning for offline reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:32.794597Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:b94bceb42247886979ec6380181a843d3dc1e44a9a2c1c815ab9dd024bb56894","observation_id":"7fa71875-f4e4-4297-a91c-5c32be4a3538","resolution":{"observed_at":"2026-08-01T07:56:32.794597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-01T07:56:32.835740Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:32.835740Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:82480c4ae021b742c959932f96ed8f91f60af2a577e4118bc156585a0c70f2a7","observation_id":"a1447621-db8d-4328-ba4e-95b364d4eae0","resolution":{"observed_at":"2026-08-01T07:56:32.835740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:32.899188Z","title":"De-pessimism offline reinforcement learning via value compensation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:32.899188Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:2646cc5860b1589171098d081f21c51a7cc8d2bb48099898848c57f1ca1daeb9","observation_id":"f7f0e50a-4191-49fe-be71-a2cb55e7e547","resolution":{"observed_at":"2026-08-01T07:56:32.899188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:32.963742Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:32.963742Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:ec4d65317e2b0f0c9e9c19468ec488b5a800b431aa85eb85413570cee57746a6","observation_id":"09c13e59-946a-4bba-947d-eaffdbddc620","resolution":{"observed_at":"2026-08-01T07:56:32.963742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-01T07:56:33.064948Z","title":"Awac: Accelerating online reinforcement learning with offline datasets,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:33.064948Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:27f0b19c530753ed0915d92a7788aa1c6705c35ee31ac23f415b9fd96c170a85","observation_id":"822d88c3-11b9-4f6d-954b-86655039d45c","resolution":{"observed_at":"2026-08-01T07:56:33.064948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:33.240341Z","title":"Don’t start from scratch: Leveraging prior data to automate robotic reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:33.240341Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:557d46cb87276774abf547b02f90e9033b693a76f36fda652608a66d9e6bb5dc","observation_id":"3f20a930-d0d0-4395-8ffa-a72e6d36787b","resolution":{"observed_at":"2026-08-01T07:56:33.240341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:33.362398Z","title":"Behavior prior representation learning for offline reinforce- ment learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:33.362398Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:0ab729ce5ff567e51165c02bc43f13e90d14f6dc86960b40b1c5b9950a4365df","observation_id":"c5072f68-74b8-47aa-8502-26451274812d","resolution":{"observed_at":"2026-08-01T07:56:33.362398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10175","last_updated":"2023-09-18T21:50:26Z","snapshot_observed_at":"2026-08-16T14:59:38.227096Z","submitted_at":"2023-09-18T21:50:26Z","title":"One ACT Play: Single Demonstration Behavior Cloning with Action Chunking Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10175","snapshot_observed_at":"2026-08-01T07:56:33.450588Z","title":"One act play: Single demonstration behavior cloning with action chunking transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:33.450588Z"},"links":{"cited_paper":"/paper/2309.10175","citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:90a49e80ec19e6a62d79d3c1d434ee31768569e59cdbd2618908a35155e824de","observation_id":"03b83487-1f98-4c71-9d77-7bbfcd9df768","resolution":{"observed_at":"2026-08-01T07:56:33.450588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:33.531132Z","title":"Policy optimization with demonstrations,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:33.531132Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:93fbf66e9a8ff14d8d33c5b4169ee038e67a3a9a5715f45d97234939e13f2516","observation_id":"163ac0ef-2bef-4e25-9473-990c566512c1","resolution":{"observed_at":"2026-08-01T07:56:33.531132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04628","last_updated":"2022-02-13T21:23:07Z","snapshot_observed_at":"2026-08-16T17:22:27.661674Z","submitted_at":"2022-02-09T18:45:40Z","title":"Reinforcement Learning with Sparse Rewards using Guidance from Offline Demonstration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04628","snapshot_observed_at":"2026-08-01T07:56:33.684912Z","title":"Reinforcement learning with sparse rewards using guidance from offline demonstration,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:33.684912Z"},"links":{"cited_paper":"/paper/2202.04628","citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:4a7d1430bc5fa6e05c2926c340ad9a589d1b4159624663fcceb496b314f58011","observation_id":"dba72cb6-62df-4dd0-96f0-98af582b032c","resolution":{"observed_at":"2026-08-01T07:56:33.684912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:33.799415Z","title":"Goal-conditioned on-policy reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:33.799415Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:a00fce2d102d9fdd79626b6efec8b9c168238f008dc599b8a1925b79cbc86f68","observation_id":"5893c168-8d3b-444e-9354-fbbfb894a289","resolution":{"observed_at":"2026-08-01T07:56:33.799415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:33.866798Z","title":"Recurrent experience replay in distributed reinforcement learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:33.866798Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:cc8a571577c900759e82d91bd6c6a2f22e57e221333fa4aa30fd4ace1ff2d733","observation_id":"6fa04518-1d3f-411f-92cd-b92d001e8d69","resolution":{"observed_at":"2026-08-01T07:56:33.866798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14242","last_updated":"2023-02-28T01:54:56Z","snapshot_observed_at":"2026-08-20T12:50:01.980832Z","submitted_at":"2023-02-28T01:54:56Z","title":"Learning Sparse Control Tasks from Pixels by Latent Nearest-Neighbor-Guided Explorations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14242","snapshot_observed_at":"2026-08-01T07:56:33.967615Z","title":"Learning sparse con- trol tasks from pixels by latent nearest-neighbor-guided explorations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:33.967615Z"},"links":{"cited_paper":"/paper/2302.14242","citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:b5a32dd97d4c84f0e65d6c6cfa119eb5a122edeaa95a80e6e0deaeff7529eb48","observation_id":"cdd59388-1c54-4fdd-aff1-630c621322fb","resolution":{"observed_at":"2026-08-01T07:56:33.967615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:34.218354Z","title":"Theoretically principled deep rl acceleration via nearest neighbor function approximation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:34.218354Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:b51cf86231c0f32da30a038a07c212407d5527aadd8ebe7b63f41023d97a9352","observation_id":"0a641db0-4e66-40b2-b67b-68049ba7f9b3","resolution":{"observed_at":"2026-08-01T07:56:34.218354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:34.293904Z","title":"A review of recurrent neural net- works: Lstm cells and network architectures,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:34.293904Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:5cb7dcc33c6b4984b17d5eca0457fb080cb56f4e6ff2ddd25606fa48d8702057","observation_id":"62b46839-b198-4750-b1c5-8e89c68393cc","resolution":{"observed_at":"2026-08-01T07:56:34.293904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:34.393332Z","title":"Frustratingly easy regularization on representation can boost deep reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:34.393332Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:dceb991ed965bbd1424777cc2fce70553020269024fd7d1f92c2008077bae33d","observation_id":"504f9b9c-e716-4a8d-a92f-ab32a0141259","resolution":{"observed_at":"2026-08-01T07:56:34.393332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:34.574737Z","title":"Q-learning with nearest neighbors,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:34.574737Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:63ea5c20b5fdf2db5d61e8dc0adcc50a192e7aed08207409c34abbb459610788","observation_id":"6f4f9eb3-2fd6-44e7-8dd6-80ec3b3fde8e","resolution":{"observed_at":"2026-08-01T07:56:34.574737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:34.698097Z","title":"Improving policy exploitation in online reinforcement learning with instant retrospect action,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:34.698097Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:66f478276b3d463adc9ef08bc521d1c4b92f0b16c5da1fe53b25412b95d69506","observation_id":"44512d60-f245-4f66-b622-b0dcfd475e60","resolution":{"observed_at":"2026-08-01T07:56:34.698097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:34.845854Z","title":"Seizing serendipity: exploiting the value of past success in off-policy actor-critic,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:34.845854Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:bc71de3ef1d76fe02bf66c3723fac81ad58c2acc3beeceef86ac0da9e6c83e35","observation_id":"aa4d02f3-c43d-474d-a816-8729a6e9bd6c","resolution":{"observed_at":"2026-08-01T07:56:34.845854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:34.950027Z","title":"Offline-boosted actor-critic: Adaptively blending optimal historical behaviors in deep off-policy rl,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:34.950027Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:b5e9c4c8f130bc71280efd8a62d5957cd6398d7639ccc3bced8d8737cd02ffcb","observation_id":"e8476f44-e366-4a04-8c2b-2f01e5b160b9","resolution":{"observed_at":"2026-08-01T07:56:34.950027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:35.055000Z","title":"Off-policy deep reinforcement learning without exploration,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:35.055000Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:0dfdcaa4a84f4c5259605c57ecab6c47a3389e97c25360edd7577e9b8a8e36c9","observation_id":"8ea73369-3cd0-4d66-9a5c-adc939e45cd0","resolution":{"observed_at":"2026-08-01T07:56:35.055000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-01T07:56:35.179046Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:35.179046Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:269f5977655ca649627c52aab03c57612332ac3624310b749903c681ec64c950","observation_id":"b3fa0b96-1174-4cda-a03e-5c0168346b18","resolution":{"observed_at":"2026-08-01T07:56:35.179046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:35.302638Z","title":"Reparameterized policy learning for multimodal trajectory optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:35.302638Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:8e2c591443e6fd2e2d7d8c4ba70fe88e00592b8899886c9acd8dd89de298eb00","observation_id":"b910d697-74b6-4a3b-b22e-3b59658c6b1d","resolution":{"observed_at":"2026-08-01T07:56:35.302638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14790","last_updated":"2024-05-23T17:00:15Z","snapshot_observed_at":"2026-08-18T18:30:25.111210Z","submitted_at":"2024-05-23T17:00:15Z","title":"DIDI: Diffusion-Guided Diversity for Offline Behavioral Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14790","snapshot_observed_at":"2026-08-01T07:56:35.396183Z","title":"Didi: diffusion-guided diver- sity for offline behavioral generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:35.396183Z"},"links":{"cited_paper":"/paper/2405.14790","citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:c7bb5ce758edbcb7ba0e5f0499604c3929c95f68760b4146058bece28c955eba","observation_id":"ce2529a7-64a0-4bbf-9ea1-37190d9bb340","resolution":{"observed_at":"2026-08-01T07:56:35.396183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:35.482128Z","title":"Addressing function approxima- tion error in actor-critic methods,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:35.482128Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:0f98fa11267f1acbe1a9883b6aa8204d3a1c1caca424dc5276694b2e8e2ce6ef","observation_id":"ee6eb6eb-f9d9-4fcd-8a93-026744b08b85","resolution":{"observed_at":"2026-08-01T07:56:35.482128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:35.589963Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:35.589963Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:5a76428abc901b7685acc856fe9f3c8e84b0065ffc8960042a7faa7f90d0261a","observation_id":"a77a6591-4287-4227-93d6-34a572ae9783","resolution":{"observed_at":"2026-08-01T07:56:35.589963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-01T07:56:35.699676Z","title":"Continuous control with deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:35.699676Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:cdb677417937e2b9fbec08578a7cc70dbda018f2e26b6e8fccf1a4b43e0d5020","observation_id":"80fa20c8-a962-4b8a-a3e5-a9eca32fc7bc","resolution":{"observed_at":"2026-08-01T07:56:35.699676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:35.807665Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:35.807665Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:b162005aa14be2bac3add06ef059ebbe758475ecae18a748430b96ed3304eecd","observation_id":"9301c955-d440-4711-82d7-a5e3f9ba95c9","resolution":{"observed_at":"2026-08-01T07:56:35.807665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:35.918222Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:35.918222Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:e4bd6b83916f00d57eff69ef4f485809b43b5cf8741eb1e3859cfd5c5b9ddb1c","observation_id":"c158b7c2-32ec-4edf-9475-07c3e811f996","resolution":{"observed_at":"2026-08-01T07:56:35.918222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:36.031209Z","title":"Reinforcement learning with stochastic reward machines,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:36.031209Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:b279d7284c26d772ca567388c339e3b22eee8f6e9abe53bd1def90758cfc25d3","observation_id":"c7e0ee36-8abc-45c2-a41f-3faedef10911","resolution":{"observed_at":"2026-08-01T07:56:36.031209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:36.138710Z","title":"Distributional soft actor-critic: Off-policy reinforcement learning for addressing value estimation errors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:36.138710Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:6503dd8b73e18481ef7261fa0267fe293aff72f47e0b0ceed802683f63bb923f","observation_id":"ef020d41-844a-4952-b14b-0a9e874f033b","resolution":{"observed_at":"2026-08-01T07:56:36.138710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:36.248100Z","title":"Softmax deep double deterministic policy gradients,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:36.248100Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:2fc243bf51f24bd3700998ebee895649b542d48639b7802f78460ba4c03790c9","observation_id":"a1fd98d0-4f57-49cb-b69a-1f3c4f1e8399","resolution":{"observed_at":"2026-08-01T07:56:36.248100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:36.289956Z","title":"Logit standardization in knowledge distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:36.289956Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:bbb4fe41b960d7bb2c0d4852125fb7e7ed09f8ff9cebc6a8dd72646b6a9e677f","observation_id":"2b60f18e-79ec-4e30-9aa6-98c606b6ff08","resolution":{"observed_at":"2026-08-01T07:56:36.289956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-01T07:56:36.434176Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:36.434176Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:29ae7f025cc5a8dfda1a1cc86dc95d012ebbaa690f420cbe143123bf24d541dd","observation_id":"fa6be7b5-bd2b-4c1e-8ea0-157f77c92cb7","resolution":{"observed_at":"2026-08-01T07:56:36.434176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:56:36.541257Z","title":"Deep reinforcement learning at the edge of the statistical precipice,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:36.541257Z"},"links":{"citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:cf2d0afa097e3856d220431008ca1f5c3b2a3c824689a5b1f9f49392356e742c","observation_id":"88022178-65f0-4374-bf61-c4e6ad1621bd","resolution":{"observed_at":"2026-08-01T07:56:36.541257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T08:16:00.848388Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2607.21302."}