{"as_of":"2026-08-07T15:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:942fea146c64c9c47eb42622a2a1176b5e74859f5e962aeef746a296ec6876c7","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:27:30.592023Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12095/citation-record","integrity":"/paper/2506.12095/integrity","json":"/paper/2506.12095/citation-record.json","paper":"/paper/2506.12095"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:32.191058Z","title":"Learning humanoid locomotion with transformers,","venue":null,"work_id":"d7c99b14-8062-4574-843e-fd92ad397b4d","year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.499106Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:d9e10481ee071108fc553028afdc8f523f179ca9d853e90d5fa604e647fb1885","observation_id":"e260941e-9d6f-4510-b2ae-7ccda0e66247","resolution":{"observed_at":"2026-08-07T04:27:32.278036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:32.038870Z","title":"Real-world humanoid locomotion with reinforcement learning,","venue":null,"work_id":"04f18176-5d42-4b68-bbc4-b622ac0791ea","year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.537410Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:d0293dfc39093bbf7c90c11673cf5a53427c92e26a9465485e1b045c1ce25e11","observation_id":"d7889185-0ee8-4d79-918b-ee4f71d97b26","resolution":{"observed_at":"2026-08-07T04:27:32.115658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.827785Z","title":"Model predictive control,","venue":null,"work_id":"336eb4b6-c696-4564-b0ec-fee8b88e4f87","year":2016},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.589024Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:7f7f2e3ec7ad93089659eb527f8e268c65ed32115f887d54b999f2f8988ce015","observation_id":"52a8d7ac-5b49-41e5-8d74-14e8d27525b2","resolution":{"observed_at":"2026-08-07T04:27:31.932501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.593877Z","title":"Aleatoric and epistemic uncertainty with random forests,","venue":null,"work_id":"453011fa-a0a5-4a0c-bbda-f3f69517ef8e","year":2020},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.628274Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:a39a8e16b5e8691bca4c0fd086476059ac755301697f3d33f4e684e557445e06","observation_id":"f4bab07a-8f8e-4064-9cf6-977f1283d99c","resolution":{"observed_at":"2026-08-07T04:27:31.656935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:29.696736Z","title":"Aleatoric and epistemic uncertainty in machine learning: An introduction to concepts and methods,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.696736Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:31503af4257367d2c31d3199b58785c4b73392bcad2c55bcda41e4fa275ca884","observation_id":"87224d6d-60e6-4b83-a8dd-19afe8e017c6","resolution":{"observed_at":"2026-08-07T04:27:29.696736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01628","last_updated":"2025-02-28T16:28:50Z","snapshot_observed_at":"2026-07-06T19:26:12.102947Z","submitted_at":"2024-10-02T15:02:32Z","title":"Stochasticity in Motion: An Information-Theoretic Approach to Trajectory Prediction","version":3},"cited_work":{"arxiv_id":"2410.01628","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01628","snapshot_observed_at":"2026-08-07T04:27:30.953188Z","title":"Stochasticity in Motion: An Information-Theoretic Approach to Trajectory Prediction","venue":"cs.RO","work_id":"2a8f0f5c-c902-414f-bb72-93301b787dd7","year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.748895Z"},"links":{"cited_paper":"/paper/2410.01628","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:f12c979b761b7a075a0bedc5dae19975197c3caf45cbab039c95f84891119252","observation_id":"4d584cc8-db7c-4a6e-81f4-d036127ff71f","resolution":{"observed_at":"2026-08-07T04:27:30.960812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13785","last_updated":"2025-04-18T16:35:12Z","snapshot_observed_at":"2026-08-02T08:13:54.725848Z","submitted_at":"2025-04-18T16:35:12Z","title":"Learning Through Retrospection: Improving Trajectory Prediction for Automated Driving with Error Feedback","version":1},"cited_work":{"arxiv_id":"2504.13785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.13785","snapshot_observed_at":"2026-08-07T04:27:30.898741Z","title":"Learning Through Retrospection: Improving Trajectory Prediction for Automated Driving with Error Feedback","venue":"cs.RO","work_id":"5d02e8d6-a151-47e4-a1fc-183d636af024","year":2025},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.806038Z"},"links":{"cited_paper":"/paper/2504.13785","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:94aaa181df449b5c119b82ae72ef6e591432e8762ac9865f640caf93ad04a001","observation_id":"8b5c315c-d480-435d-84ac-a50798c6409d","resolution":{"observed_at":"2026-08-07T04:27:30.909236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:29.890578Z","title":"Temporal difference learning for model predictive control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.890578Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:5f6c22e72f75e751f1df5807acbb405ec55ea3b22cf55af814567c909de88817","observation_id":"878a5feb-84b3-4579-beea-fa4067b7500c","resolution":{"observed_at":"2026-08-07T04:27:29.890578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.517166Z","title":"Td-mpc2: Scalable, robust world models for continuous control,","venue":null,"work_id":"eec727b5-1e9f-45c0-b624-850eabef46bc","year":null},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.976944Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:a632e19b9b47fd47bf35005021730c672cc2af378da16ef91b989b1036767082","observation_id":"0e2d9b79-dbe9-4b1f-9065-b6a28d55aaa9","resolution":{"observed_at":"2026-08-07T04:27:31.541850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.465839Z","title":"Deep reinforce- ment learning in a handful of trials using probabilistic dynamics models,","venue":null,"work_id":"fb30ae8a-c231-48b1-97f9-1d77eb81f962","year":2018},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.035313Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:3553d003cc52e9f982d83338e31523eecd89f5bec9d4b73df021d3c302e6c322","observation_id":"56bbb6f7-6191-4408-94d9-414ebade58b5","resolution":{"observed_at":"2026-08-07T04:27:31.489789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05556","last_updated":"2021-03-17T17:22:51Z","snapshot_observed_at":"2026-08-01T17:10:08.501525Z","submitted_at":"2020-08-12T20:06:52Z","title":"Model-Based Offline Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05556","snapshot_observed_at":"2026-08-07T04:27:30.087984Z","title":"Model-based offline planning,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.087984Z"},"links":{"cited_paper":"/paper/2008.05556","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:98fb45be581d3af122c803772807dc78ffade0092cbb97706cfec1df1d7b41a7","observation_id":"70dd384c-1d61-43f9-ac3f-887c72d72b08","resolution":{"observed_at":"2026-08-07T04:27:30.087984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03550","snapshot_observed_at":"2026-08-07T04:27:30.170831Z","title":"Improving td-mpc through policy constraint,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.170831Z"},"links":{"cited_paper":"/paper/2502.03550","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:90024e56d2e8798301f9974485fc12332bc7ca513d083ae28cedaf2b3fc98e9e","observation_id":"a772cadb-ca4b-44c8-844c-52e155ff9de9","resolution":{"observed_at":"2026-08-07T04:27:30.170831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:30.198273Z","title":"V ovk, A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.198273Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:4b9db5d5f9020922be95d2aa2619960473b30b8900b93983284f07790fefd830","observation_id":"986fb49b-5f58-42ba-9610-d3c7d1488490","resolution":{"observed_at":"2026-08-07T04:27:30.198273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T04:27:30.305025Z","title":"Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.305025Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:958532ee0a44193cecf72f48d753e4c2868216235a2318aa5c5607e13673f97a","observation_id":"6cdcabf3-1b02-4939-94c8-9de1834b17a6","resolution":{"observed_at":"2026-08-07T04:27:30.305025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10506","last_updated":"2024-06-18T18:11:07Z","snapshot_observed_at":"2026-08-04T05:16:12.953751Z","submitted_at":"2024-03-15T17:45:44Z","title":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10506","snapshot_observed_at":"2026-08-07T04:27:30.356457Z","title":"Humanoid- bench: Simulated humanoid benchmark for whole-body locomotion and manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.356457Z"},"links":{"cited_paper":"/paper/2403.10506","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:2930590047c946f7a1ca5730130a903dcd9e8d4a83742acb0abae3f6a839ed6e","observation_id":"8b14b05d-c8fa-4c20-b22a-d15cb39aa7d0","resolution":{"observed_at":"2026-08-07T04:27:30.356457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.397267Z","title":"Reinforcement learning for humanoid robotics,","venue":null,"work_id":"73d6477c-94cd-47c1-b18f-c37a3542bb01","year":2003},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.415385Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:c97fbdef0675dbf53b2f0c203740321f9cc03a521bc6f88e1b8c5722705e9757","observation_id":"c337b9cf-f2b7-4f20-9d21-9d6a3f968b11","resolution":{"observed_at":"2026-08-07T04:27:31.425332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.371859Z","title":"Learning off-policy with online planning,","venue":null,"work_id":"ab23a847-2970-414f-9b88-eb589dfe555c","year":2022},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.423302Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:6f0a8fc7b5a79ae4665b2487c6996ed5c342af0985823010fcf9f8214b14d713","observation_id":"11b382bb-3341-4f1c-90fb-c1db1f7a0b97","resolution":{"observed_at":"2026-08-07T04:27:31.380410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.352262Z","title":"Conformal prediction in manifold learning,","venue":null,"work_id":"b54c9cb7-cdc1-4959-afaf-1fc4d012a5b5","year":2018},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.428872Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:26e750ac822238b3d3c0c89d53c76e21b5abf0b8df60ee9cd3e096e62dc87cd2","observation_id":"f123cf6a-1eea-4d54-8c5a-9b4320964f46","resolution":{"observed_at":"2026-08-07T04:27:31.357234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17487","last_updated":"2024-04-26T15:43:06Z","snapshot_observed_at":"2026-08-01T21:41:16.199203Z","submitted_at":"2024-04-26T15:43:06Z","title":"Conformal Prediction with Learned Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17487","snapshot_observed_at":"2026-08-07T04:27:30.435680Z","title":"Conformal prediction with learned features,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.435680Z"},"links":{"cited_paper":"/paper/2404.17487","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:cebb192279fe8e12822df8ee97c7452702e35f3e32c1f6750fd549142e41e169","observation_id":"614f192f-7e1f-4661-83c0-acde746bf96c","resolution":{"observed_at":"2026-08-07T04:27:30.435680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.331496Z","title":"Confor- mal prediction for semantically-aware autonomous perception in urban environments,","venue":null,"work_id":"66538cef-ce91-402b-8b77-f5e791180c75","year":null},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.445140Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:a9ee873482ee6c67702ae09a21911506401363b4d02bc87412f5fc29df2b6907","observation_id":"2d667aa7-e41b-4da9-884c-c297c762fdd9","resolution":{"observed_at":"2026-08-07T04:27:31.338215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.302620Z","title":"Conformal prediction for uncertainty-aware planning with diffusion dynamics model,","venue":null,"work_id":"86dcedac-c70e-4b5d-bc56-446bd4f931f8","year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.452592Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:96346187e011c1987b9248e9a49ad3803b6adb95234871a7ca6b7ad82ecef932","observation_id":"c3a52c1e-a316-4937-83dc-e277ce094e56","resolution":{"observed_at":"2026-08-07T04:27:31.307658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.279946Z","title":"Adaptive conformal prediction for motion planning among dynamic agents,","venue":null,"work_id":"7e772bbf-b34e-43c8-a47d-e809770d03f6","year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.459658Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:075495d844e23424c3516b7b4a6e281bda99727e70776467752b27c378d53ccc","observation_id":"07eba7e6-feff-4612-8708-cba7edc3e584","resolution":{"observed_at":"2026-08-07T04:27:31.286345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.258672Z","title":"Safe planning in dynamic environments using conformal prediction,","venue":null,"work_id":"d2490db1-3afa-4f75-be65-0b6f00c4c95c","year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.467615Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:0fddc5d8cb94fc9db155c1bae12f936cf313b7553d14f4b85d0cd44fab9ed92d","observation_id":"82632f0d-106c-4c04-aac0-bbe697569ced","resolution":{"observed_at":"2026-08-07T04:27:31.267133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.240509Z","title":"Safe perception-based control under stochastic sensor uncertainty using con- formal prediction,","venue":null,"work_id":"440b4473-db0d-4a5a-8e68-c5dd48d20cb8","year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.473135Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:e8d4d862a90d007cb59aa626b80c8502a2487480178fc22337f3d1dce83dc6a8","observation_id":"6f144c20-bd22-4315-af55-7676327a4b1d","resolution":{"observed_at":"2026-08-07T04:27:31.246167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.223805Z","title":"Conformal decision theory: Safe autonomous decisions from imperfect predictions,","venue":null,"work_id":"334b70e0-6bd6-4f56-818a-fa9cf5c58ee9","year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.480932Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:33e87aef4c4529272a7bdc4945d557beff9c228a871de6cf5f994fcad80dc3f2","observation_id":"94498e85-f25f-4691-9792-b54b2eee61c2","resolution":{"observed_at":"2026-08-07T04:27:31.229092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.197118Z","title":"Safe pomdp online planning among dynamic agents via adaptive conformal prediction,","venue":null,"work_id":"acc5cb80-1bd9-44e8-95fb-b11ad22e7ebe","year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.486796Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:74e018ad9a73634275926242dd4b7b04582192bd087a8813c8f23521b6048789","observation_id":"668e69c2-056f-45a2-9bbf-c26ed3c50442","resolution":{"observed_at":"2026-08-07T04:27:31.206160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.173972Z","title":"Conformal policy learning for sensorimotor control under distribution shifts,","venue":null,"work_id":"01681614-199c-4e14-910f-42c980c919df","year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.493848Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:13f80336058079b63ed9099a58f5358a3cefb72a88f4a5fe053b12010a5ae672","observation_id":"9982d18c-a52c-4002-948c-34f7c9562c1e","resolution":{"observed_at":"2026-08-07T04:27:31.180556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07767","last_updated":"2024-07-10T18:34:05Z","snapshot_observed_at":"2026-07-06T18:29:17.280082Z","submitted_at":"2024-06-11T23:16:46Z","title":"Conformalized Teleoperation: Confidently Mapping Human Inputs to High-Dimensional Robot Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07767","snapshot_observed_at":"2026-08-07T04:27:30.502164Z","title":"Conformalized teleoperation: Confidently mapping human inputs to high-dimensional robot actions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.502164Z"},"links":{"cited_paper":"/paper/2406.07767","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:27376d3eab71dddb9ab9e73693d4237d6261863b18a83c38b3b1cf658ba17e57","observation_id":"45659071-8e67-416d-9c9d-f0cb3d6260ba","resolution":{"observed_at":"2026-08-07T04:27:30.502164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.149708Z","title":"Stabilizing off- policy q-learning via bootstrapping error reduction,","venue":null,"work_id":"cbb95ace-a845-434d-94f3-e6508db22260","year":2019},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.512999Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:8e034684eb9e5122fdac42650578ece442499efd60d5dafbd1b7d229742a143f","observation_id":"129a9df3-0ca0-4cd3-9f37-ab4523e42d85","resolution":{"observed_at":"2026-08-07T04:27:31.157675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.125406Z","title":"Conservative q-learning for offline reinforcement learning,","venue":null,"work_id":"a5cdd8d8-2385-4ecd-a36d-589eeeb13d9c","year":2020},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.521022Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:827c9ad79e4188cd16a0d7de918c52157175351e6c68b186078d5110536ebec9","observation_id":"c8364e28-c826-42d7-b104-9488c5a1d8bd","resolution":{"observed_at":"2026-08-07T04:27:31.135640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.096921Z","title":"A minimalist approach to offline reinforce- ment learning,","venue":null,"work_id":"0f05727a-1016-4c02-9b0b-d6f62e80df82","year":2021},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.527463Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:7e9db7a3724b2311ae9f709978200de8df8b84816fbb8c52b535d499cdd4634b","observation_id":"03d3fb43-b9bb-442d-b1ed-df58065d65db","resolution":{"observed_at":"2026-08-07T04:27:31.103450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.072851Z","title":"Off-policy deep reinforcement learning without exploration,","venue":null,"work_id":"f8e2b8bb-e70f-43b3-b86b-c784d688eba0","year":2019},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.533658Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:108d343e15e3f06a16d67a157158585df3cd07f4d455ed9f5efa2a8463cf256d","observation_id":"f0913dee-c670-42da-9b0f-7160d230e533","resolution":{"observed_at":"2026-08-07T04:27:31.079366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-07T04:27:30.542382Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.542382Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:82cfebe9d176873b464c7cb3b1b8838737309ed2240905674dbac0059fb8a8cd","observation_id":"f69c47d4-639e-4bb8-a9b2-5ee79a991814","resolution":{"observed_at":"2026-08-07T04:27:30.542382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-07T04:27:30.548506Z","title":"Extreme q-learning: Maxent rl without entropy,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.548506Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:91cffae66b0f16711fcfbda32adcf3877f8ef91efe49cee3ef4375906afb962c","observation_id":"6b556c63-0a75-4c9d-a391-14da58e48501","resolution":{"observed_at":"2026-08-07T04:27:30.548506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T04:27:30.555683Z","title":"Offline reinforcement learning with implicit q-learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.555683Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:ec8511bf2e5b7ec6ca698924c51ad0d55d3a1555105213cf720b8655beccee7e","observation_id":"05760fd6-b9e7-4ee7-9971-fb4e4a86156d","resolution":{"observed_at":"2026-08-07T04:27:30.555683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:30.561578Z","title":"Aggressive driving with model predictive path integral control,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.561578Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:23303c41fb3e6dc40a57031bacd68ee202d394e2c2fb70f0a4c5a4b1493b1b25","observation_id":"d9f23434-f2ee-4508-8fb0-c5c7e8889472","resolution":{"observed_at":"2026-08-07T04:27:30.561578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:30.569861Z","title":"Trust region policy optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.569861Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:01ba6f00ed88312ae5da871a03ae45bd4c207fba9ebd84d593b4e937876d62db","observation_id":"4e8df83b-7ac8-4750-ad88-c1415d4c9e99","resolution":{"observed_at":"2026-08-07T04:27:30.569861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.008412Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"e382cffd-4cba-421e-a6cf-90b0dffeb58e","year":2018},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.576382Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:58a3bedc75490ceb02b4590acbb902d270e178ded78c67d9dd897e4df4bde894","observation_id":"dc279f4d-39da-4c85-b56e-c235f4528584","resolution":{"observed_at":"2026-08-07T04:27:31.019435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:30.585942Z","title":"Imitation is not enough: Ro- bustifying imitation with reinforcement learning for challenging driving scenarios,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.585942Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:df12946fd76f008a33f241bd74cffeace05005cbfb5c1abb11e040a9e59a2058","observation_id":"f335dd01-54b4-4e0e-88e6-d9ab13ca0f86","resolution":{"observed_at":"2026-08-07T04:27:30.585942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-07T04:27:30.592023Z","title":"Awac: Accelerating online reinforcement learning with offline datasets,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.592023Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:3b0a0f0cbe86de1770dc667d6488d711d6475252aa77de641e50f17cf0b2f16b","observation_id":"4a59ac21-e20c-4335-982e-fa8a68de9b1a","resolution":{"observed_at":"2026-08-07T04:27:30.592023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2506.12095."}