{"as_of":"2026-08-23T12:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73ca535ebe54a00aa25806bc018147b7db33be8d618d2184f99f6445a85c8d89","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T05:28:28.298787Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.31691/citation-record","integrity":"/paper/2606.31691/integrity","json":"/paper/2606.31691/citation-record.json","paper":"/paper/2606.31691"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.695242Z","title":"Deepmimic: Example-guided deep reinforcement learning of physics-based char- acter skills","venue":null,"work_id":"8ba1966f-1b5d-42bb-843d-2737ae6a5a3a","year":2018},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:360763e2c90daf7e74c4e24f67075d117e241cb129015eaf3952defb9c7352c2","observation_id":"577b2d4a-0e01-445a-8c35-2f5370713f3c","resolution":{"observed_at":"2026-07-06T21:42:56.696535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.663824Z","title":"Towards robust motion control in multi- source uncertain scenarios by robust policy iteration,","venue":null,"work_id":"9f5f187f-2d51-4822-8d78-e2480703c596","year":2025},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:0a452790686462bf89e7f15957dcc214c035ab8851110e77df08057a67c512d2","observation_id":"c0851825-7d3c-4dc7-9249-86fdc1a84903","resolution":{"observed_at":"2026-07-06T21:42:56.665133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.669259Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning,","venue":null,"work_id":"221e0bca-962b-4967-8260-fe3c2ea3027e","year":2021},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:9e95bb6d17ef09e5640cb92a8d6f95b4d3c2e24145362d071c96e1f83f7351c4","observation_id":"3bb1bd68-d373-4717-82e6-a2c714e9802e","resolution":{"observed_at":"2026-07-06T21:42:56.670441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:46:13.581103Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning","venue":null,"work_id":"380ca6e0-55eb-40c9-921f-e3ceab211529","year":2022},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:796764bceb0a2e296311b86b489ac752154a1b11e7e8f350df5d7a931be3b311","observation_id":"85d90521-0a46-4d7d-bbbb-db3f667cb576","resolution":{"observed_at":"2026-07-06T21:42:56.661458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.658379Z","title":"Parallelq- learning: Scaling off-policy reinforcement learning under massively parallel simulation,","venue":null,"work_id":"09f57d38-651e-4b91-be87-404b63525ad6","year":2023},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:c8c75dec8ebdcb66e12dc6c1e681556c2d935ea39bc9315c85e598d9109c8e16","observation_id":"beb051b3-c625-4441-a55e-36d2e95d0834","resolution":{"observed_at":"2026-07-06T21:42:56.659633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.688175Z","title":"Randomized ensembled double q-learning: Learning fast without a model,","venue":null,"work_id":"99900863-4850-4cce-a3fc-b342d239322b","year":2021},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:726cfcf08e046631ee803d3dd2f3764256e01b5cc7010c0eef50dbd40417ac24","observation_id":"18ef4f72-b86d-457f-aae2-034b3470a634","resolution":{"observed_at":"2026-07-06T21:42:56.689497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.690051Z","title":"Understanding and preventing capacity loss in reinforcement learning,","venue":null,"work_id":"9a84ddac-acb3-4d5a-84bb-ad970b755049","year":2022},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:e3609543e2c68240922790c48cc03b329d14f150da1f032de52f5100d7f484ae","observation_id":"d6a03610-57c2-453d-a00d-3c9d83c53571","resolution":{"observed_at":"2026-07-06T21:42:56.691225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.691795Z","title":"The primacy bias in deep reinforcement learning,","venue":null,"work_id":"cb33da12-e2ef-4149-8500-fdae1aae5130","year":2022},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:26bd8947101c692e0c78ea69730ce4ce7c5577a4bc5694f48e217a5665b18dd6","observation_id":"56a943d7-4848-4e59-bf97-2187a60888ca","resolution":{"observed_at":"2026-07-06T21:42:56.692973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.686398Z","title":"Deep reinforcement learning with plasticity injection,","venue":null,"work_id":"ec04d339-3e7e-4866-97ff-3b167bddc829","year":2023},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:45537175fd39d93cdcb67400f63ddce80c7c4395d71cf5a1c7d3c16ead100000","observation_id":"199f3d32-e9c7-47d1-9c84-61554d50c5a1","resolution":{"observed_at":"2026-07-06T21:42:56.687595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.665699Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"3c7dd272-8c5d-423e-b9ea-34518c6babf6","year":2015},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:74b19925cb5c1b1420d57e5c048b8fd7956aca950a75379aae28cda97c0c6d20","observation_id":"6df9832f-17f5-4571-b5d5-08501d113738","resolution":{"observed_at":"2026-07-06T21:42:56.666905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.662019Z","title":"Continuous control with deep reinforcement learning,","venue":null,"work_id":"e8e65a98-25b1-4139-8475-68571b54d62a","year":2016},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:dba5dd8417d4aef7d5516b678164c3ce7a5dd1d79b2512ebc2ab3d7c38ad66ca","observation_id":"9425a985-eb4f-4405-abcf-d5f72282856b","resolution":{"observed_at":"2026-07-06T21:42:56.663237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.682736Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"ea54bb9c-90e7-47dc-84ed-41707c345615","year":2019},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:96eca3f569e9212d20a1fe9cbea5ad117aabba664d7a113106d6103b22976a46","observation_id":"7038c482-182f-4e7e-95a5-3658d64bb3d4","resolution":{"observed_at":"2026-07-06T21:42:56.683973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T07:34:43.616247Z","title":"Addressing function approxi- mation error in actor-critic methods","venue":null,"work_id":"5529beb5-cee9-41fb-ad76-31832ca8cefe","year":2018},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:bdda5f0f1ad460dc18d2ad0dfca4636b2ec8e0b4eb73197da50b4cec8a585b37","observation_id":"67368d14-222b-4f99-80af-5d10b4fa672b","resolution":{"observed_at":"2026-07-06T21:42:56.682164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.667504Z","title":"Smoothed action value functions for learning gaussian policies,","venue":null,"work_id":"c89094c0-c32a-4d0c-b74b-3f8b016ed693","year":2018},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:3598c6a147b61d0013d6c0dd9f606fd6179e1eb3fe81dda5595a313c8808594b","observation_id":"6a6b1675-58f3-4067-98cf-fdb1d26e33a2","resolution":{"observed_at":"2026-07-06T21:42:56.668718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.677432Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction,","venue":null,"work_id":"879ead61-1678-4d80-97c8-a5975c73e2c3","year":2019},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:88f27312189aaf252ac2dda616e0445183ec033da19f0f3fc1a83f6c19f5b248","observation_id":"e5b99d32-f6ad-4d9a-98c4-4dea8920deb0","resolution":{"observed_at":"2026-07-06T21:42:56.678667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.679250Z","title":"Demonstrating MuJoCo playground,","venue":null,"work_id":"037c45df-a204-437b-9714-198a537ee82d","year":2025},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:fe642d68716fa0d77b363183df41888db395e196313878b060cec43f64ae177c","observation_id":"082f1e61-89ec-4554-ae27-ec28c0b8afc8","resolution":{"observed_at":"2026-07-06T21:42:56.680348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.684553Z","title":"Humanoid- Bench: Simulated humanoid benchmark for whole-body locomotion and manipulation,","venue":null,"work_id":"e9294400-b203-43f0-ad1d-34e2177d7613","year":2024},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:68a31a9c9f9e65656ba0d316082177313848435f76e4fffe748545b3699e1ff7","observation_id":"b9387db1-df13-429d-b33a-ff9f31a8295d","resolution":{"observed_at":"2026-07-06T21:42:56.685806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:bffdbabf26fbba1f3d280e9fe78bf299e84ffb47ce0e46893142118629bcfa30","observation_id":"49629b77-0c2b-4599-b51f-aede4b038750","resolution":{"observed_at":"2026-07-01T10:25:42.282822Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T07:34:43.608241Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"05ca9c2f-3d88-4368-8a54-341e7866d027","year":2018},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:c711254441b03cb9ca795bac2d360361cda30b009ba3f33fbeaa0b913180c4e0","observation_id":"ec7a3f50-326f-420d-a0ad-1a081c8816ec","resolution":{"observed_at":"2026-07-06T21:42:56.694711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.697087Z","title":"A distributional per- spective on reinforcement learning,","venue":null,"work_id":"756fffe9-862f-48e5-be85-af61a236b0d7","year":2017},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:7fa4f2ba84ed9d71a24001a903d80efa16410237ab66136427562631483d8e0b","observation_id":"fa85eaec-3c3b-4835-b975-a38a3c06821e","resolution":{"observed_at":"2026-07-06T21:42:56.698246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:d8e5074112760dc816fc18c8c9c5df1b408ff1204c68b2304f91c778abad7999","observation_id":"777d2734-968a-4372-809d-a0cc91583f46","resolution":{"observed_at":"2026-07-01T10:25:42.276740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01996","doi":"10.48550/arxiv.2512.01996","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sferrazza, C., Huang, D.-M., Lin, X., Lee, Y ., and Abbeel, P","venue":"ArXiv.org","work_id":"31a9f277-c36a-47ed-a6a6-a3d49c6debc3","year":2025},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:49e67dfe280b99ecb29653a47243f7efd4e33281dd2a04622d8e0b85e5228df3","observation_id":"5a9aa663-3fb2-45b1-97e9-8c7f442239a9","resolution":{"observed_at":"2026-07-01T10:25:42.279278Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.698766Z","title":"Understanding plasticity in neural networks,","venue":null,"work_id":"4abeb3ea-eb9f-490c-8178-108a0d17a23d","year":2023},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:76524295ca3a5f1a7c6b481de7f1942509d6acc2c799188770f87f20ef0ecb93","observation_id":"fee1a2df-bc03-4776-b843-a95095394f45","resolution":{"observed_at":"2026-07-06T21:42:56.699855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.700398Z","title":"Dropout q-functions for doubly efficient reinforcement learning,","venue":null,"work_id":"0fee97f9-703a-46a7-88cb-c2b50a88bf5b","year":2022},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:e8fc4bb7b028d55fa6a03f0d39a9a96446cf92b2e5de4bcc8ffa7d463526131c","observation_id":"f9cc123d-ef33-4701-ad96-21cbcefbcbea","resolution":{"observed_at":"2026-07-06T21:42:56.701584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.672863Z","title":"Distributional soft actor-critic with three refinements,","venue":null,"work_id":"357a224b-7afc-463a-b143-54085a3d047b","year":2025},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:4ec8da1a938b9cafa7381410343c63b0a09b62aedd27bf2c7f7514cccac6e18d","observation_id":"2c714ea5-f0d1-42bd-bd02-48764c69ca09","resolution":{"observed_at":"2026-07-06T21:42:56.673983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.674559Z","title":"Controlling overestimation bias with truncated mixture of continuous distributional quantile critics,","venue":null,"work_id":"20f80c6d-2a70-41c8-8bda-ba075e1feaf4","year":2020},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:5cfc8866bd78aae15cd9c770279829e104fcd8623c161c2f9d5d54820b331c68","observation_id":"03469d2b-161f-4484-a2dc-8fc8a03152a6","resolution":{"observed_at":"2026-07-06T21:42:56.676853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04792","last_updated":"2024-12-11T09:40:27Z","snapshot_observed_at":"2026-08-16T13:20:33.280823Z","submitted_at":"2024-09-07T11:08:20Z","title":"Improving Deep Reinforcement Learning by Reducing the Chain Effect of Value and Policy Churn","version":2},"cited_work":{"arxiv_id":"2409.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04792","snapshot_observed_at":"2026-07-01T10:25:42.279123Z","title":"Kenny Young and Tian Tian","venue":null,"work_id":"891b5821-3053-4c80-93dc-a0d0afa2601f","year":2024},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"cited_paper":"/paper/2409.04792","citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:f4a8543352474b2e1992d2e178e93a0a525d5a6a3bbb798a78183e8f69e5e3c8","observation_id":"885ddcd0-b9ed-4882-9a81-0af74ef93f18","resolution":{"observed_at":"2026-07-01T10:25:42.280503Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.670991Z","title":"Stop regressing: Training value functions via classification for scalable deep rl,","venue":null,"work_id":"755bad85-b2f5-4de0-a8d1-36f69de6b6cb","year":2024},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:7507a0a0dc1dd84cbc972d1b474a0fb74fd098b71bd11ab8eec020d9fcb12a9f","observation_id":"94520889-b3d5-47ca-9d65-34385a5a08c7","resolution":{"observed_at":"2026-07-06T21:42:56.672302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":2,"verified_fuzzy":24},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2606.31691."}