{"as_of":"2026-08-20T13:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:133020e9ec2ecfc7cef7e587b05b4acfd50bdf831e87b758d7fcc5e96ec16ebc","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:02:41.650877Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02958/citation-record","integrity":"/paper/2608.02958/integrity","json":"/paper/2608.02958/citation-record.json","paper":"/paper/2608.02958"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-15T15:02:41.415362Z","title":"π 0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.415362Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:eb4760cb607c69dca5949df748d356b8d212f278869058123079ef0fbe062e8e","observation_id":"f0e327eb-cc37-41fc-ac9f-ad43b5fb7db0","resolution":{"observed_at":"2026-08-15T15:02:41.415362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-15T15:02:41.421479Z","title":"π 0.5: A vision- language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.421479Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:b98be0dac775c0003075915985acd01b9878a22a2c2c255ae434b7fe0de0313f","observation_id":"4bdb01c7-c19c-49aa-8284-2675c899ca72","resolution":{"observed_at":"2026-08-15T15:02:41.421479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-15T15:02:41.427337Z","title":"π ∗ 0.6: A VLA that learns from experience,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.427337Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:961d26993e291e35ee1a2c0581fa647d5ff79fdbaed79c5de98a6bb733500c19","observation_id":"a6f130c9-fd8b-43f6-b4fc-e6d31fc55b12","resolution":{"observed_at":"2026-08-15T15:02:41.427337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-15T15:02:41.432578Z","title":"OpenVLA: An open- source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.432578Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:198ecf75582f443a8370b3d4fe42f82a94d93cf990d97b5bd172eb867783ec3f","observation_id":"f2044ad1-7e77-4b81-a8ac-c3c54c9fdfa2","resolution":{"observed_at":"2026-08-15T15:02:41.432578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-08-20T09:40:44.825072Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-15T15:02:41.437785Z","title":"RDT-1B: A diffusion foundation model for bimanual manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.437785Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:e5de55b3c41c4ecd8319ab4a48729ecc4497866033790e4186c8cfc099b98a4e","observation_id":"c5494d4b-18ed-4c80-a060-212a70fe5ec2","resolution":{"observed_at":"2026-08-15T15:02:41.437785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:41.442971Z","title":"GigaBrain-0.5M ∗: A VLA that learns from world model-based reinforcement learning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.442971Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:9e0752bd7126bed675e4e3d66443e8e0e2d74447767a37d6b66d9172b7175cc1","observation_id":"190a658c-ae30-41eb-9636-7f2fd317abcf","resolution":{"observed_at":"2026-08-15T15:02:41.442971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.693951Z","title":"LeRobot: State-of-the-art machine learning for real-world robotics in PyTorch,","venue":null,"work_id":"a5aced53-3c19-4f5a-a06a-433df2472a2f","year":2024},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.447649Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:9e14a21e50812384380690d62b0187af19b69d748b7b51b44eb3ed65ba12ac30","observation_id":"0fe84d86-5341-478a-ad6b-ec8f4a0381f2","resolution":{"observed_at":"2026-08-15T15:02:42.698854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-18T01:07:23.737664Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-15T15:02:41.453078Z","title":"Sim ´eoni, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.453078Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:e4d7b24c7cb639965e469efe74312dcf6161a550b4685b24203aa304e165bb3a","observation_id":"cf8cc2e8-5f26-4ed8-b694-d0f93b49890b","resolution":{"observed_at":"2026-08-15T15:02:41.453078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-15T15:02:41.457922Z","title":"RT-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.457922Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:91079b5ed033167ed243c8043dd4fb6c4624a335fa75754e91aefeb801c8bc08","observation_id":"4fa4a75d-27f3-4c63-9114-223b557c1e9d","resolution":{"observed_at":"2026-08-15T15:02:41.457922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-15T15:02:41.462863Z","title":"RT-2: Vision-language- action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.462863Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:ea15b64ee54136f8d65cbf2ecd8eeec98b99e85cbad099e1afaf8f98436d206f","observation_id":"94c88663-bab4-4128-9f0f-ef5be6899801","resolution":{"observed_at":"2026-08-15T15:02:41.462863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.678166Z","title":"OpenPI: An open-source implementation of theπ 0 vision-language-action model,","venue":null,"work_id":"33757e41-e4e0-4ac9-9f59-ce9859f7460d","year":2024},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.467599Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:1b62dc874f38af13044ed92f37d7bdb563c221ea610670ec5260d870fd64789a","observation_id":"0edee28e-0d3e-471f-8f6d-99308dc3d347","resolution":{"observed_at":"2026-08-15T15:02:42.683287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:41.472878Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.472878Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:2214b9e66082dad471ed813d2421d91f6ac88491ae6c929b43dcfb3b8f5e2b98","observation_id":"38447433-88ab-41eb-8e8a-928dedf3afd4","resolution":{"observed_at":"2026-08-15T15:02:41.472878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.652294Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":"8beb5188-af60-4547-ac1f-135942b24e65","year":2023},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.477834Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:0253501d9cf69b23baa8898817767efae1e7148831060b929a6e734bdc214477","observation_id":"be3c095b-6159-4b72-bbf3-e2a3846b4de1","resolution":{"observed_at":"2026-08-15T15:02:42.656926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:41.482362Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.482362Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:37dc690e7842c8a756ba4564ff79bce23b2ef66e6d2dc383dbc3b9a3281d2ae4","observation_id":"ac4a517a-a463-4a62-ae3e-2f16db055145","resolution":{"observed_at":"2026-08-15T15:02:41.482362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:41.486801Z","title":"Xiaomi-Robotics-0: An open-sourced vision- language-action model with real-time execution,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.486801Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:a129c35f5cfef3f85120754c99881063401b5c6eeea70e47012b90af6631a2cf","observation_id":"2526b958-28da-4b52-877e-9471b3ff58fb","resolution":{"observed_at":"2026-08-15T15:02:41.486801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:41.491888Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.491888Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:88bae33447d126cf549bf67b1182c763750a2d611308a5d59f9647d87d1d96a7","observation_id":"4c587d16-b1b5-4a7e-8262-35ad00ff8500","resolution":{"observed_at":"2026-08-15T15:02:41.491888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-15T15:02:41.496940Z","title":"Continuous control with deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.496940Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:ed9f705feb5bd1ecf54099c5e094765bf21c97b098f8087b26a7ac830aac7ab7","observation_id":"d9682bcd-ab6e-4fac-bd90-88541120cb38","resolution":{"observed_at":"2026-08-15T15:02:41.496940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.618878Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"426baf86-8f0d-4d8c-9435-1c68ead919ae","year":2018},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.501647Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:2722ce4a52cce7e6efedfd359894f67aa5862ba0303aa72d303730d998f23bf3","observation_id":"d12c4145-0e4d-4519-ba34-4be611a74e51","resolution":{"observed_at":"2026-08-15T15:02:42.623620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.604543Z","title":"Q-Transformer: Scalable offline reinforcement learning via autoregressive Q-Functions,","venue":null,"work_id":"2c16f4e3-1d2f-4840-bf3b-e3609080194e","year":2023},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.506037Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:6d0fabbbcd0b55d2289c7931f25dbdfe40cd769ddc2cc49e0fb88f7e7f17500f","observation_id":"05f1db3b-a716-4f3f-8a38-7b3b1cb1ffff","resolution":{"observed_at":"2026-08-15T15:02:42.609498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.590007Z","title":"Offline reinforcement learning with implicit Q-Learning,","venue":null,"work_id":"324326ef-cbe8-438f-9c24-7b08752112bd","year":2022},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.510778Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:c032345c04f4da89705070037e525afdc7340b2efbbad0fac6ad1fc33b2bf325","observation_id":"bca37e54-10b7-41b6-bb0f-a8bc0544a626","resolution":{"observed_at":"2026-08-15T15:02:42.594889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.575497Z","title":"Conservative Q-Learning for offline reinforcement learning,","venue":null,"work_id":"8bfd486f-93d0-483c-85b3-4783b299735d","year":2020},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.514974Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:3b0e92f26e65dea0ad422d81a6837c89ed63623004f1af955cc6ce79d8c0952d","observation_id":"55cee351-4331-4ed6-9459-d2b387895242","resolution":{"observed_at":"2026-08-15T15:02:42.580342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.561033Z","title":"VIP: Towards universal visual reward and representation via value-implicit pre-training,","venue":null,"work_id":"971654dc-13ce-4375-8889-62fb9abeaac3","year":2023},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.519302Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:4499752c203895b91949e1224bfe811da0d9cf0a23a95ca2eebf0ff97812ffec","observation_id":"347c65e5-ea50-4851-8e64-3b1ffe7c2ea7","resolution":{"observed_at":"2026-08-15T15:02:42.565820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.546911Z","title":"LIV: Language-image representations and rewards for robotic control,","venue":null,"work_id":"b2be70dc-4aef-4784-bda4-5ac32cb691c2","year":2023},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.524128Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:d905fe7e78c2b107aa14f948d0b81984f4caa6b09e7108cf6d62599a4649df02","observation_id":"fc3462e8-1e6c-4a63-8dc3-52e4950688b6","resolution":{"observed_at":"2026-08-15T15:02:42.551612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.533077Z","title":"Contrastive learning as goal-conditioned reinforcement learning,","venue":null,"work_id":"4a2f1aa4-c035-49b0-a2cd-2855c04c7637","year":2022},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.528700Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:84adcc35b9cf963b848b17caaf630378f9c3ab90923cded11a01653116ed403e","observation_id":"b16b8d36-e70a-4112-bdd4-d778613395ff","resolution":{"observed_at":"2026-08-15T15:02:42.537740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.517769Z","title":"GoFAR: Offline goal- conditioned reinforcement learning via state-occupancy matching,","venue":null,"work_id":"790e9346-1b0a-4314-b510-53ded2165c21","year":2022},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.534071Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:9c4625dabbd3ef4fc117ae9c5d9320a751623b815b2771f6922471f28ff6cffd","observation_id":"ad680993-cb28-44dc-9e86-70d19154b112","resolution":{"observed_at":"2026-08-15T15:02:42.522202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-15T15:02:41.539164Z","title":"Diffusion policy policy optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.539164Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:7140732d83f03b9556dd60643b3e57d43f38d3ad0e35897a5d9181d9995987fa","observation_id":"c02acba3-526e-475e-b87b-4c162cd52012","resolution":{"observed_at":"2026-08-15T15:02:41.539164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:41.544101Z","title":"VLAC: A vision-language-action-critic model for robotic real-world reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.544101Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:b3fe3796ac52ceb03eae598833928fff67eaf2e591e2084af6c2ef0698b38727","observation_id":"c413955e-7141-4bfe-8f89-3cdea09e62de","resolution":{"observed_at":"2026-08-15T15:02:41.544101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:41.548852Z","title":"SAFE: Multitask failure detection for vision-language- action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.548852Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:814d30a5bcbeaa3775b1e9a52e1557c06c9e68936113ac8c3b9becce55b1cd2e","observation_id":"22522702-9309-4bb1-9acc-1a0fc399b256","resolution":{"observed_at":"2026-08-15T15:02:41.548852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00371","last_updated":"2024-10-01T03:47:00Z","snapshot_observed_at":"2026-08-18T18:53:05.535288Z","submitted_at":"2024-10-01T03:47:00Z","title":"AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00371","snapshot_observed_at":"2026-08-15T15:02:41.553251Z","title":"AHA: A vision-language model for detecting and reason- ing over failures in robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.553251Z"},"links":{"cited_paper":"/paper/2410.00371","citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:88988166ecc16b423a25aaa3f2e7278cec350902dd3978c37b81da2562f5af06","observation_id":"65428792-2496-40f1-9f1c-1ffa74e6bf32","resolution":{"observed_at":"2026-08-15T15:02:41.553251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:41.558114Z","title":"I-FailSense: General robotic failure detection with vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.558114Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:64520dc2afbae9d77af12ffdadd42a592f07ac787b0356259cf75ad948cd9564","observation_id":"3f8d0f19-fa02-4d52-828c-45d1482d5488","resolution":{"observed_at":"2026-08-15T15:02:41.558114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:41.563786Z","title":"Score the steps, not just the goal: VLM-based subgoal evaluation for long-horizon manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.563786Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:5fa2830c4f15020e88def943a9ca66b2757fac211d10d56c5a396c0408b54179","observation_id":"8289811b-fdef-41ff-affe-6afbfc7166bf","resolution":{"observed_at":"2026-08-15T15:02:41.563786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07899","last_updated":"2023-10-11T21:10:21Z","snapshot_observed_at":"2026-08-16T14:52:53.872056Z","submitted_at":"2023-10-11T21:10:21Z","title":"RoboCLIP: One Demonstration is Enough to Learn Robot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07899","snapshot_observed_at":"2026-08-15T15:02:41.568317Z","title":"RoboCLIP: One demonstration is enough to learn robot policies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.568317Z"},"links":{"cited_paper":"/paper/2310.07899","citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:ae484948643cafc6fb076789853728af410043cd4469c91b3152d3f03284d40b","observation_id":"3a095653-1d88-491b-bbaa-b4452fae635c","resolution":{"observed_at":"2026-08-15T15:02:41.568317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.503002Z","title":"Eureka: Human-level reward design via coding large language models,","venue":null,"work_id":"9a547f18-942d-44df-b76d-7285bd912f55","year":2024},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.573081Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:4656b5b40b765e324005712423e8171c1ca30d7308e7d0705c732ecfb42ef123","observation_id":"81ba3366-5daa-4143-b4ad-8f142ef64257","resolution":{"observed_at":"2026-08-15T15:02:42.507851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.486678Z","title":"JHU-ISI gesture and skill assessment working set (JIGSAWS): A surgical activity dataset for human motion modeling,","venue":null,"work_id":"df23d3a1-022c-41c9-b6fc-66f8f77e3c6e","year":2014},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.578714Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:52d68efbae83b878e5d5ce7d5ce5e3974042a8d79698f08c26baef1967ac85b9","observation_id":"d37e56e8-90bf-4972-8fb0-9738bf696814","resolution":{"observed_at":"2026-08-15T15:02:42.492478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.471755Z","title":"EndoNet: A deep architecture for recognition tasks on laparoscopic videos,","venue":null,"work_id":"9e1a04a6-5244-4e2b-9191-edfae8b8ad12","year":2017},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.583014Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:effb3f2cad2371845463387679aae2b2583e82828b777b1952a89c80cb7c9a3c","observation_id":"6598b3e5-267f-4211-a448-c469afd72baf","resolution":{"observed_at":"2026-08-15T15:02:42.476569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.453506Z","title":"MS-TCN: Multi-stage temporal convolutional network for action segmentation,","venue":null,"work_id":"c14b4b33-3579-40f3-b46f-abac41b3569e","year":2019},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.588456Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:ba966b56c4cf94235154ee6c68623e37cb6c81220024c14e2042e6f9810112e8","observation_id":"a611b781-5a24-4f2d-88ce-c215b0f87aba","resolution":{"observed_at":"2026-08-15T15:02:42.460133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.437989Z","title":"ASFormer: Transformer for action segmentation,","venue":null,"work_id":"378e41d2-7612-43ac-aa6e-63e0febd7972","year":2021},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.593049Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:4257241b4e0181e374bda5bdbcf0fc1fbb4031c186c382140a25e8f515d36e36","observation_id":"fcd55768-862d-4696-b916-1da56be9d3e7","resolution":{"observed_at":"2026-08-15T15:02:42.442471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.422736Z","title":"The THUMOS challenge on action recognition for videos “in the wild","venue":null,"work_id":"eb9d0949-a377-4ef6-8b58-aa13f6a7cddc","year":2017},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.597504Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:9d35a12614f195595114aec0019e211e7860e98a855c920151971c605b92b620","observation_id":"590cca07-9941-4f4c-9828-ec86c1fdceb2","resolution":{"observed_at":"2026-08-15T15:02:42.427607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.404697Z","title":"ActivityNet: A large-scale video benchmark for human activity under- standing,","venue":null,"work_id":"17cac2b3-3915-4cd9-a26b-37b807c51454","year":2015},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.602421Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:e24dc791655ff00ed3c962aef676362113443166779a4249f365c94dc1ded2a0","observation_id":"ffd4ba50-0acf-4444-9620-757526ca789e","resolution":{"observed_at":"2026-08-15T15:02:42.410480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.386546Z","title":"Scaling egocentric vision: The EPIC-KITCHENS dataset,","venue":null,"work_id":"a808b66d-96ed-40d1-a71f-16e9a6081de1","year":2018},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.606917Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:100e5be18a808303d683da8052d04b934491cdf798985bed334a10dc61a6d230","observation_id":"defdb187-7a36-42a7-ad83-d31e400ab0fb","resolution":{"observed_at":"2026-08-15T15:02:42.392963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.369329Z","title":"ActionFormer: Localizing moments of actions with transformers,","venue":null,"work_id":"ed198756-6886-42a3-a3bd-3efbda28afe9","year":2022},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.611388Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:bd1b251f03b76e542d77034151eae657a095341b6e13d176ea650cb77feb77b2","observation_id":"4389f750-1222-45d5-bd87-865c7e4dd82b","resolution":{"observed_at":"2026-08-15T15:02:42.373937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:41.615797Z","title":"Let’s verify step by step,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.615797Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:233ec01d328505e4a262272fd853860b0480e2d9bcb46fd0e75825f71116c98b","observation_id":"6b5a9b44-287b-4d51-b70b-6f2908687eba","resolution":{"observed_at":"2026-08-15T15:02:41.615797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:41.620209Z","title":"R3M: A universal visual representation for robot manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.620209Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:ff67021ccb5a9bad262596041025b86fc9e5f8a0c353f9f0f0963dcf75041ef9","observation_id":"fefe5a37-e52d-4331-ace0-616a3a092fa6","resolution":{"observed_at":"2026-08-15T15:02:41.620209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.331548Z","title":"Value prediction network,","venue":null,"work_id":"3f5b05a1-c9b2-4ee3-8653-cbb04229f54d","year":2017},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.624683Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:a091bbee6a0c5c4739b63862d1a35a33702fc2e6cea54685654f9fd705c8a25b","observation_id":"720ce021-625e-40e8-a0ff-8f81bb2e8cf1","resolution":{"observed_at":"2026-08-15T15:02:42.337585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.314999Z","title":"Hi Robot: Open-ended instruction following with hierarchical vision-language-action models,","venue":null,"work_id":"926c1c72-ed23-45ec-a29e-bb23e6286c22","year":2025},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.629081Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:27e3bd63cefc02812deea7befaf726c4c5ad0aedc5ca2c1e49f8dfd29583dfe1","observation_id":"162dcab4-6c66-4f8c-b8d4-591017289f75","resolution":{"observed_at":"2026-08-15T15:02:42.320148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-15T15:02:41.633989Z","title":"Do as i can, not as i say: Grounding language in robotic affordances,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.633989Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:9c5eafe0b454e1d24fbcc0f9a50f884b6469912530d38d3cec2f2587500870ff","observation_id":"09de69db-ef78-412b-af36-2eeaff55e989","resolution":{"observed_at":"2026-08-15T15:02:41.633989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.297833Z","title":"Inner monologue: Embod- ied reasoning through planning with language models,","venue":null,"work_id":"cdb89084-708f-43fd-bc12-76a355599518","year":2022},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.638484Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:a73ed95bab388d51e393b8620ce9ab2b8ea90181e98e56fac22729e7baff4dae","observation_id":"e21eac49-62d1-421f-ab97-bc72cb148efe","resolution":{"observed_at":"2026-08-15T15:02:42.303592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.282732Z","title":"Interactive language: Talking to robots in real time,","venue":null,"work_id":"f0a9e1b3-34ff-47f9-b7f6-4d8324c76ba3","year":2023},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.642742Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:91d1ed7baad1bb2a7d7fb7ef6a765a08ba12ec51b7db6807a1ea815427905800","observation_id":"7a40187b-8cd6-41ef-bcf6-ab63ff94a761","resolution":{"observed_at":"2026-08-15T15:02:42.287712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.267408Z","title":"What matters in language- conditioned robotic imitation learning over unstructured data,","venue":null,"work_id":"8cd9e515-d71d-4c8f-a876-2b8cba49778c","year":2022},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.646714Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:bb97ccbe8972dd89602285f6a62f0f55f7cd3a79ed4d6e134bf635e73308eaa5","observation_id":"64aec2f3-cf86-4567-9900-1a457c730b57","resolution":{"observed_at":"2026-08-15T15:02:42.272114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:02:42.249438Z","title":"HG-DAgger: Interactive imitation learning with human experts,","venue":null,"work_id":"11eb64a5-b31b-43ed-abeb-c574bd56a482","year":2019},"citing_paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:41.650877Z"},"links":{"citing_paper":"/paper/2608.02958"},"observation_digest":"sha256:2ab1b930056b89e7b800136f51c2282729d4755bed1f3785379c6507a5298436","observation_id":"400348e5-c209-434d-be2e-52a6acbba034","resolution":{"observed_at":"2026-08-15T15:02:42.256203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.02958","last_updated":"2026-08-03T23:46:39Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-18T18:54:29.745563Z","submitted_at":"2026-08-03T23:46:39Z","title":"ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2608.02958."}