{"as_of":"2026-08-09T02:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7cb4413a0abc54ea899355eb61db297ac998f79f5ecae90e7791ba4bcf6f71a","coverage":[{"denominator":145,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:23:22.546415Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26991/citation-record","integrity":"/paper/2607.26991/integrity","json":"/paper/2607.26991/citation-record.json","paper":"/paper/2607.26991"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-07T04:35:01.931995Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-01T10:23:13.435458Z","title":"From intention to execution: Probing the generalization boundaries of vision-language-action mod- els,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:13.435458Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:0ac64c094a84ce8f27218d495a94ac74a64e245be59e1f5ebdcfb4075a337272","observation_id":"82189999-d2a1-4aa9-8fbd-d1272d3f771b","resolution":{"observed_at":"2026-08-01T10:23:13.435458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:13.492884Z","title":"Interleave-VLA: Enhancing robot ma- nipulation with image-text interleaved instructions,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:13.492884Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:3c8ae817664c13a75bdbcfdd361e23cef9741d03cf44811253f29d607c121c41","observation_id":"4058a8c2-20b2-4552-ade8-5648240821b1","resolution":{"observed_at":"2026-08-01T10:23:13.492884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:13.620644Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:13.620644Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:c05a258ce5021e40c8e13ba4760a00eb98b4889aeaad4a7ac8bbcf867a0e953d","observation_id":"8d04be80-913f-4dae-84f5-6892ef26704b","resolution":{"observed_at":"2026-08-01T10:23:13.620644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-01T10:23:13.732230Z","title":"π 0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:13.732230Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:f1b09947834808b49c4b808826cc24e4e501a01049eb5225cbed2679864a405f","observation_id":"a5d449e5-326b-4bd5-9177-80821f0acfa3","resolution":{"observed_at":"2026-08-01T10:23:13.732230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:13.818099Z","title":"π 0.5: a vision- language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:13.818099Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:2280cd107f9251c1d67ff3800cac3c385e5d9b1c5cd192b2150a5b3abf27d9c5","observation_id":"26ecde4f-a058-4467-b0bd-be50d94cfc35","resolution":{"observed_at":"2026-08-01T10:23:13.818099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-01T10:23:13.881598Z","title":"Molmoact: Action reasoning models that can reason in space,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:13.881598Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:bf3b3caec57456e5171f77dcba58326a91a3ffb371ed99a0c3c7024fd4fcdd6e","observation_id":"836a3aa9-8e48-4ea9-b88b-f12df5d4f65f","resolution":{"observed_at":"2026-08-01T10:23:13.881598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:13.955885Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:13.955885Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:2a7cde5e7ac9ef9fe6ce737b90d849d36a26c5b9f56a267b330d3c90a7602b76","observation_id":"8f77e18b-c5c8-434c-84dd-e22b1dbc284c","resolution":{"observed_at":"2026-08-01T10:23:13.955885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-01T10:23:14.040221Z","title":"GRAPE: Generalizing robot policy via preference alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:14.040221Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:7e0de2bfb72e98f0a2e18c46fe886b82d1eb9c69efa94f8f87a4705fc184478f","observation_id":"8247ecf9-282f-4cea-99d9-e682e690fe3f","resolution":{"observed_at":"2026-08-01T10:23:14.040221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:14.126447Z","title":"Robotic control via embodied chain-of-thought reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:14.126447Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:75464d74e0d35ede93dc08fa3307255fc33483bab569157ab783a7d5dfd8ade8","observation_id":"8b64a5cd-3678-4ceb-89c0-ba09c37d333d","resolution":{"observed_at":"2026-08-01T10:23:14.126447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:14.218154Z","title":"Fast ecot: Efficient embodied chain-of-thought via thoughts reuse,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:14.218154Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:b5f781fa3d3a8929ca0c29d48eba5dc5e10559b53189624072eaf3b9cf0cd1d2","observation_id":"2fa1ccc3-685b-4333-af6d-97b64a207dbd","resolution":{"observed_at":"2026-08-01T10:23:14.218154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:14.314459Z","title":"Steering your generalists: Improving robotic foundation models via value guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:14.314459Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:015333d11b9855c67749c859fc10ee2aa03f9e1564d437cd28af7d37aa9a1480","observation_id":"8c34d8a8-1442-4862-80f1-30b347952d6b","resolution":{"observed_at":"2026-08-01T10:23:14.314459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:14.407718Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:14.407718Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:abc675ae1e7090602b7e6d188310714d4b6f7a9fb95d5684b7baad4bce2fc19e","observation_id":"2abd730c-9928-476c-aa25-ece195e49fc4","resolution":{"observed_at":"2026-08-01T10:23:14.407718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:14.511876Z","title":"Scaling verification can be more effective than scaling policy learning for vision-language-action alignment,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:14.511876Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:adbeed270e703db0a5b37a8147a1597694e30b8b824e47dd567d3ef82b5253f7","observation_id":"24177c57-d34b-4b97-ab02-764330135832","resolution":{"observed_at":"2026-08-01T10:23:14.511876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:14.605511Z","title":"From foresight to fore- thought: Vlm-in-the-loop policy steering via latent alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:14.605511Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:5891c4a60216fed8be8d8e2374d765fbaa532411047f84b3709427541277698c","observation_id":"38b13b1a-62e6-4e76-bf34-5a8351475e0f","resolution":{"observed_at":"2026-08-01T10:23:14.605511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:14.697591Z","title":"Do what you say: Steering vision-language-action models via runtime reasoning-action alignment verification,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:14.697591Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:cfe01e7a43cecf4eb87824b39ab1cf39088258bdb846f46a628f0e13d7c592e0","observation_id":"fa7863d8-ce58-4de8-ab0c-6e13f8cb9783","resolution":{"observed_at":"2026-08-01T10:23:14.697591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:14.792815Z","title":"Dynaguide: Steering diffusion policies with active dynamic guidance,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:14.792815Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:f0de32b7db960503c02232448631bb4f0781ffa5e4009aab9b32b3f24fb66831","observation_id":"cfeeb6de-fdc0-442d-8e48-6232de845942","resolution":{"observed_at":"2026-08-01T10:23:14.792815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:14.869132Z","title":"VLS: Steering pretrained robot policies via vision-language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:14.869132Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:3d4a5772ea59844331345688532d58f9d26a9b6a770830c902d15ab3f81e0ff0","observation_id":"17a3eb91-e3b8-4596-9db3-5df5637da133","resolution":{"observed_at":"2026-08-01T10:23:14.869132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14178","last_updated":"2026-04-16T10:12:34Z","snapshot_observed_at":"2026-07-06T22:36:08.495952Z","submitted_at":"2025-11-18T06:30:52Z","title":"Towards Deploying VLA without Fine-Tuning: Plug-and-Play Inference-Time VLA Policy Steering via Embodied Evolutionary Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14178","snapshot_observed_at":"2026-08-01T10:23:14.938409Z","title":"Towards deploying vla without fine-tuning: Plug-and-play inference- time vla policy steering via embodied evolutionary diffusion,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:14.938409Z"},"links":{"cited_paper":"/paper/2511.14178","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:3cd3b4edf878b6437d803943b99a8f8db0984c445aad486360f47cc9dd55a0c7","observation_id":"3ceff9a1-5900-42a1-b5ae-7869d131bc48","resolution":{"observed_at":"2026-08-01T10:23:14.938409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:15.033215Z","title":"Compose your policies! improving diffusion-based or flow-based robot policies via test-time distribution- level composition,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:15.033215Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:28936d9b7f820b59a2afe735fbd9b3efcb2425c8d1bfeb6851178b87980e213b","observation_id":"915828f1-0902-45cf-b36a-ba3f53163dce","resolution":{"observed_at":"2026-08-01T10:23:15.033215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:15.125967Z","title":"Safe: Multitask failure detection for vision-language-action models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:15.125967Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:5100023d1a7a198c08235446e364583d5191c9008733ca7311cf1f90043daa42","observation_id":"5d98c612-a7d0-4b30-8fe9-52d1eac505f2","resolution":{"observed_at":"2026-08-01T10:23:15.125967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-01T10:23:15.210833Z","title":"Evaluating real-world robot manipulation policies in simulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:15.210833Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:f0854c6d8ca420215a8469c8c81250a6490f3b72e7b84a320409e7462d0280a7","observation_id":"8a620c79-e51d-40df-b3f6-860cbe107bfe","resolution":{"observed_at":"2026-08-01T10:23:15.210833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:15.286564Z","title":"Polaris: Scalable real-to-sim evaluations for generalist robot policies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:15.286564Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:8557951962d440b1bcfa94100a45ed1ebdbfd41984e12964a4fca798ea28b352","observation_id":"8e8fd429-779b-492c-a9b7-cb4accc96e0f","resolution":{"observed_at":"2026-08-01T10:23:15.286564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-01T10:23:15.337472Z","title":"π ∗ 0.6: a vla that learns from experience,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:15.337472Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:740e14b1b1bf28138407a922678b79dbd38bd2071c1834088503a22267ed0c12","observation_id":"e13195e9-186c-476a-850e-4225a93e5ac1","resolution":{"observed_at":"2026-08-01T10:23:15.337472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:15.417435Z","title":"SimpleVLA-RL: Scaling VLA training via reinforcement learning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:15.417435Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:da47e9f6c8ee547a96b25499cdc5a653c085a5729c6ae4fd8dc166eacf1943ab","observation_id":"4f6bdf98-badb-4894-b743-112ebdf6bb6a","resolution":{"observed_at":"2026-08-01T10:23:15.417435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:15.508623Z","title":"Conrft: A reinforced fine-tuning method for vla models via consistency policy,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:15.508623Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:27452d3266d967fa4fe0edd6bae1d2ef29585ede882966b7a461cf7fedf59ffe","observation_id":"207cf4cb-6321-426a-a817-a9615cb056b3","resolution":{"observed_at":"2026-08-01T10:23:15.508623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:15.618052Z","title":"Policy decorator: Model-agnostic online refinement for large policy model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:15.618052Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:9f83bf87dcaca3b332a2ba50b9809b696bf1fe3c6e472870e61e5b9873855634","observation_id":"49350aa3-aa90-4f42-a1b9-204ee52fbbc3","resolution":{"observed_at":"2026-08-01T10:23:15.618052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:15.692751Z","title":"Self-improving vision-language-action models with data generation via residual RL,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:15.692751Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:afc32950ddb3ff40f28858f411f99502d8db77ca078bf4016dac8dcf68e89b44","observation_id":"5bf7d3ac-a881-4c33-a488-a00f148adfc0","resolution":{"observed_at":"2026-08-01T10:23:15.692751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:15.749064Z","title":"Steering your diffusion policy with latent space reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:15.749064Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:9c152b262cd404f571a663b79916179c201514af13543d24e72ccf0174e9924f","observation_id":"1d6071e7-ceab-4e17-b42f-6d3f1996cdec","resolution":{"observed_at":"2026-08-01T10:23:15.749064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23073","last_updated":"2026-04-30T20:04:38Z","snapshot_observed_at":"2026-07-31T07:02:53.376869Z","submitted_at":"2026-04-24T23:57:45Z","title":"RL Token: Bootstrapping Online RL with Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23073","snapshot_observed_at":"2026-08-01T10:23:15.805915Z","title":"Rl token: Bootstrapping online rl with vision-language-action models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:15.805915Z"},"links":{"cited_paper":"/paper/2604.23073","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:a4b72390358dcd4b4d4ba473e633ef8f3d7fc1e3e9c74052ac38a3c45406bf0b","observation_id":"0e1362db-aeea-44bd-9b26-8c1c4a8479de","resolution":{"observed_at":"2026-08-01T10:23:15.805915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:15.869557Z","title":"OnetwoVLA: A unified vision-language-action model with adaptive reasoning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:15.869557Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:cbbf32060a363af8fc55244070b6ec7c6c4e596311d5f88c33e0494b564889c6","observation_id":"9171437d-0dea-4e0e-b5ba-fa55e7d57e0d","resolution":{"observed_at":"2026-08-01T10:23:15.869557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:15.921754Z","title":"Recurrent-depth vla: Implicit test-time compute scaling of vision-language-action models via latent iterative reasoning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:15.921754Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:ebb132e1bf30478cf418806c7b7e0c9b7335b650600402502632f800cef9aad8","observation_id":"6333fa52-f636-4d23-813d-3c410867247c","resolution":{"observed_at":"2026-08-01T10:23:15.921754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01194","last_updated":"2026-05-02T02:13:11Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-02T02:13:11Z","title":"VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.01194","snapshot_observed_at":"2026-08-01T10:23:15.979649Z","title":"Vla- attc: Adaptive test-time compute for vla models with relative action critic model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:15.979649Z"},"links":{"cited_paper":"/paper/2605.01194","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:0940538ea250752de838502783919c1f53fb95879205b77a8505dedcaf2337f9","observation_id":"c788c747-a420-4035-84fc-9fe037a81601","resolution":{"observed_at":"2026-08-01T10:23:15.979649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:16.027697Z","title":"Scale: Self-uncertainty conditioned adaptive looking and execution for vision- language-action models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:16.027697Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:11f828922b6096527ecfff23f838982aa6ccf8c0dcbf7937c068481322842e05","observation_id":"1bc2efdc-0710-4644-9269-31cc5f73f224","resolution":{"observed_at":"2026-08-01T10:23:16.027697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:16.079243Z","title":"Diffusion models beat GANs on image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:16.079243Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:b67033208f402dccdcdb504a302fb002a523e29a0afa05cdf0e2609d4bc12de1","observation_id":"e01631d8-3810-48af-827b-0de4b259d73a","resolution":{"observed_at":"2026-08-01T10:23:16.079243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:16.142731Z","title":"Tree-guided diffusion planner,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:16.142731Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:a91d5ea4d0f6ac17bafec908eacd1f55cc7263db91fa64bf820eb0c44b402978","observation_id":"83dcab72-84e2-4488-afda-73d946d6210a","resolution":{"observed_at":"2026-08-01T10:23:16.142731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:16.215444Z","title":"Bridgedata v2: A dataset for robot learning at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:16.215444Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:ec98f38de3cd69ffaf2fb7afd5efae64edc1072c42dcacb045dee27c9e0ceec3","observation_id":"aa55a7d3-da41-4efa-8fc0-24e71f3ea53a","resolution":{"observed_at":"2026-08-01T10:23:16.215444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:16.280145Z","title":"Q-learning with adjoint matching,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:16.280145Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:e5d41d4e0f53f30b5ea192ccff4d78c2ab0d8bab0e69a6a4e629706c0f86418b","observation_id":"3fa36e8c-f983-40f1-95ef-4ccf1eefefaf","resolution":{"observed_at":"2026-08-01T10:23:16.280145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:16.322982Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:16.322982Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:d950d75338c0002951826580a31a9b28b6fad3483043fc8fcf3df4fce5997920","observation_id":"f20e95fa-ae97-4ff2-9098-c94021ffafe4","resolution":{"observed_at":"2026-08-01T10:23:16.322982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:16.373443Z","title":"Flow q-learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:16.373443Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:6af3a1d6f71a43fcfa7a217e216457babe1db8b2483040bbaca9ad63fa69d610","observation_id":"ece1d371-fefd-4e55-917b-4bb59d3f7dde","resolution":{"observed_at":"2026-08-01T10:23:16.373443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:16.413313Z","title":"Conservative q-learning for offline reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:16.413313Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:0e847a14e8558fa3d0ae3a60104e7ddc1294d1059b8826bc1544d9c949e84296","observation_id":"db41bc28-2948-473d-96b4-28dfbdace6cf","resolution":{"observed_at":"2026-08-01T10:23:16.413313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08558","last_updated":"2025-06-20T05:51:24Z","snapshot_observed_at":"2026-08-08T21:27:43.811611Z","submitted_at":"2025-03-11T15:47:12Z","title":"Can We Detect Failures Without Failure Data? Uncertainty-Aware Runtime Failure Detection for Imitation Learning Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08558","snapshot_observed_at":"2026-08-01T10:23:16.470353Z","title":"Can we detect failures without failure data? uncertainty-aware runtime failure detection for imitation learning policies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:16.470353Z"},"links":{"cited_paper":"/paper/2503.08558","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:423e6e546cddb83114428f84b54453ebaf9381591bbc2614df70e0a2beb1e99d","observation_id":"e11dd19a-af92-43ff-9f1f-d7154a4e67ac","resolution":{"observed_at":"2026-08-01T10:23:16.470353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18676","last_updated":"2025-02-10T16:32:27Z","snapshot_observed_at":"2026-07-06T19:58:13.816588Z","submitted_at":"2024-11-27T18:57:26Z","title":"Embodied Red Teaming for Auditing Robotic Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18676","snapshot_observed_at":"2026-08-01T10:23:16.532893Z","title":"Embodied red teaming for auditing robotic foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:16.532893Z"},"links":{"cited_paper":"/paper/2411.18676","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:a503706c379ef66e103c22005e67a2801bf1b44dfb28077157c111200a3af7a2","observation_id":"91018a86-7d02-4932-b3bb-b735a798e16a","resolution":{"observed_at":"2026-08-01T10:23:16.532893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:16.592086Z","title":"OGBench: Bench- marking offline goal-conditioned RL,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:16.592086Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:f1cf29777ecdeba36595a1c6a84cab12af84942473fa2041f26cf42844e63336","observation_id":"7a205f8a-8c8e-49f5-8f28-71951d52cc3e","resolution":{"observed_at":"2026-08-01T10:23:16.592086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:16.999044Z","title":"Continued on next page 19 TABLE IX LANGUAGEINSTRUCTIONSREPHRASES(CONTINUED FROM PREVIOUS PAGE)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:16.999044Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:0f9e38b4f24218fb278c4e58466a2d5cb4ea6fee74ac3ba0b720fab32bff73c9","observation_id":"d2dbeff4-8c9f-42e8-b956-28d37b90d3c0","resolution":{"observed_at":"2026-08-01T10:23:16.999044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:17.062377Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:17.062377Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:357233bc76d0695866f3ed57d33c50fe1f16f0f346caf2046e1bc6d5222166a9","observation_id":"026edf7b-258d-40e9-8722-7120c0b36a6b","resolution":{"observed_at":"2026-08-01T10:23:17.062377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:17.563954Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:17.563954Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:16cde39425fecd9987a699ef031fb0ceb634a7eab2e391afd95ef777d4b699da","observation_id":"f6b92b59-37dc-49da-a6b5-b232d7eb6bc0","resolution":{"observed_at":"2026-08-01T10:23:17.563954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:17.663291Z","title":"Stack Cubes (SIMPLER) Stack the green block on the yellow block","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:17.663291Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:500141f75ee1b285e5ba4c19aed1ff9c30ed2604baf908e386e4a10df1301410","observation_id":"45411861-9b51-4343-a6f9-cde6954eff54","resolution":{"observed_at":"2026-08-01T10:23:17.663291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:17.714772Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:17.714772Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:fb2d3edb7e396fc7ca23e6056ad0469d30946ded4232930ef6a3b8f77a39d048","observation_id":"c021fd19-f3bb-4de4-a0eb-a1a77647b544","resolution":{"observed_at":"2026-08-01T10:23:17.714772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:17.790917Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:17.790917Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:d8744f203fa6b8e97d3b1399ef172257c2e754a637f5d240fa7d84fb14b95ff5","observation_id":"5e812c8c-c2c4-4228-b429-2d679a8c61cc","resolution":{"observed_at":"2026-08-01T10:23:17.790917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:17.832452Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:17.832452Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:735972a53e3bbd30154acbada434ef991cda58ce638ed7c19a9afd19c52f7063","observation_id":"d744e415-e37c-4d53-a231-083d660a245d","resolution":{"observed_at":"2026-08-01T10:23:17.832452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:17.883906Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:17.883906Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:2f5de53406f25b2deffb3a53a278669451cb139144727ea5ee3272d7d328f133","observation_id":"340745dd-6b87-4076-846a-86dbed13ca33","resolution":{"observed_at":"2026-08-01T10:23:17.883906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.006692Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.006692Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:91906b37c4e0e1a3572c5fd0dbcdad9a64ffde5048e6d7f20bf0e950b33f4f67","observation_id":"96791625-f56a-4aab-86b3-a53a3fb9c428","resolution":{"observed_at":"2026-08-01T10:23:18.006692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.062391Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.062391Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:b6063e75e6b7c65f6be0ef4467b1dafafd8a8d9ffdbb149c50cfa953b0b6bb1a","observation_id":"e3d16601-ffe9-4f26-a867-ba93653ee71c","resolution":{"observed_at":"2026-08-01T10:23:18.062391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.114528Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.114528Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:6078c276b2b2c8550cf221020067b9ef87c5b06d8a8fe04931c8f95e0366d9b8","observation_id":"dbb14d00-bb74-4292-8da7-2ddca360b88f","resolution":{"observed_at":"2026-08-01T10:23:18.114528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.177799Z","title":"Eggplant in Basket (SIMPLER) Put eggplant into yellow basket","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.177799Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:4f48bb8c2871b976ad3f26d9a559a98477578ec86346a65f37f770d12b254001","observation_id":"09eadde3-4cba-42b9-8c72-cd68485f434e","resolution":{"observed_at":"2026-08-01T10:23:18.177799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.215730Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.215730Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:b8234ab7af578dad8820e0d0e1939dfcb3f65618337922b32e5c9f00f1a844b5","observation_id":"de19a3b3-4078-461b-b257-ef3db3377a7f","resolution":{"observed_at":"2026-08-01T10:23:18.215730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.265103Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.265103Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:1e8ee2d59702e1c1fe58978369688690c37dcf7df21aa0c1f884189be9e61b10","observation_id":"251c7197-76db-4895-bfe0-687fcfabc634","resolution":{"observed_at":"2026-08-01T10:23:18.265103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.320046Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.320046Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:d77980002ae213e1b2afd866fd8edc60aa65c8de17a01f9c7930bec790d904a5","observation_id":"ccbfe763-d46a-4b59-b8fa-8ed50fa9ee1b","resolution":{"observed_at":"2026-08-01T10:23:18.320046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.379107Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.379107Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:866ffece8e5e8cdb8f56de5158c18018fd48cac58cc5018f9245098fc61e1f96","observation_id":"ece91bfd-5463-428d-b280-941636eef344","resolution":{"observed_at":"2026-08-01T10:23:18.379107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.491832Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.491832Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:23e2d6a3c702fd9077531a8f9312422e3eecb11d08c5df3f6076030ffcf7da02","observation_id":"93acb861-1793-4ce8-b8b5-3e8edf90d965","resolution":{"observed_at":"2026-08-01T10:23:18.491832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.557785Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.557785Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:7c1a25d4f07434631a5b33b766d2341c829f1d40195041da85fbb1315b77f7ca","observation_id":"da656ec7-3130-46b8-af68-7d4987e894cc","resolution":{"observed_at":"2026-08-01T10:23:18.557785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.620792Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.620792Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:35d5c97b1ececda266f504a7803b122520dbacc16e77a9784b2c0bb4c525c51c","observation_id":"336407d0-f3ab-40a5-829c-d3a32284c279","resolution":{"observed_at":"2026-08-01T10:23:18.620792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.703396Z","title":"Orange Juice on Plate (SIMPLER) Put orange juice on plate","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.703396Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:7521fa47e06468094315063d52c65e95cedb3c5ff4d4058839a5e8122982fdec","observation_id":"12d63119-9cd6-45ae-9273-7b456e3d8ee8","resolution":{"observed_at":"2026-08-01T10:23:18.703396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.770604Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.770604Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:32df5e4ffb32b1ad84c55320aba3bd6769786f8aa482e077a7e420b65afd8645","observation_id":"c119ea1b-4265-4b6f-a906-3c3ecbac3609","resolution":{"observed_at":"2026-08-01T10:23:18.770604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.846143Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.846143Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:59442bdc969ddd099d56f4e2ff4a22fff75a0feb3815d4e520b2a28f6b6a01a8","observation_id":"30e1990a-4a3f-412d-9540-f0ad7fc2b75b","resolution":{"observed_at":"2026-08-01T10:23:18.846143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:18.966008Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:18.966008Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:a54880983d571163615e72674eabc5c4dc85298bcfdb3431dcc0ae5c31b858d3","observation_id":"3b4b4133-1b74-4486-add6-8745382d1259","resolution":{"observed_at":"2026-08-01T10:23:18.966008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:19.112850Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:19.112850Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:223bd5aea392b993c2c4caf99214d027643a52d1206452bdc528e1ae674b143f","observation_id":"dcba702e-68cb-45d5-9240-cd6f422fcd53","resolution":{"observed_at":"2026-08-01T10:23:19.112850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:19.237382Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:19.237382Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:0f73f5b0ae70479c2c0c0c7d1ea42bbd80bcef82d916000e4b77d49f8a13a8ea","observation_id":"9cffd2b4-7922-421c-a1d2-d5c597ee76a2","resolution":{"observed_at":"2026-08-01T10:23:19.237382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:19.364076Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:19.364076Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:8c85ff0de565c941dbcb8b08e10fb6c6010e4b5c9335bd2f4cfab6c3cbb310c3","observation_id":"5aaf8e5a-841b-442b-a691-9867f3f3e6b5","resolution":{"observed_at":"2026-08-01T10:23:19.364076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:19.492236Z","title":"Spoon on Towel (Google) (SIMPLER) Put the spoon on the towel google","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:19.492236Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:956e1f3323f2e64c2923cfe901ab1187af6a8c978d55dba3b60211dc44ae21d0","observation_id":"b14d1703-9284-4db9-bee8-c494cac8088a","resolution":{"observed_at":"2026-08-01T10:23:19.492236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:19.634507Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:19.634507Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:6ea8c4b5ae55b497ea1899879e557850086fdb579aa9ed9c8c29f06008c1c86f","observation_id":"67103780-10d5-4295-b42b-d11ff9fea364","resolution":{"observed_at":"2026-08-01T10:23:19.634507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:19.750758Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:19.750758Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:5522ed2ffd39dcf116d17aa1cedae3ecc9614b8d395a57203da5f45d3671fa68","observation_id":"e5cd675b-401c-49c4-9be4-27cfed98acee","resolution":{"observed_at":"2026-08-01T10:23:19.750758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:19.866588Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:19.866588Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:c4681603d6086a03ad37be25002b8f6914098d970e36ea97e07043e8d1f37ef1","observation_id":"fe83d52c-3d7f-4254-b59b-110d713abff7","resolution":{"observed_at":"2026-08-01T10:23:19.866588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:19.981726Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:19.981726Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:0d6c451c689aaac5b5a52bc6aefb23171ba50b368e8af1fb8535add7a79bd120","observation_id":"f15bb228-0af1-43d9-b64a-5a8ad9b20e04","resolution":{"observed_at":"2026-08-01T10:23:19.981726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:20.096440Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:20.096440Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:3eca4cceaf24c8215c4d64cb143062ba934aebcdb93d43ea1fc10cbb3690f2cb","observation_id":"689f1b12-2129-48dd-b2f4-13043c28555d","resolution":{"observed_at":"2026-08-01T10:23:20.096440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:20.208506Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:20.208506Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:4eb9977e9f42833e046cb17669b61cec11002452f1ccdb0cc38a9d9a03d48fc0","observation_id":"0ce87732-d2b6-4e4c-b9d4-2c4fdd4cabfd","resolution":{"observed_at":"2026-08-01T10:23:20.208506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:20.317398Z","title":"Toy Dinosaur on Towel (SIMPLER) Put the toy dinosaur on the towel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:20.317398Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:31a8a139435aab8696da2282260553dc125faa9e86202495b31ebb8edf8665c0","observation_id":"db9ccfa6-c986-4ad8-9d71-aaeda05f7b7c","resolution":{"observed_at":"2026-08-01T10:23:20.317398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:20.423981Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:20.423981Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:afe31942c9d8d8e017907f899b1c5f4c49c9509369eb74b8d5e7ed14dbfa7553","observation_id":"5c2a3019-eebc-4e34-9ab2-2248e377e9f2","resolution":{"observed_at":"2026-08-01T10:23:20.423981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:20.544621Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:20.544621Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:0d9a8385fc19461ae95975ee1e5fc4cbfd07320ba0b44fb3be865e4d7200703a","observation_id":"afd4d84e-624d-4ae2-949d-5641c0589eb4","resolution":{"observed_at":"2026-08-01T10:23:20.544621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:20.641990Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:20.641990Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:c0d44505f75152890220b0303e52708f0172ef4502f406d4f317bbb4d7108d6c","observation_id":"556990df-6497-4b66-8464-02efe9743cbf","resolution":{"observed_at":"2026-08-01T10:23:20.641990Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:20.740790Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:20.740790Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:f0f745066ca52d640d913b03296eb9ccaffa2ec760fcdcfadbb39f2d6a2f21f0","observation_id":"c27ff3ce-bda0-401f-b4ae-00c757c906fc","resolution":{"observed_at":"2026-08-01T10:23:20.740790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:20.861030Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:20.861030Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:51514b8fa3927c80274bb16cfb9d2031da93c2f32afe64335c138efff55cfcde","observation_id":"3b853103-2b3f-4851-8dd6-a2118daabed7","resolution":{"observed_at":"2026-08-01T10:23:20.861030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:20.957873Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:20.957873Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:f130f8e300e5e65f9e873895ff3a361eb267497d87a3f528c1ea614b9f0d0f41","observation_id":"2f8aa4f4-b613-4a73-9e41-52ca58737958","resolution":{"observed_at":"2026-08-01T10:23:20.957873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:21.086090Z","title":"Tape Measure in Basket (SIMPLER) Put tape measure into yellow basket","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:21.086090Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:4afe2bd76128d9a768394c4f4c7cfe219b70b1c85f0be4d989687ad4c7db3212","observation_id":"e918508e-e656-4fd3-8317-7f6b588feb5d","resolution":{"observed_at":"2026-08-01T10:23:21.086090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:21.194399Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:21.194399Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:6e816150dd0c225dfc18df2269940d5841976b735387983d47fad3cef40583fa","observation_id":"5b740f6e-b5be-4340-bec9-b2e00cd79562","resolution":{"observed_at":"2026-08-01T10:23:21.194399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:21.313613Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:21.313613Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:2d6380078d0b38552dc5b043a2717f89bb86d16cdfc4dde6ac4e356f6ec22bc5","observation_id":"d91999a3-4c2c-4441-a83d-2b9a2f98eac1","resolution":{"observed_at":"2026-08-01T10:23:21.313613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:21.415872Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:21.415872Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:7082db99f6cf072a3ddadb3b782cfdb788faf004571e13d14f38efe78b9f7914","observation_id":"894f4e51-9769-498d-991d-f0ee9ece1658","resolution":{"observed_at":"2026-08-01T10:23:21.415872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:21.532286Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:21.532286Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:ae317bd5aa4fdfe7f727a1ebb6ca3544dde1f9805aebaf33b86b909c2f84dd02","observation_id":"8f498697-bf6c-4e24-a324-537fea6c667e","resolution":{"observed_at":"2026-08-01T10:23:21.532286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:21.619286Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:21.619286Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:d95dc50594f67806a4a36ded2d935052f675e83a7103f9b6f9ea6f4200fe1de1","observation_id":"e60a3612-4ade-4d71-8513-ee29ff76ce5a","resolution":{"observed_at":"2026-08-01T10:23:21.619286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:21.709015Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:21.709015Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:440c5e447f3661635ff4d43d176e3c8893f697c7106eda29b0b30635e8bed1e6","observation_id":"134b3c02-dcf8-449b-8a99-204868406b84","resolution":{"observed_at":"2026-08-01T10:23:21.709015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:21.815758Z","title":"Continued on next page 20 TABLE IX LANGUAGEINSTRUCTIONSREPHRASES(CONTINUED FROM PREVIOUS PAGE)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:21.815758Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:cc3c80f5845f55f503491b8a1bbf970fd6a3ce10e3b00942ce8e71718ecd9089","observation_id":"d2008f78-3d6e-4ce5-803a-1630c93436bc","resolution":{"observed_at":"2026-08-01T10:23:21.815758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:21.924963Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:21.924963Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:da852d5230263feac51cb748e5fdeeafa2bfa61d660926a4ad3aac0c8af8a256","observation_id":"c0924578-ab81-4222-9e3a-3769765beaff","resolution":{"observed_at":"2026-08-01T10:23:21.924963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:22.008419Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:22.008419Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:a262c5b4b973313bd90c7f56cff4d83dbad3953fdc9c9598a37c08081397226a","observation_id":"09340f14-c14f-4457-bdb8-a8de0257143f","resolution":{"observed_at":"2026-08-01T10:23:22.008419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:22.085585Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:22.085585Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:8e4998d1e38be37578ee9ae7bfcdb0f6a3784b69eb06e110f33e419e64d3bf79","observation_id":"f3c67ee5-eee2-4102-9c9b-aa4f34e1e5fd","resolution":{"observed_at":"2026-08-01T10:23:22.085585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:22.177392Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:22.177392Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:31a3f2a214adedd515a50d3f82e52a33353915116a9c79105f12203b3c30f471","observation_id":"07ca74ee-b0cb-4f52-b187-cf596fbf824a","resolution":{"observed_at":"2026-08-01T10:23:22.177392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:22.277613Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:22.277613Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:5361c9cadd3e773cbd753c3ad834e5015bef4ebd4c0704c037ab2e516e23b0f2","observation_id":"3b49baf8-ed4c-4aa8-9f62-c97c0c3eaadf","resolution":{"observed_at":"2026-08-01T10:23:22.277613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:22.343463Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:22.343463Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:d442d43ef6a05365c8d52e55f132b94feea81fea4b3c390d2895133781b95879","observation_id":"d9e1b330-b07e-4385-891e-5f0a08ca0485","resolution":{"observed_at":"2026-08-01T10:23:22.343463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:22.408398Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:22.408398Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:225feb443a08d346bde1a9d34a673c4d62c55c1bea7bb7adaa02e574cd7837ba","observation_id":"ec4741ae-3599-4fff-8f48-288bb6d39bdb","resolution":{"observed_at":"2026-08-01T10:23:22.408398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:22.478879Z","title":"Tape into Container (PolaRiS) Put the tape into the container","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:22.478879Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:1ed61e17d7a99b7cef56fa7cb8f1d02ae7b20e8764f0f28f3814c91abea71b4e","observation_id":"337717c4-b7d0-4876-901e-cbefe32beefd","resolution":{"observed_at":"2026-08-01T10:23:22.478879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:23:22.546415Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:22.546415Z"},"links":{"citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:c4adb9893e732f0f0eda344b71eb6b3e787c124c530d0781155f9221eb0bb91e","observation_id":"de0e8dc0-be9b-4958-9979-f741e8493580","resolution":{"observed_at":"2026-08-01T10:23:22.546415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":145},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 145 outbound references and 0 inbound Pith citation observations for arXiv:2607.26991."}