{"as_of":"2026-08-13T10:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1aa73f00f22b6bcf02e20d389718e34b2e03687cc145800e72dafc67b92495e","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:34:33.493545Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14635/citation-record","integrity":"/paper/2607.14635/integrity","json":"/paper/2607.14635/citation-record.json","paper":"/paper/2607.14635"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:29.433041Z","title":"RT-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:29.433041Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:d038163bfa32a596c044ec9a57c67ebd419f9938c618485979e47f2645b72513","observation_id":"168c138b-5b28-48a2-9e18-51b61348cba2","resolution":{"observed_at":"2026-08-02T01:34:29.433041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:29.498298Z","title":"OpenVLA: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:29.498298Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:c22afd6b6e491e0a738fd6a4c1be7adc0c39a36f69fe54d8a4bcdb0620d540ff","observation_id":"9d41ccb1-28fa-4344-8721-eb0f3c1270f8","resolution":{"observed_at":"2026-08-02T01:34:29.498298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T01:34:29.563364Z","title":"π 0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:29.563364Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:b979e88f50d40c7df28d6ade31d5cd391e8f652edad228ce901e0eaf5f642426","observation_id":"f4340d76-8cb1-40bd-9926-c82e604cc9ac","resolution":{"observed_at":"2026-08-02T01:34:29.563364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:29.631505Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:29.631505Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:c82332da252d7afe50c96111dc89d4606974ac73bccf6111e6febb1db60dbca2","observation_id":"15d08ad3-b1d1-4906-bbc5-4ace3c238c75","resolution":{"observed_at":"2026-08-02T01:34:29.631505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:29.689972Z","title":"π 0.5: A vision-language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:29.689972Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:1eb74f479ebdedb8406732dd6a1ae0a9653860f2b31487e451a2efb7223f8799","observation_id":"7b41b2c2-a51e-4c51-959b-28a852d27df9","resolution":{"observed_at":"2026-08-02T01:34:29.689972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-02T01:34:29.776432Z","title":"FAST: Efficient action tokenization for vision- language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:29.776432Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:a3a3dab91affe63bb7b46436abd80395bf15631ef20d7267977e686d1988d42e","observation_id":"05b9df07-540b-435f-9d44-3ad02a2d2a90","resolution":{"observed_at":"2026-08-02T01:34:29.776432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:29.861393Z","title":"VQ-VLA: Improving vision-language-action models via scaling vector-quantized action tokenizers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:29.861393Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:cf19627b8bee1ddee1c26d07c93cf77784fd8049b620c0f26cdceb64c1f0032a","observation_id":"77c6d70d-6cb4-45f1-ba0e-04c1d9600072","resolution":{"observed_at":"2026-08-02T01:34:29.861393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:29.942388Z","title":"Latent action pretraining from videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:29.942388Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:22aa8bb16adb88d630088408dfd3293723edf791132823644ef2f1e4e8d261c6","observation_id":"b1533588-0a9b-4320-a324-d7079b8c57bb","resolution":{"observed_at":"2026-08-02T01:34:29.942388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:30.060679Z","title":"Learning to act anywhere with task-centric latent actions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:30.060679Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:12564ede441c8cfb2cf70fa393c1770ea3a55a5f60acfbe8ab7150968979993e","observation_id":"476587b7-83dd-4d1d-9db3-723908f040ae","resolution":{"observed_at":"2026-08-02T01:34:30.060679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13403","last_updated":"2026-05-13T11:58:02Z","snapshot_observed_at":"2026-08-13T07:25:04.882256Z","submitted_at":"2026-05-13T11:58:02Z","title":"RotVLA: Rotational Latent Action for Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13403","snapshot_observed_at":"2026-08-02T01:34:30.181563Z","title":"RotVLA: Rotational latent action for vision-language- action models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:30.181563Z"},"links":{"cited_paper":"/paper/2605.13403","citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:9d685ceba9e45a300046c9ff8c5b76a67d4047cf8dc6a34a9a671b3f56e5fb69","observation_id":"b3014be4-9765-487d-8d81-2ee225112ea3","resolution":{"observed_at":"2026-08-02T01:34:30.181563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:30.319349Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:30.319349Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:ba3873e4c2f23c31b04e8c868e922508b2d5ae2bceb13a7747ab5121b1584b6b","observation_id":"ef5d9e8a-f341-4bfa-91ca-2e9dbd3a5b62","resolution":{"observed_at":"2026-08-02T01:34:30.319349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:30.461696Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:30.461696Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:2619213b5034e895f2814802a18d1f2c221d5a02d133f798a3e0a331991269a0","observation_id":"2a7b6a1c-7f0c-4f82-805e-08098bf12975","resolution":{"observed_at":"2026-08-02T01:34:30.461696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:30.599740Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:30.599740Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:5762b1c83c1bd661eed281468d32f664b6ddcb41d1cd93081d1e7c395788dea7","observation_id":"0e83d065-144b-446d-aecb-f7e79013b687","resolution":{"observed_at":"2026-08-02T01:34:30.599740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:30.685381Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:30.685381Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:ecb7937637b3aae2838edea8301d15f1ae2c2c3999d9f95afdb877f61b886e7c","observation_id":"e9de61cc-a106-44b7-9630-e6e93b987c5e","resolution":{"observed_at":"2026-08-02T01:34:30.685381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:30.777303Z","title":"Perceiver: General perception with iterative attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:30.777303Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:7b75f1a46ac83022ab33c193d8c78a9fca7f1e57be64dc7c480efe9e0f582d19","observation_id":"ed05aa5d-8654-43c9-8fe2-d5c4f95ef435","resolution":{"observed_at":"2026-08-02T01:34:30.777303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:30.870154Z","title":"Flamingo: A visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:30.870154Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:d46d729cb755dc1e57bcdf509f5ca282662b03614f9d38eb9123388c6c315d14","observation_id":"d7716786-d9b1-4637-94f3-fc2a37d4d9fe","resolution":{"observed_at":"2026-08-02T01:34:30.870154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:30.960688Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:30.960688Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:29b1b7f89c6788f6faf9de15a02c58e1bdac438c4c103902c8fef26eb408311a","observation_id":"923415a7-9bd2-49a4-88fe-a6d3bd47c635","resolution":{"observed_at":"2026-08-02T01:34:30.960688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:31.053667Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:31.053667Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:c09c1c1c8f1b7dacbd4cc07d9b37e4bcc693c09194f5cc0f1f24827d0edd9e32","observation_id":"1c49c74d-9986-4f96-b0a7-db0f3047c11a","resolution":{"observed_at":"2026-08-02T01:34:31.053667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10485","last_updated":"2026-05-11T12:44:26Z","snapshot_observed_at":"2026-08-11T10:15:45.506833Z","submitted_at":"2026-05-11T12:44:26Z","title":"VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10485","snapshot_observed_at":"2026-08-02T01:34:31.166730Z","title":"VEGA: Visual encoder grounding alignment for spatially-aware vision-language-action models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:31.166730Z"},"links":{"cited_paper":"/paper/2605.10485","citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:b7631b2d9da5e46b075dd8a4509cf10fce3a384d2e9f57d301910be416cf170e","observation_id":"9637b991-567d-4564-8175-23d732540a7d","resolution":{"observed_at":"2026-08-02T01:34:31.166730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30350","last_updated":"2026-05-28T17:59:53Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:59:53Z","title":"DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30350","snapshot_observed_at":"2026-08-02T01:34:31.269443Z","title":"DynaFLIP: Rethinking robotics perception via tri-modal- dynamics guided representation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:31.269443Z"},"links":{"cited_paper":"/paper/2605.30350","citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:9c66345205bb32e5935ee01e9cb30061db0a8da1dd4fc07454a8a36de56e4d1e","observation_id":"ead814d6-4973-4ae1-9688-f1eda41eb078","resolution":{"observed_at":"2026-08-02T01:34:31.269443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31234","last_updated":"2026-05-29T12:36:30Z","snapshot_observed_at":"2026-08-08T12:01:24.894800Z","submitted_at":"2026-05-29T12:36:30Z","title":"HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.31234","snapshot_observed_at":"2026-08-02T01:34:31.334140Z","title":"HARP-VLA: Human-robot aligned representation learn- ing for vision-language-action model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:31.334140Z"},"links":{"cited_paper":"/paper/2605.31234","citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:49c150d9401b9332a2d2946ec77df903af96f0239a5a3b32d98dd7d67d15fea4","observation_id":"074e1e22-2d11-4cd4-b40b-49822b0b9199","resolution":{"observed_at":"2026-08-02T01:34:31.334140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.07100","last_updated":"2026-06-30T09:11:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T09:51:25Z","title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.07100","snapshot_observed_at":"2026-08-02T01:34:31.411913Z","title":"LARA: Latent action representation alignment for vision- language-action models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:31.411913Z"},"links":{"cited_paper":"/paper/2606.07100","citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:3f032fcc34a47a7e6a481fc78cd9422d54a5e9aedc54ba4be0f9bc9d3eddb960","observation_id":"0bcd7638-d956-4d7a-9b0c-18e40d3d4ef2","resolution":{"observed_at":"2026-08-02T01:34:31.411913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.12217","last_updated":"2026-06-10T15:31:25Z","snapshot_observed_at":"2026-08-13T02:16:08.998426Z","submitted_at":"2026-06-10T15:31:25Z","title":"Making Foresight Actionable: Repurposing Representation Alignment in World Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.12217","snapshot_observed_at":"2026-08-02T01:34:31.476784Z","title":"Making foresight actionable: Repurposing representation alignment in world action models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:31.476784Z"},"links":{"cited_paper":"/paper/2606.12217","citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:0e06ce07eb7c3e217c2336abb9c7a6fc9cce7fc8250bb2da4ec60fbb97bd987b","observation_id":"56aa65d7-e7da-4bf5-a083-24c74d54eef3","resolution":{"observed_at":"2026-08-02T01:34:31.476784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:31.541114Z","title":"A formal basis for the heuristic determination of minimum cost paths,","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:31.541114Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:887336c882aa93c02661ef756bfbcb7bdfdc48bf69f7e8b0a588f15503809fd4","observation_id":"8a87a132-008f-48dd-9d21-a3f5767226a7","resolution":{"observed_at":"2026-08-02T01:34:31.541114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:31.602905Z","title":"The dynamic window approach to collision avoidance,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:31.602905Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:66b73939712a04a71603dfd881f5b9f6844c407c8e3a6a999a4a01743271ecb3","observation_id":"9cec96d1-84a1-4269-8b49-73017f76d0ec","resolution":{"observed_at":"2026-08-02T01:34:31.602905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:31.688754Z","title":"ViKiNG: Vision-based kilometer-scale navigation with geographic hints,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:31.688754Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:3ca44cd8c07b59d1114a5750e1a3755207aa72840252907c701347048746aa40","observation_id":"7acdcb17-7df6-4517-bd60-2c2202c9e3e3","resolution":{"observed_at":"2026-08-02T01:34:31.688754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:31.745987Z","title":"GNM: A general navigation model to drive any robot,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:31.745987Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:eb7d9710fbcbb9b693d2bb339f74c2ac94a1dffd7a8cecc7e7b2b37c9f872dcd","observation_id":"45b6e0e3-aa74-46fc-a565-6864dce056a6","resolution":{"observed_at":"2026-08-02T01:34:31.745987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:31.799338Z","title":"ViNT: A foundation model for visual navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:31.799338Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:42c6a9a75c4ce0231d4964c6fbc62cbac5879b7805f76154dfb6c7616453a333","observation_id":"60b2c79c-6854-4342-9f7e-59017e491a0f","resolution":{"observed_at":"2026-08-02T01:34:31.799338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07896","last_updated":"2023-10-11T21:07:14Z","snapshot_observed_at":"2026-08-13T05:51:45.791521Z","submitted_at":"2023-10-11T21:07:14Z","title":"NoMaD: Goal Masked Diffusion Policies for Navigation and Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07896","snapshot_observed_at":"2026-08-02T01:34:31.849984Z","title":"NoMaD: Goal masked diffusion policies for naviga- tion and exploration,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:31.849984Z"},"links":{"cited_paper":"/paper/2310.07896","citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:5a2c6c97628612a32a4763a6f9ade1a1f52975fbd8e3e70e9837d4eb8d2cbfde","observation_id":"3a20c86d-0c4d-4318-afe6-1498b8d62cc5","resolution":{"observed_at":"2026-08-02T01:34:31.849984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:31.928705Z","title":"LM-Nav: Robotic navigation with large pre-trained models of language, vision, and action,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:31.928705Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:c4e145176e3c2f943ea00874b0968d911acfe3331b7a703072259fab9a1c3087","observation_id":"c0e19cde-c6eb-4aca-8ce8-022e72b98cc1","resolution":{"observed_at":"2026-08-02T01:34:31.928705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:31.989633Z","title":"NaVid: Video-based vlm plans the next step for vision- and-language navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:31.989633Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:09e4d07420f911491a0c4e58321d9a318f49a4f351e50a3d338a234771aa708a","observation_id":"c3517109-29f0-42f2-8a4e-e7f4e012a460","resolution":{"observed_at":"2026-08-02T01:34:31.989633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:32.050463Z","title":"Uni-NaVid: A video-based vision-language-action model for unifying embodied navigation tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:32.050463Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:2824bc77581410da86cca5bcda55812a8352cd7a31be7635c3b49013d2c9e6fa","observation_id":"641a3b0e-511b-44fb-a13e-ee9f7b980fa6","resolution":{"observed_at":"2026-08-02T01:34:32.050463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:32.102790Z","title":"Embodied navigation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:32.102790Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:8809c6f5e1153fa53b9e901259ab55a0cdb7c2b0fa416abd973fa4b6364912d2","observation_id":"a8c0ee6e-9933-4b35-9cf4-7dee1f335325","resolution":{"observed_at":"2026-08-02T01:34:32.102790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:32.173003Z","title":"Navigation world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:32.173003Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:d1bdb97c0e6744851abaea4a39317cc4ab764046dd97dee52f3d813f1b4f2257","observation_id":"d593800d-480f-4f4d-b9fd-8912113eed2b","resolution":{"observed_at":"2026-08-02T01:34:32.173003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:32.225527Z","title":"Habitat: A platform for embodied ai research,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:32.225527Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:3ba6803b47e2f24dc53d118466ed336d6c0fd8f32f5001655bab9ac31e313ddd","observation_id":"42860d4a-8a13-45c9-adb6-3eccb20c7d28","resolution":{"observed_at":"2026-08-02T01:34:32.225527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:32.327882Z","title":"ObjectNav revisited: On evaluation of embodied agents navigating to objects,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:32.327882Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:ddd71987b707baf45100e31760f079650fc4d2f748123fcb97c45549ba413853","observation_id":"5ed974af-8670-469b-bac0-d40b8af23c2b","resolution":{"observed_at":"2026-08-02T01:34:32.327882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:32.403060Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:32.403060Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:e5a24a3d1b23efc9fcfc31f97329e245e2dcecc84f5e64608a8e56a4e547f451","observation_id":"4d62678d-e558-41a8-b12a-c0ee58e35ac4","resolution":{"observed_at":"2026-08-02T01:34:32.403060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:32.482082Z","title":"In the main training setup, this parsing uses thespecial-token branchexclusively","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:32.482082Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:db70d3c758c0c6d69f3f904172d51b9c93bff64be06b1d7a1bbb30f2f750cc37","observation_id":"10b45c3a-54d0-4c01-9a52-5529cd98d10e","resolution":{"observed_at":"2026-08-02T01:34:32.482082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:32.565185Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:32.565185Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:d399aa094bcb4ab2766f8565420607ca87c8db58b25e99fb449d7d6837a55e79","observation_id":"308a49be-7698-4501-bf4d-2d46507a8aa4","resolution":{"observed_at":"2026-08-02T01:34:32.565185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:32.642066Z","title":"make a left turn","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:32.642066Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:5f249b4d7611175e9fc70f984a109967050876eb4ca65b82bf352a8f8ab65baa","observation_id":"cd1d99b8-d009-4994-9894-fb5cacfddc32","resolution":{"observed_at":"2026-08-02T01:34:32.642066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:32.746572Z","title":"Thedirect-fusion baselineuses the minimal shared-context interface described in Sec","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:32.746572Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:e34587bdee34a39c3ad1ac97bde2f394105459f4dbb44dfcfe64e253dbbb222c","observation_id":"49c84480-0031-416f-b8f9-295d3eb852dc","resolution":{"observed_at":"2026-08-02T01:34:32.746572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:32.820960Z","title":"These set- tings differ in which parts of the inherited multimodal pathway are exposed to action-loss gradients","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:32.820960Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:12482b2e330e66fa523a547182fc8dc8c27ef79923ac58051709238face5155f","observation_id":"c118e976-ecdd-4dfc-83a7-1c27e862da10","resolution":{"observed_at":"2026-08-02T01:34:32.820960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:32.876278Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:32.876278Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:f9f6869fd1fa4328f9996fc20db4ee3532920f3b594deb344c7d37a718ce239e","observation_id":"7554865d-e876-417b-9474-1fda0ca23fbb","resolution":{"observed_at":"2026-08-02T01:34:32.876278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:32.984898Z","title":"Token-wise rewriting and rewriting-subspace analyses examine how strongly the inherited pathway is rewritten and whether that rewriting is broad or targeted","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:32.984898Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:831fffce66b3f3c5967f86b4b2973a12ed9ea1a138e0674e2921f2b7323892e7","observation_id":"520758be-a9a1-48c8-bd17-3eb81162391c","resolution":{"observed_at":"2026-08-02T01:34:32.984898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:33.064517Z","title":"These statistics are supporting measurements: they are not intended to replace the token-level visualizations in Sec","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:33.064517Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:7cce53401f1eda4bf048a0590ac81edf48d32cc6380cd287a69dbcb8eda239c0","observation_id":"1fc04309-d7d6-4a5f-ab9e-e3044dfd14de","resolution":{"observed_at":"2026-08-02T01:34:33.064517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:33.108432Z","title":"We partition tokens into boundary, control, spatial, and other groups, and report each group’s share of the total rewriting budget in Table VIII","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:33.108432Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:91b35ce4e832aedcd1cfeb04dc6246f2f6d30373b20a882c4e2849007ff667a2","observation_id":"1f877ce6-2ddb-4ece-971e-ff9a85ac6098","resolution":{"observed_at":"2026-08-02T01:34:33.108432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:33.159920Z","title":"We next ask whether this selectivity is also reflected in how rewritten dimensions are organized","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:33.159920Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:8154f772e2f81bf29d3df6b38183d1ca9347c703cfba8b753ff43bddd9995533","observation_id":"5a284d3e-0b81-4b44-bc9d-dee06831325f","resolution":{"observed_at":"2026-08-02T01:34:33.159920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:33.236218Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:33.236218Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:dc333e94515c07ca9a004499135fd42455ca8e1f359b76c9346503e3665fa1d2","observation_id":"e3a8b086-09c5-4be3-ad73-9e8c228cfc88","resolution":{"observed_at":"2026-08-02T01:34:33.236218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:33.281574Z","title":"These statistics provide additional views of how closely an action-loss-exposed atten- tion map remains aligned with its action-update-blocked refer- ence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:33.281574Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:e213d351de4f3c8e21825f0e8b835323225944664492958d7289b2f2404e1ba7","observation_id":"71385eb9-5416-4727-a888-a2b4a0614e02","resolution":{"observed_at":"2026-08-02T01:34:33.281574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:33.348531Z","title":"18 provides complementary distributional views of attention stability across the full set of phrase-level comparisons","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:33.348531Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:fe644dce292e35e98941dbcd372da4c13ba6eb92ede7b52e83ffc292a02940a4","observation_id":"6701a273-65d1-432f-8b5c-3b6f98e49d3a","resolution":{"observed_at":"2026-08-02T01:34:33.348531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:33.434174Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:33.434174Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:33a44c1c47e47e76b833864476015132d3b081c96eb6cb0383eca7adbc9ae584","observation_id":"c6967e63-079c-47b5-b8e4-eb3ea5aecc2d","resolution":{"observed_at":"2026-08-02T01:34:33.434174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:34:33.493545Z","title":"20 shows that the all-head average can hide substantial head-level heterogeneity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T01:34:33.493545Z"},"links":{"citing_paper":"/paper/2607.14635"},"observation_digest":"sha256:4e7853047ae930dd40efcd6401921e06bf879285f90a8e99891f992bb2ae8c1b","observation_id":"d4f04fbf-6567-4331-8616-3e12c1f68dd2","resolution":{"observed_at":"2026-08-02T01:34:33.493545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14635","last_updated":"2026-07-16T06:59:39Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T08:36:34.058460Z","submitted_at":"2026-07-16T06:59:39Z","title":"Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2607.14635."}