{"as_of":"2026-08-15T01:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fdc20bdd7665439ebd059875c2a32f883ee761a854124c96a1c1962d97cd9133","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:14:27.945967Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04765/citation-record","integrity":"/paper/2608.04765/integrity","json":"/paper/2608.04765/citation-record.json","paper":"/paper/2608.04765"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-06T17:14:26.037934Z","title":"Do as i can, not as i say: Grounding language in robotic affordances, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:26.037934Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:9ec605a5e9c208e263df75a96b2f11e556e9e9365dc33b34fcc17b909ddeb494","observation_id":"ec2b4004-2e21-407b-a086-73d84010ac79","resolution":{"observed_at":"2026-08-06T17:14:26.037934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-06T17:14:26.111120Z","title":"Paligemma: A versatile 3b vlm for transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:26.111120Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:b36e7be9f5abfab6ad05ad90498508f4c30db83038ef4a14d915975d43067cfb","observation_id":"d2adf88a-c541-493b-b0df-1f6ffe2c69a6","resolution":{"observed_at":"2026-08-06T17:14:26.111120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T17:14:26.189732Z","title":"π0: A vision-language-action flow model for general robot control, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:26.189732Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:60b58aa88b92cbcfc60eeea7c731142ee1259561b4b2462bd0f1efa57a270def","observation_id":"66f39838-00f2-4465-a131-21ab3c0956f3","resolution":{"observed_at":"2026-08-06T17:14:26.189732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:14:28.733276Z","title":"Joycon-robotics: Low-cost, convenient teleoperation for one- and two-arm robots","venue":null,"work_id":"d06db8e9-5d23-41fb-8d3a-eb7061a95687","year":2024},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:26.276539Z"},"links":{"citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:000881f7cc21101cc576a2fd85584144185fef53cae93baabdcaafff8a659213","observation_id":"f8e65588-ddd3-4d20-964f-ae43a6141cc3","resolution":{"observed_at":"2026-08-06T17:14:28.851693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T17:14:26.385568Z","title":"RT-1: Robotics transformer for real-world control at scale, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:26.385568Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:ddedc1fc44cfc816ee62f0f61c8ac9725c3348b7a8cd6fe460238daa5ef11890","observation_id":"c344ba2b-89a2-419f-a60a-e5025c4878d0","resolution":{"observed_at":"2026-08-06T17:14:26.385568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:14:28.544559Z","title":"Lerobot: State-of-the-art machine learning for real-world robotics in pytorch","venue":null,"work_id":"8ede247d-12ce-4387-b321-0153122ee840","year":2024},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:26.490968Z"},"links":{"citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:3ea1954b239725f4456374fde343f7ebc85a7aae8ea16350357e522ec1de1d07","observation_id":"41feb185-f395-438e-bd57-e06e0979e0c2","resolution":{"observed_at":"2026-08-06T17:14:28.588740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-06T17:14:26.588110Z","title":"Inner monologue: Embodied reasoning through planning with language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:26.588110Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:f82a8e156f093bae09e65c0726ee9eb78ee253bb95e28738e4257d7a9cfcc494","observation_id":"fee69af2-5a7a-41c9-9555-f3a149b88d74","resolution":{"observed_at":"2026-08-06T17:14:26.588110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T17:14:26.712575Z","title":"OpenVLA: An open-source vision- language-action model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:26.712575Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:cc1149b1ea1627f1c99eda5e462ab4d169a5328d3a265fd6d31df3081a271655","observation_id":"6735a986-ff53-484e-b4da-f1f423db95a7","resolution":{"observed_at":"2026-08-06T17:14:26.712575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00695","last_updated":"2026-04-15T17:01:03Z","snapshot_observed_at":"2026-08-12T17:36:16.455110Z","submitted_at":"2025-10-01T09:15:52Z","title":"HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.00695","snapshot_observed_at":"2026-08-06T17:14:26.783152Z","title":"HAMLET: Switch your vision-language- action model into a history-aware policy, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:26.783152Z"},"links":{"cited_paper":"/paper/2510.00695","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:3c318e0a5bd6d7ea68de6e3d2e18a8a2c3611bfba7e450ace9ae15d4426a0166","observation_id":"65adc830-e97a-45cd-b04a-c739778869d7","resolution":{"observed_at":"2026-08-06T17:14:26.783152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09227","last_updated":"2024-03-14T09:48:36Z","snapshot_observed_at":"2026-08-14T09:46:23.313135Z","submitted_at":"2024-03-14T09:48:36Z","title":"BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09227","snapshot_observed_at":"2026-08-06T17:14:26.871373Z","title":"BEHA VIOR-1K: A human-centered, embodied ai benchmark with 1,000 everyday activities and realistic simulation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:26.871373Z"},"links":{"cited_paper":"/paper/2403.09227","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:eb7d45d64e2fb596e5fd6711001026f091b48fe0af780326f8e54ec0f3226c91","observation_id":"f225bd11-9e7a-4f60-8bd4-51b1e6cb27c3","resolution":{"observed_at":"2026-08-06T17:14:26.871373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:14:28.409776Z","title":"MAP-VLA: Memory-augmented prompting for vision-language-action model in robotic manipulation, 2025","venue":null,"work_id":"68015573-f0cb-40cc-9712-884acaec2bf9","year":2025},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:26.952439Z"},"links":{"citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:94bb106513ca022cd546e1ce24dd671f3b5885d4dc63abb23e15f01ce87bd04a","observation_id":"237d394d-7864-4b49-a301-a7739ce01fa7","resolution":{"observed_at":"2026-08-06T17:14:28.489749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-06T17:14:27.000096Z","title":"RDT-1B: A diffusion foundation model for bimanual manipulation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:27.000096Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:a2ac4a7d749beab8e81e3086d091e930c1b3a033a6c943791d870e6b5aff5007","observation_id":"7c21e6dc-3e5c-4420-98ae-0615431a054b","resolution":{"observed_at":"2026-08-06T17:14:27.000096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-06T17:14:27.106158Z","title":"Octo: An open-source generalist robot policy, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:27.106158Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:a3add2a54d847cb57fe71b85658e94a6af8a19905e6eebde9318c5516226b343","observation_id":"3b1c435e-2a12-4b36-be43-6ff890490cab","resolution":{"observed_at":"2026-08-06T17:14:27.106158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-06T17:14:27.209877Z","title":"π0.5: A vision-language-action model with open-world generalization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:27.209877Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:6c31cfb32bdad946ac2ef9dbdbbba710578110bedbc8f46c44fd71c341e35ddb","observation_id":"f853134b-9a69-42aa-871a-2bf63528db39","resolution":{"observed_at":"2026-08-06T17:14:27.209877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:14:27.279263Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:27.279263Z"},"links":{"citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:422c073b6f7dff1368903069644d0c7e467db486cbe7321c5ee4ab68e146f4b7","observation_id":"c0a42ada-1856-4df4-9adb-fdd227092620","resolution":{"observed_at":"2026-08-06T17:14:27.279263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-08-06T17:14:27.367558Z","title":"MemoryVLA: Perceptual-cognitive memory in vision- language-action models for robotic manipulation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:27.367558Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:95d907195f0859232e735b86d631cf32f66514760b205e9e025b03105371ac1f","observation_id":"c915fb07-061a-43e5-b299-aada8e2681ad","resolution":{"observed_at":"2026-08-06T17:14:27.367558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:14:28.302398Z","title":"XLeRobot: A practical low-cost household dual-arm mobile robot design for general manipulation","venue":null,"work_id":"98ca3350-231d-4258-af89-8e28cedb89c1","year":2025},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:27.485130Z"},"links":{"citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:500d6cf186ead599d9356af210f3151e2cb55ac182ddab2df21f72f159b3f51f","observation_id":"a0ec2831-49aa-494e-a42e-a007edbdf222","resolution":{"observed_at":"2026-08-06T17:14:28.370855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:14:27.589065Z","title":"dVLA: Diffusion vision-language-action model with multimodal chain-of-thought, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:27.589065Z"},"links":{"citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:e9f7a15ea800f16ece2100b3f46913ae124114fe6705360d89e221e3d49a39b7","observation_id":"55f0d4a2-5889-41ca-b91e-0f0405701a26","resolution":{"observed_at":"2026-08-06T17:14:27.589065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02078","last_updated":"2026-06-30T05:51:48Z","snapshot_observed_at":"2026-08-11T05:42:08.001838Z","submitted_at":"2026-01-05T12:59:39Z","title":"Genie Sim 3.0 : A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02078","snapshot_observed_at":"2026-08-06T17:14:27.690161Z","title":"Genie Sim 3.0: A high-fidelity comprehensive simulation platform for humanoid robot, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:27.690161Z"},"links":{"cited_paper":"/paper/2601.02078","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:e578d3e3013ba27dc327515074352ee98463d190d45802e4b9708fb61f8e58ed","observation_id":"fdf76bb0-0b49-4392-a1e3-8ed27da973a7","resolution":{"observed_at":"2026-08-06T17:14:27.690161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-06T17:14:27.759703Z","title":"Robotic control via embodied chain-of- thought reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:27.759703Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:579f7d5ba329c24a6425aebdbac3d0d3db71cc76dfae0fe48b1e5bc5220f7c1c","observation_id":"fbfb4b99-ddd3-4431-bee1-9b98220acb78","resolution":{"observed_at":"2026-08-06T17:14:27.759703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:14:27.833388Z","title":"DualCoT-VLA: Visual-linguistic chain of thought via parallel reasoning for vision-language-action models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:27.833388Z"},"links":{"citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:ed44dc77e14a792f48d29f2a71d221ffc546ea6c704562b4184558fab983de16","observation_id":"4bb970a5-a952-4d1e-b542-1a3be5360814","resolution":{"observed_at":"2026-08-06T17:14:27.833388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T17:14:27.945967Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:27.945967Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2608.04765"},"observation_digest":"sha256:ea7b2ca3ff986c562d736e83f581bdb60815432f6c9bd44f2f6f2f4b21d37005","observation_id":"eb76eb0c-77e0-4a74-8e22-b4f14cf602fc","resolution":{"observed_at":"2026-08-06T17:14:27.945967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04765","last_updated":"2026-08-05T12:32:15Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T00:18:59.745929Z","submitted_at":"2026-08-05T12:32:15Z","title":"Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2608.04765."}