{"as_of":"2026-08-20T04:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a880bf53a9a7e8a037021e2e2abdde65ac554f417f3c3b0ec5be5a320069f08c","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T05:29:36.753268Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:48:28.878006Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T22:48:33.298230Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2607.07608","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.07608","snapshot_observed_at":"2026-08-06T22:48:33.298230Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","venue":"cs.RO","work_id":"c8d05f19-3605-4fa5-8d97-7a249a379e6f","year":2026},"citing_paper":{"arxiv_id":"2608.04530","last_updated":"2026-08-05T07:02:30Z","snapshot_observed_at":"2026-08-15T23:02:24.834125Z","submitted_at":"2026-08-05T07:02:30Z","title":"FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:28.878006Z"},"links":{"cited_paper":"/paper/2607.07608","citing_paper":"/paper/2608.04530"},"observation_digest":"sha256:3b0fd5273586b3945f09b1c06d80a4f4019861919dc0f60ceba402c695feda68","observation_id":"dd020876-d68a-4447-9842-82d6d3bf1c40","resolution":{"observed_at":"2026-08-06T22:48:33.383515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.07608/citation-record","integrity":"/paper/2607.07608/integrity","json":"/paper/2607.07608/citation-record.json","paper":"/paper/2607.07608"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:93a1d5bc1b5352598ab768589aa288d593c57bf3f9f16437aa279b719c594071","observation_id":"3c52b51d-4e6a-4e05-a87c-39912171f975","resolution":{"observed_at":"2026-07-09T05:36:01.215054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.890866Z","title":"Openvla: An open- source vision-language-action model","venue":null,"work_id":"7635468c-2c8b-4eb5-bf7f-65e9eddd0df8","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:bce4d2ad1552f8b0f612d19714a2dbff8bf73a78e340c12b6614b8855033293b","observation_id":"d5ef3b4d-2d1b-4631-a151-577467e1d942","resolution":{"observed_at":"2026-07-09T05:36:01.892196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.884673Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":"b47b3295-2e01-4a90-87b8-be07151fd80b","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:559a7436065411ae5e6a0869cc26779f5ddfdd6aa4d5511872f19e121e8eb65e","observation_id":"10ef95d4-f89a-4d43-82f2-99abe57c854a","resolution":{"observed_at":"2026-07-09T05:36:01.885881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.882694Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":"a820270b-018b-421a-8698-53115533ab17","year":2024},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:47cafa45429cf2797dea5c2eaae036be467705b4596bc9f9381d546776b75ba1","observation_id":"ae71e712-f169-47c0-a38b-87a583995ef5","resolution":{"observed_at":"2026-07-09T05:36:01.884064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:7ad6c8cb8969dbff760d477103c83412687eeda7dd834ba6ea2ae1a4215fb145","observation_id":"7ea1439f-7640-420b-8de6-faeb8f0c0876","resolution":{"observed_at":"2026-07-09T05:36:01.205303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:f782f41c46b89155d1a681f6fdcdaf38ac759cdc09c9f916d67ffcb1737169a0","observation_id":"2f713d6d-1511-41af-b81c-79089e44ad12","resolution":{"observed_at":"2026-07-09T05:36:01.149913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:14.101106+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:14.101106+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.880751Z","title":"On scaling up a multilingual vision and language model","venue":null,"work_id":"a66eee84-3d71-45f7-99d4-713265dd155a","year":2024},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:e271b0d90c2ea2998318817f4993b0eaedcc28d7a31682f035c2a5e80c261043","observation_id":"ddb3cb7f-702f-465f-bcac-9ff60e8e383f","resolution":{"observed_at":"2026-07-09T05:36:01.882065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.886480Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"9f841cfa-d98a-416f-bf72-09cbc664eb66","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:6dff61bd78b6c1995d29653f5605be9a18a470aee69b98f37b8ae2a65e6e6ce8","observation_id":"68a23db1-9e35-4523-9769-6c36e233586c","resolution":{"observed_at":"2026-07-09T05:36:01.887756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.888380Z","title":"Flowpolicy: Enabling fast and robust 3d flow-based policy via consistency flow matching for robot manipulation","venue":null,"work_id":"cb5b43ef-8d74-4987-bde2-a4aab9bb223f","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:6c0bc7c9b5e615b1b7399596bc8ea0a18e101448febd4d24c8548896ebc5a5cf","observation_id":"76bbf25e-0765-4320-8738-a6e7b2cd5a19","resolution":{"observed_at":"2026-07-09T05:36:01.889950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.876215Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":"2208bab9-5448-4615-95a3-47f6ed9557f7","year":2024},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:d09f2d30b3a82480cc524c3d0214dcf0bb2f8ccea44a7a070e50b763c2f50399","observation_id":"b21a8162-0191-4606-9f90-9b44558b8b7d","resolution":{"observed_at":"2026-07-09T05:36:01.877560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.872006Z","title":"Open x- embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":"d0524be0-8520-4dc1-a84a-d70a1c25749a","year":2024},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:c44179e04ce34bb825cf12d4f9347cae5d9590648a9d6b51b90b345df2f5959b","observation_id":"732f7e62-24a3-4830-960e-7ba329b89ff9","resolution":{"observed_at":"2026-07-09T05:36:01.873488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.869993Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset","venue":null,"work_id":"94a3d4a5-0178-4cda-a0de-9c26353d574f","year":2024},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:ab820177f931451ea2aa9b8c1d0a8a65e73602bf0c67199be03daf10f8271e95","observation_id":"dc9d015d-be52-4f9b-b0f8-4be30e59484e","resolution":{"observed_at":"2026-07-09T05:36:01.871324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.874200Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":"a935607d-451d-45c8-a360-93e9ea4d41c4","year":2023},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:d1a2d8d8e6764396118cbeff252a5981b34e200a9e3024a0a5a4e9c53cbbce39","observation_id":"45149a7f-21de-4bb1-8eb5-e72e33119dcf","resolution":{"observed_at":"2026-07-09T05:36:01.875592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-16T04:42:52.370966Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":"2503.06669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-07-10T23:07:47.895730Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","venue":"cs.RO","work_id":"f797e9ec-510f-43a7-8a0c-18009ce332e5","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:6a06be36763f995d7dd4980581b60e9943719531dbc80a1554fe94e4b7ba14bc","observation_id":"836d59b8-cfd3-4314-9482-742fd4ae5dce","resolution":{"observed_at":"2026-07-09T05:36:01.247849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2411.19650","doi":"10.48550/arxiv.2411.19650","metadata_source":"pith","pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","venue":"cs.RO","work_id":"4b158d3e-3dff-4412-85cd-baa879465a5e","year":2024},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:56215c86e8a96d23873efa1c67a1920a8bab8f97231e030b4b627ed1f33d6d18","observation_id":"ad38fbb4-ca87-43bc-bb0b-8341a3aa9916","resolution":{"observed_at":"2026-07-09T05:36:01.156824Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00451","last_updated":"2025-03-16T03:33:01Z","snapshot_observed_at":"2026-08-16T13:38:31.097287Z","submitted_at":"2024-06-29T14:35:21Z","title":"Language-Guided Object-Centric Diffusion Policy for Generalizable and Collision-Aware Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2407.00451","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.00451","snapshot_observed_at":"2026-07-09T05:36:01.216951Z","title":"Language- Guided Object-Centric Diffusion Policy for Collision-Aware Robotic Manipulation","venue":"cs.RO","work_id":"26f5da7e-5875-4ddb-bb29-5f1feec17762","year":2024},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2407.00451","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:7162c08babe726caf909b4230495b83538f527761197a5224936c45490dfb639","observation_id":"c71cc377-b180-4bb3-ab04-fce1ed191065","resolution":{"observed_at":"2026-07-09T05:36:01.220052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.865384Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations.RSS,","venue":null,"work_id":"0a48cf30-f17b-4ac4-b91d-5b213e2af382","year":null},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:c912116900e79e1f9dd0bdee27c4c3b00773d8c716e59aedd532e9ceacc8314a","observation_id":"171e4a30-9b9a-41c0-99df-8d821a46def3","resolution":{"observed_at":"2026-07-09T05:36:01.866669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-17T09:33:59.536762Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:b9771736117cd9661c8f1ee761e15ef23702ab1b6483076377b84b98ec9bf260","observation_id":"0dde5dc2-ca81-465d-b62b-251bf7a85223","resolution":{"observed_at":"2026-07-09T05:36:01.254012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.867240Z","title":"Interleave-vla: Enhancing robot manipulation with interleaved image-text instructions","venue":null,"work_id":"8457112d-9d81-4112-a42b-a5cd91700659","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:774c76f0a6a94b190f7c4b21f2aa95d7ddbaee275130a0c595cc8fc380522e3d","observation_id":"9a28d0b0-29a6-438e-88b5-fc6350fbc904","resolution":{"observed_at":"2026-07-09T05:36:01.869379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.19816","doi":"10.48550/arxiv.2506.19816","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling, October 2025","venue":"arXiv (Cornell University)","work_id":"98421727-12e6-4220-9a07-01a1e8870d40","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:36e7d09f6ffc8204ed108b89d678893ece7358b1bce40c539768ffd29a772db1","observation_id":"b8942b76-b11a-4ffc-a86e-747b3203cf0f","resolution":{"observed_at":"2026-07-09T05:36:01.233117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00695","last_updated":"2026-04-15T17:01:03Z","snapshot_observed_at":"2026-08-12T17:36:16.455110Z","submitted_at":"2025-10-01T09:15:52Z","title":"HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy","version":3},"cited_work":{"arxiv_id":"2510.00695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00695","snapshot_observed_at":"2026-07-10T23:37:42.713726Z","title":"HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy","venue":"cs.RO","work_id":"4a945e96-4e00-4739-9671-ddd02c7f5cfa","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2510.00695","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:24a038c19fefc6bf0351f1cbf746ab6c2d4daab70bbbc7877e1034cfb2a5588d","observation_id":"60fb7c14-391e-44d2-bbf3-2902234e43dc","resolution":{"observed_at":"2026-07-09T05:36:01.223722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.878274Z","title":"Resolving state ambiguity in robot manipulation via adaptive working memory recoding.IEEE Robotics and Automation Letters, 2026","venue":null,"work_id":"2bc96e5e-df09-4e89-8ec7-5ca3a5bd7c1f","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:c5a5940a6078dcf977697748d5acd9b439bd27d9ccceb34f31682e8e578b888d","observation_id":"8e81eda7-2bc6-47ad-8982-4bf3a8b33b43","resolution":{"observed_at":"2026-07-09T05:36:01.880111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.892821Z","title":"Memoryvla: Perceptual-cognitive memory in vision- language-action models for robotic manipulation","venue":null,"work_id":"1215cb7d-08f7-4cc2-bcd2-cbbcb6b720c7","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:88e5ef363acc21bf46d1eb7f7ba8680fc1d5d7145b8e48f54cc13197bf894b09","observation_id":"43cab735-4845-424e-a9f8-be293a75844a","resolution":{"observed_at":"2026-07-09T05:36:01.894901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.20328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T23:37:43.055592Z","title":"Memer: Scaling up memory for robot control via experience retrieval","venue":null,"work_id":"572b92b0-0318-4389-8b27-add4a67909a3","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:002d49997f1543bca504b8a38cd4688c8fb51e4f38ad583d3b474f62137af904","observation_id":"a15068c5-bfae-42dd-ac20-70ba63b8c7d6","resolution":{"observed_at":"2026-07-09T05:36:01.240704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.863326Z","title":"Global prior meets local consistency: Dual-memory augmented vision-language- action model for efficient robotic manipulation","venue":null,"work_id":"59ec1da9-8ee7-47dd-be84-afe3b3ae7eb7","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:ba25e0340aebe2c1a06837566de9381f77715d1856487ed687b02599032d91ea","observation_id":"7673f631-5362-407d-be7b-42e6344a9c61","resolution":{"observed_at":"2026-07-09T05:36:01.864791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.895585Z","title":"Monet: Reasoning in latent visual space beyond image and language","venue":null,"work_id":"0d37fdf8-73e0-432c-8076-1cf4fcdd4541","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:56472b9b25b1370337d7acfb5245e624a2445cb1858820a04dc06c2a0e2a03f4","observation_id":"f5d5fd2c-7633-470e-8f9d-032161386b75","resolution":{"observed_at":"2026-07-09T05:36:01.897015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.818875Z","title":"Machine mental imagery: Empower multimodal reasoning with latent visual tokens","venue":null,"work_id":"2928af6f-a01f-4969-84e1-0d541bd81d64","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:baeee23a0ab9a4faa8fd534a18a00d73afaf31d27c0154dc557b0338594643c7","observation_id":"bc0e9a92-6160-4101-b9f9-71b992c0132d","resolution":{"observed_at":"2026-07-09T05:36:01.820533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.813616Z","title":"Latent visual reasoning","venue":null,"work_id":"6fbe9d70-4904-4625-a4a9-77528ee56998","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:1c18ef47bd829f9bbfcd7fc8d8c5a0b22d0596c79d3da592f9e94fdf27caaf2f","observation_id":"d525808d-e432-411c-b45e-981637381a37","resolution":{"observed_at":"2026-07-09T05:36:01.815107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.01166","last_updated":"2026-05-08T03:58:29Z","snapshot_observed_at":"2026-08-14T22:59:01.593753Z","submitted_at":"2026-02-01T11:34:37Z","title":"Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2602.01166","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.01166","snapshot_observed_at":"2026-07-09T05:36:01.180602Z","title":"Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models","venue":"cs.RO","work_id":"6e132164-e81e-47c1-a2b0-0abae63e122f","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2602.01166","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:025725a27fe57a3bd06477f43215fc74d03b6648af59a59a9cfcfa1a24ebfaf7","observation_id":"ce34f478-4072-4502-9607-4f688fd9b487","resolution":{"observed_at":"2026-07-09T05:36:01.182613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.242136Z","title":"Appagent: Multimodal agents as smartphone users","venue":null,"work_id":"9a080bd6-ce14-4b37-9c10-b026c507a4d7","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:73e2998c85fdf7a184ee47988582c2df55bf14a8137361d801fd85c15b32dcee","observation_id":"3bd25b8b-617f-4680-a44d-1f06e6666639","resolution":{"observed_at":"2026-07-09T05:36:01.244436Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.823752Z","title":"Vismem: Latent vision memory unlocks potential of vision-language models","venue":null,"work_id":"f5a02127-6e91-4f93-ba84-c7c1e3bbbf68","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:9ed31c7b9c7f1546d396b319e848e318f47594b17390d7e6d538aa1a7c858aaf","observation_id":"2e8fcb0e-77bc-4122-a9b4-846a6de8baf3","resolution":{"observed_at":"2026-07-09T05:36:01.825378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"cited_work":{"arxiv_id":"2604.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.02029","snapshot_observed_at":"2026-07-09T05:36:01.166323Z","title":"The latent space: Foundation, evolution, mechanism, ability, and outlook.arXiv preprint arXiv:2604.02029","venue":"cs.AI","work_id":"66adad9d-c3df-4cf7-9601-cf9d67d19ef5","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2604.02029","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:11fa5c1e894f09ef94bc695fdeb433351e82c78fe3b1f18d63b51058045e9175","observation_id":"d35bfe89-30e8-49bf-8d1d-4373133994e1","resolution":{"observed_at":"2026-07-09T05:36:01.169585Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.799521Z","title":"Rt-2: Vision-language-action models trans- fer web knowledge to robotic control","venue":null,"work_id":"4740d6ea-a4a5-4152-8039-428cd696a6a0","year":2023},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:f0a2b6aa7ef769bd71f346ca8bb04dc750b3e8987d6edbf7e076e11c802d92fa","observation_id":"468bb18f-4c58-4f70-9e21-cb2ffb6865dc","resolution":{"observed_at":"2026-07-09T05:36:01.801736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.796732Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"5739fa02-5c77-4eea-a788-060352f5c9ce","year":2023},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:99c9eaac32a8a425ccc00820f6c82174cafd302a64bda0295f37417439f5b049","observation_id":"414f107c-9584-46bb-93ef-59ead2726ac6","resolution":{"observed_at":"2026-07-09T05:36:01.798731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.826122Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":"0a6d5c98-8835-49ca-bf09-ee3b469c4a13","year":2023},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:bb044f7585c6569b116fdb302432da50aa5220fe8dfc48dea8e4eecb4c22121f","observation_id":"6922aa31-d139-4c16-8f1b-f80ed48d36b5","resolution":{"observed_at":"2026-07-09T05:36:01.827859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.811029Z","title":"Evaluating real-world robot manipulation policies in simulation","venue":null,"work_id":"50be86de-d634-47bf-91f4-ef997b6f9acd","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:eb959e53e3ef8238a340b9e60c0098bf02e3cd1c6123f47afe6ae05584327d0c","observation_id":"022a85cd-dd5d-4a90-af16-1dd47b8f63fb","resolution":{"observed_at":"2026-07-09T05:36:01.812848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.805154Z","title":"Manipulate-anything: Automating real-world robots using vision-language models","venue":null,"work_id":"0a4d1aef-a88c-4ce4-8984-4d88f279ac00","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:42131a30804a25b46aee1f33c6e294b1c7eae2d4ecc8b46a3c3f9b78403c7bc8","observation_id":"0ce8fed2-df73-4d59-85c3-c9a8c74bf296","resolution":{"observed_at":"2026-07-09T05:36:01.807300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.821254Z","title":"Rekep: Spatio- temporal reasoning of relational keypoint constraints for robotic manipulation","venue":null,"work_id":"d58f5ba2-90ae-4cf0-afb9-2596bc2d1b67","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:f727a2ee939deac001949e16a72b6c6484ccb7d9759295e33dd0d7f6f3270a88","observation_id":"b74ff13f-9e9b-49f5-9cdf-c1fe852a794f","resolution":{"observed_at":"2026-07-09T05:36:01.823039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-08-16T10:00:51.789693Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2503.10631","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-07-10T23:07:48.060771Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","venue":"cs.CV","work_id":"ecac5f06-a68f-4fff-a89a-a89358afb649","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:34baeae1b50efefb67838e27c804b926ecc3bc72cae19f3e4e864053fdaf16d5","observation_id":"d1e832fc-aa8e-4cca-be7a-a2c72d769426","resolution":{"observed_at":"2026-07-09T05:36:01.229345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.861280Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models","venue":null,"work_id":"7d20358d-9968-4a18-aed3-4225cdd052e8","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:ace14dc5c9877d7c2170ee0df2d5f603419ab01aae2ded668ebc7253033f1fcb","observation_id":"340113ce-fed4-49dd-bc9c-ebb8b0558cbc","resolution":{"observed_at":"2026-07-09T05:36:01.862692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":"2506.21539","doi":"10.48550/arxiv.2506.21539","metadata_source":"pith","pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WorldVLA: Towards Autoregressive Action World Model","venue":"cs.RO","work_id":"d8c0c873-b2fc-44a5-a0c8-0d4a698783fb","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:42bd14f19c80754fac5676984337505253725e572acfd556f0efd61469bca78b","observation_id":"a648fa49-288d-4f36-8e13-b005c59b38d2","resolution":{"observed_at":"2026-07-09T05:36:01.236548Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-15T18:55:35.634820Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:e6d4451d6152c87e30795844135817145c6ef9a8253217ab09fc2f0f960d22e8","observation_id":"d0a44ef8-cb7c-4f95-afad-eb9faee15b42","resolution":{"observed_at":"2026-07-09T05:36:01.201663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05116","last_updated":"2026-07-08T17:09:24Z","snapshot_observed_at":"2026-08-18T09:02:13.147377Z","submitted_at":"2025-07-07T15:30:55Z","title":"VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting","version":5},"cited_work":{"arxiv_id":"2507.05116","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05116","snapshot_observed_at":"2026-07-09T05:36:01.255549Z","title":"V ote: vision-language-action optimization with trajectory ensemble voting","venue":"cs.CV","work_id":"577786f7-7545-48fe-b085-1c37abd6a879","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2507.05116","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:d0c1596e3b44319232ede36898f7db8f0a3bf755a0a2eecc0613bccb7b02f350","observation_id":"0816f57c-57e0-4f93-ad67-b58a0d26215a","resolution":{"observed_at":"2026-07-09T05:36:01.257153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.852354Z","title":"Spec-vla: speculative decoding for vision-language-action models with relaxed accep- tance","venue":null,"work_id":"17c77cf2-07e1-4d58-910b-1b52dd36bc2b","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:3e9249176223d4bef956ea330d0fa6b2a3a87ec505bf510f5d1b7fd6b5a4207e","observation_id":"3c8c5ef2-b0c7-4663-bdb5-eb449eaa6a47","resolution":{"observed_at":"2026-07-09T05:36:01.854027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-08-15T09:35:08.116329Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":"2502.19645","doi":"10.48550/arxiv.2502.19645","metadata_source":"pith","pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","venue":"cs.RO","work_id":"04f46bb3-4346-47e8-bf09-c75d91f96e87","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:082e059e45962c3d94ddd0e4793e04dbc81b9fe448220ae241266f2271a8f3e4","observation_id":"e05629fc-de17-4052-ae1e-542a4e55aabf","resolution":{"observed_at":"2026-07-09T05:36:01.209803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.857129Z","title":"Mole-vla: Dynamic layer-skipping vision lan- guage action model via mixture-of-layers for efficient robot manipulation","venue":null,"work_id":"9987fa66-f0ce-4eef-b377-4be52d56113b","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:fa13b742f962dbb732f5531276e444dcc704e7fba01d6f665a83390bc258c210","observation_id":"05869d1f-7bcc-4ac3-996d-b62b8260076f","resolution":{"observed_at":"2026-07-09T05:36:01.858596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.07530","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.195561Z","title":"Bitvla: 1-bit vision-language-action models for robotics manipulation.arXiv preprint arXiv:2506.07530","venue":null,"work_id":"7c28e41e-f878-4a0a-be94-00fd05e27e6b","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:71b0514f959970cf2ce948c7f62316226143b3298a5aaa466e3961436f2df156","observation_id":"6288911b-8a21-4a87-b61e-67126167e164","resolution":{"observed_at":"2026-07-09T05:36:01.198163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.793175Z","title":"Dexvla: Vision-language model with plug-in diffusion expert for general robot control","venue":null,"work_id":"f494693f-11fb-42e6-ad70-7514aaa9baf5","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:84f2429b600f2df79853c905e54eb8f4620c1855ceb2efc28646db1a5686920d","observation_id":"dd5bc57f-a59f-497f-8820-b375cb64340c","resolution":{"observed_at":"2026-07-09T05:36:01.795515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.808450Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers","venue":null,"work_id":"59766d80-a228-4e39-891b-9089ed091b9c","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:995c9a65dbbeac3fd09344eabef08d3f17dc0bceabc9cf5466c1842423b8175f","observation_id":"1989f193-05e5-4703-a156-ca23d2df6fd4","resolution":{"observed_at":"2026-07-09T05:36:01.810323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-08-17T09:50:38.119234Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"cited_work":{"arxiv_id":"2505.03233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.03233","snapshot_observed_at":"2026-07-09T20:46:33.635100Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","venue":"cs.RO","work_id":"0575c08a-597a-4420-9cbd-e33ef136c900","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2505.03233","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:393304ebc9fbb190928968da5ead864990c0825764e9895cd11aa349c59fe028","observation_id":"754d2efd-bc29-4b6e-989d-a66d06027dc0","resolution":{"observed_at":"2026-07-09T05:36:01.178426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.12942","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T23:37:42.968094Z","title":"Towards long-horizon vision-language-action system: Reasoning, acting and memory","venue":null,"work_id":"3779b1b5-7879-4cd9-bdec-d4974c464457","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:c4fc543cd6e3b0cf76ea329c76dd0e3fd0a830f3f93cc4d560373e38ef46b29a","observation_id":"5f9edbb0-e6c3-449d-b24d-34af7313939a","resolution":{"observed_at":"2026-07-09T05:36:01.164800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.840673Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":"ae350b61-dcdf-433f-aaa1-fdfdb6d41ba9","year":2024},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:2c05ecbbddc49538796f065363d05609633f54c81011af05f4c7fede3c93e9b1","observation_id":"fa6721e3-beca-4f5a-ae9d-29d63d420c75","resolution":{"observed_at":"2026-07-09T05:36:01.842258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.845409Z","title":"Tracevla: Visual trace prompting enhances spatial- temporal awareness for generalist robotic policies","venue":null,"work_id":"e75c2769-020e-4762-ac09-f87b80d5be29","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:088cfd1e5b9528edd20bfd9c6745f4db196a6b4ce326414680ea167ddba202d8","observation_id":"d409a3bd-c294-43fd-a3fd-76e47311ec3a","resolution":{"observed_at":"2026-07-09T05:36:01.847013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":"2505.06111","doi":"10.48550/arxiv.2505.06111","metadata_source":"pith","pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","venue":"cs.RO","work_id":"e05d654d-db73-48f6-9318-381b6798bac9","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:2007b861c8aeb14c11414ea078a87e65ca442605cb54acd398a50853c946fe9f","observation_id":"4df80ad6-5bf3-41ef-b3c9-3e6ee767774a","resolution":{"observed_at":"2026-07-09T05:36:01.186238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.15010","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T23:07:47.877418Z","title":"BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames, February 2026","venue":null,"work_id":"5b8eefc0-8517-4422-856a-015a8f43111b","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:13a6e57793eb6416a3c26f2f68ac4fc37dbb130ac767027eaa4e7179ce6f8650","observation_id":"e7ef4cb5-c49b-4c92-a424-593a00401d6c","resolution":{"observed_at":"2026-07-09T05:36:01.190060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.897616Z","title":"Hif-vla: Hindsight, insight and foresight through motion representation for vision-language-action models","venue":null,"work_id":"20b6271b-9c6d-4247-9c14-27c29022504a","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:f9e231f2b5502d1e43eefda359c0b56da37ce5df0089e0e5886bfba9a3e9601b","observation_id":"bb75aa19-3024-4d5d-b01c-04c2d169cc8e","resolution":{"observed_at":"2026-07-09T05:36:01.898934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04246","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T23:37:43.254600Z","title":"arXiv:2510.04246 [cs]","venue":null,"work_id":"a1ac51e2-dba6-47a0-92d1-82cd3a31da10","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:deeef12ba4504335d361f8a044efc72ee2f14605698284d5fed13aee0e9d254b","observation_id":"cb0975c1-a969-4700-8a33-d49983872e9a","resolution":{"observed_at":"2026-07-09T05:36:01.161110Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.843022Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":"2d449e1e-7d4d-426c-bbc5-1a75908513fe","year":2024},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:2657c0122ce0f24bb200d78ccf6ef4e362130138274ef50183e645a8d487c1b6","observation_id":"5ec692fc-4c66-489f-85ac-75d6e0d5b4ef","resolution":{"observed_at":"2026-07-09T05:36:01.844664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.847723Z","title":"Dinov2: Learning robust visual features without supervision.Transactions on Machine Learning Re- search","venue":null,"work_id":"b130b3f4-4f59-4118-8e9f-21901ed01003","year":null},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:7dbfccd86be858617244f22200a7be922a08d697786d04f15835881fbbc7c6a4","observation_id":"485cccba-ec85-4443-bd0f-cbec72d7d522","resolution":{"observed_at":"2026-07-09T05:36:01.849275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.802448Z","title":"Sigmoid loss for lan- guage image pre-training","venue":null,"work_id":"6dc223aa-695e-43d6-a02e-047f780139df","year":2023},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:2469d28f5c1bc9c00a6ae91d6d43f061ba59b8a0f5af826c0e40737ff0c42d4d","observation_id":"b0082a14-6e89-444b-a1ec-8e845b226ab5","resolution":{"observed_at":"2026-07-09T05:36:01.804308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:b91788cc5b64a3757a06a84c62bfebe905f3da49e9742835b9184047a343b04d","observation_id":"fd84c097-d777-44bd-b99c-826237ff192e","resolution":{"observed_at":"2026-07-09T05:36:01.193831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.835783Z","title":"Squeeze-and-excitation networks","venue":null,"work_id":"16fc9b1d-b2fe-404e-b89f-ff9d9ccc0e44","year":null},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:a735a33b49968f08f65fd0f7c332144d3de894fee715090a75e788af83f824b9","observation_id":"0eed64a4-38fc-44e0-8b68-8dde505caf3d","resolution":{"observed_at":"2026-07-09T05:36:01.837429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.838185Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"3b641877-cf95-435c-8d5d-441328e0d0ea","year":2021},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:f8d94af690d7f96cd802baf3315cc70bbb17622b7c94ced96c6476c11750ec01","observation_id":"25f69a02-2527-47e3-ba38-e6ccf4f00733","resolution":{"observed_at":"2026-07-09T05:36:01.839873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-08-17T12:53:34.218587Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":"2501.15830","doi":"10.48550/arxiv.2501.15830","metadata_source":"pith","pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","venue":"cs.RO","work_id":"592041b3-3ca2-4836-8dd4-f8095d8a692b","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:2b840085d6515c0b0aa8d43455f0d84d9da9b63f197970a1c1b8ae267a2fbe31","observation_id":"944ce056-85fb-4441-b63f-5fe283341e42","resolution":{"observed_at":"2026-07-09T05:36:01.153187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.828605Z","title":"Magma: A foundation model for multimodal ai agents","venue":null,"work_id":"3e9b9f36-020e-450a-9529-f2cc89968f35","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:695e7df0c62638483b350b29548c79df8b02293a3581f49069ffb1c4981616e0","observation_id":"8659a7e0-eaa4-4dba-8b02-0a0680087172","resolution":{"observed_at":"2026-07-09T05:36:01.830278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.830969Z","title":"Dreamvla: a vision-language-action model dreamed with comprehensive world knowledge","venue":null,"work_id":"94aab6ee-c732-456a-8ef1-4bf1e5dc0e3e","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:009d885f95a9ad9a627e06590807e2461c0a93e84576fa7533bf13e5add885f5","observation_id":"500c7588-ba98-4c30-bd57-784ee93b88dc","resolution":{"observed_at":"2026-07-09T05:36:01.832721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.833469Z","title":"Thinkact: Vision-language-action reasoning via reinforced visual latent planning","venue":null,"work_id":"caf0c284-4078-4bff-b1d1-b599e229f40e","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:2f59f5844a2722b564651a43750ad5e449ac4921abd9ebfe303064cf0b4d9567","observation_id":"ab3c91c9-759b-48f3-9ad7-082467a4326e","resolution":{"observed_at":"2026-07-09T05:36:01.835088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.849951Z","title":"Towards efficient and robust manipulation via multi-frame vision-language-action modeling","venue":null,"work_id":"a75344d3-b33e-4ea0-bbb6-bca6341e4f62","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:500be12c26180f346c9431bdebb9c2b72627bef0fe3ed8443a6dca7a6a6d87cd","observation_id":"9a7d9ccb-ccaf-4f22-954a-b53cf0c2bd5b","resolution":{"observed_at":"2026-07-09T05:36:01.851550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.854706Z","title":"Semanticvla: Towards semantic reasoning over action memo- rization via synergistic explicit trace and latent action planning","venue":null,"work_id":"7d94ba53-893d-4fc7-b49a-71e1ac139ba5","year":null},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:1d021e9a5e79ffc6fc164fd435aa5915932742f1c3814cf4745ff02a676d456b","observation_id":"5d341f3a-cf3c-49df-b9ec-d08955f5e619","resolution":{"observed_at":"2026-07-09T05:36:01.856231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.859239Z","title":"Universal actions for enhanced embodied foundation models","venue":null,"work_id":"59e70034-b454-4bf0-8619-9a257cdb8870","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:498b0c012ecb0a5c5d2a4ddeecc71ea584a480ff9003aa9379ce2c65280c2a9a","observation_id":"0ed73f66-74cc-4d53-a293-3144688fec06","resolution":{"observed_at":"2026-07-09T05:36:01.860665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:0e75597e0a610b78d2de6073cc733b7cc43106b97944a0e437307e47136bea35","observation_id":"563d5fa2-f223-4850-89cc-5d87bf820c2d","resolution":{"observed_at":"2026-07-09T05:36:01.250815Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.815884Z","title":"Fast-thinkact: Efficient vision-language-action reasoning via verbalizable latent planning.arXiv e-prints, pages arXiv–2601, 2026","venue":null,"work_id":"ef2d0f16-f2e5-46bf-9463-697bf6f065f1","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:eba95c6a6dac7bd54ce799ced55ca31ee8a6459970923027e5fd49cb246c785b","observation_id":"0b4845de-6cef-4f39-a9e7-50ddfc43148c","resolution":{"observed_at":"2026-07-09T05:36:01.818142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.07100","last_updated":"2026-06-30T09:11:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T09:51:25Z","title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2606.07100","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.07100","snapshot_observed_at":"2026-07-09T05:36:01.172764Z","title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","venue":"cs.CV","work_id":"58373230-8792-443a-b056-4a799e7eecf7","year":2026},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2606.07100","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:052acd5b7e064708f10db0ab436e201de645a32abfc1e9d973d342f80cd11db7","observation_id":"1a406fd2-1b25-4b6d-9d8b-a583830b5294","resolution":{"observed_at":"2026-07-09T05:36:01.174758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-19T12:47:54.459443Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":26,"verified_fuzzy":45},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 1 inbound Pith citation observation for arXiv:2607.07608."}