{"as_of":"2026-08-10T22:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:35c433eedb598cc32b507307a0b926e9d93a6edceaf75db279a6f592d6b59d72","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T12:39:02.545780Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:54:07.846961Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.08127","snapshot_observed_at":"2026-08-01T23:54:07.846961Z","title":"Mishra, Yongxin Chen, Danfei Xu, Yang Liu, Xi Chen, and Jiayuan Mao","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15207","last_updated":"2026-07-16T17:04:15Z","snapshot_observed_at":"2026-08-06T11:21:06.196983Z","submitted_at":"2026-07-16T17:04:15Z","title":"BadWAM: When World-Action Models Dream Right but Act Wrong","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T23:54:07.846961Z"},"links":{"cited_paper":"/paper/2607.08127","citing_paper":"/paper/2607.15207"},"observation_digest":"sha256:4f49c05e6c64417afd3f4421b7b2d43941231fa222e8dd7974af21aa4a7cbccd","observation_id":"7c60412a-aad7-4a17-af41-fa6935ce2e3b","resolution":{"observed_at":"2026-08-01T23:54:07.846961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.08127/citation-record","integrity":"/paper/2607.08127/integrity","json":"/paper/2607.08127/citation-record.json","paper":"/paper/2607.08127"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.03075","last_updated":"2026-04-27T13:02:22Z","snapshot_observed_at":"2026-07-06T22:31:40.462674Z","submitted_at":"2025-10-03T15:02:27Z","title":"What Drives Compositional Generalization? The Importance of Continuous Training Objectives in Visual Generative Models","version":3},"cited_work":{"arxiv_id":"2510.03075","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.03075","snapshot_observed_at":"2026-07-10T12:47:05.570796Z","title":"What Drives Compositional Generalization? The Importance of Continuous Training Objectives in Visual Generative Models","venue":"cs.CV","work_id":"a9f93a15-ff08-44ef-8613-7fe2f345caa8","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2510.03075","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:9bfc7c70a1cca14fe0ee0318f722eea6c27a88f29874568e02e3bf088adbedfb","observation_id":"620a54c3-5b4e-4bec-900e-f9857c2b6c25","resolution":{"observed_at":"2026-07-10T12:47:05.571985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13149","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:47:05.530776Z","title":"RoboHiMan: A hierarchical evaluation paradigm for compositional generalization in long-horizon manipulation.arXiv preprint arXiv:2510.13149, 2025","venue":null,"work_id":"1a769857-dad6-4a69-8893-00681929e484","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:6a2bc0196cf1d7753051a98e36163ceedeea19189c9bf4815554c21bc356aea3","observation_id":"2585a871-a7b0-4443-819b-d419c81e2ddb","resolution":{"observed_at":"2026-07-10T12:47:05.532427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-07T03:52:23.114381Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":2},"cited_work":{"arxiv_id":"2510.03827","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.03827","snapshot_observed_at":"2026-07-10T12:47:05.547933Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","venue":"cs.CV","work_id":"a20da823-a5e0-41ed-a700-21c3007f48ce","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2510.03827","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:3d89a4232e7be00df9419542cbe6ad45edea789a2a3c8cc57e2bdbc900d02e97","observation_id":"ada9a1e9-ffaa-456b-aa43-b950e37cb856","resolution":{"observed_at":"2026-07-10T12:47:05.549401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03500","last_updated":"2026-05-01T03:34:16Z","snapshot_observed_at":"2026-08-02T10:57:11.334123Z","submitted_at":"2025-05-06T13:05:04Z","title":"VLAs are Confined yet Capable of Generalizing to Novel Instructions","version":5},"cited_work":{"arxiv_id":"2505.03500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.03500","snapshot_observed_at":"2026-07-10T12:47:05.496930Z","title":"VLAs are Confined yet Capable of Generalizing to Novel Instructions","venue":"cs.RO","work_id":"e677fa65-b522-4f6a-9be0-dd325fae2ad9","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2505.03500","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:5bcf09f3aff980f7edc4269ce0ea9de08880806fff1c82097ff83ed79199a83c","observation_id":"8e0290a0-ee57-4e6e-a2a5-fec695f64c56","resolution":{"observed_at":"2026-07-10T12:47:05.498237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.17659","last_updated":"2026-07-15T16:20:07Z","snapshot_observed_at":"2026-08-07T19:47:50.377420Z","submitted_at":"2026-02-19T18:59:20Z","title":"When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs","version":2},"cited_work":{"arxiv_id":"2602.17659","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.17659","snapshot_observed_at":"2026-07-16T02:22:33.336323Z","title":"When vision overrides language: Evaluating and mitigating counterfactual failures in vlas","venue":null,"work_id":"569952e2-c3a5-4a33-9e48-7e5558a676ce","year":2026},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2602.17659","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:061bfbeec692d1e24b2f8fccbb012a728b3febbc905f8573438ff775e3a7a704","observation_id":"94179f0a-1965-4288-a2ac-5811e4637b6b","resolution":{"observed_at":"2026-07-16T02:22:33.336323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2510.13626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-07-10T12:47:05.553101Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","venue":"cs.RO","work_id":"e35c8c6d-977d-4af1-963a-766ba98703ce","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:fa7457d450f24df83a092f6fcf7d2fa792a99a3f127aa6d10170e43f75e73036","observation_id":"2c0977ed-d29e-40f0-b14f-ba7c05df07f2","resolution":{"observed_at":"2026-07-10T12:47:05.554331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:d718d8641a14d3d3a784a0af885727cf9ae7ae9e0813221d851540971e97de27","observation_id":"590be4ae-db36-419e-8ca3-d3486e7d1216","resolution":{"observed_at":"2026-07-10T12:47:05.576705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:f115d6ea4d4d0731b43d71fb4e82becda80bc4be31c3f0d470787f7003e17415","observation_id":"b68393c9-27a9-4db1-991c-a43d4337a0d0","resolution":{"observed_at":"2026-07-10T12:47:05.524625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:47:05.894852Z","title":"Veo: a text-to-video generation system","venue":null,"work_id":"1e6f6d8b-3ab3-4028-86c8-f937db7db742","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:de57d0e44dcf841ea409e1e9b068ae8e1ec2977ac9deedf3068e8eeed9c9a6d5","observation_id":"860fb295-1d54-40d8-baa8-9c3ec64f1f68","resolution":{"observed_at":"2026-07-10T12:47:05.895943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":"2601.16163","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-07-10T18:47:31.583000Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","venue":"cs.AI","work_id":"3d63039f-41b0-4a31-af31-6fc10f5c1b1b","year":2026},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:e44ac1cff5ba5ea65d2b84414c33b0defc996360133c86d3b747fc8ac859923c","observation_id":"9cddd1d0-7706-444b-bbce-61bbd4140604","resolution":{"observed_at":"2026-07-10T12:47:05.559327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-08-09T12:54:21.149243Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":"2602.15922","doi":"10.48550/arxiv.2602.15922","metadata_source":"pith","pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Action Models are Zero-shot Policies","venue":"cs.RO","work_id":"9a85fc69-74df-450e-94cd-69d186e9e830","year":2026},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:5d6aa8a2e18e3617996db084bc09cbfa865104e3e8ef8bfa9010fe91a2d65cc8","observation_id":"275eb733-967d-48f0-ab40-de7dd70890ab","resolution":{"observed_at":"2026-07-10T12:47:05.551893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"cited_work":{"arxiv_id":"2512.15692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15692","snapshot_observed_at":"2026-07-10T23:07:47.631138Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","venue":"cs.RO","work_id":"cd5b191a-8f67-43d3-8816-0ade1b9a7c29","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2512.15692","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:cc839cc472a9243c7a65246edec2346efef6da1ebe7d157038c6a4af16a80614","observation_id":"75633175-0611-4860-be72-daf45212261c","resolution":{"observed_at":"2026-07-10T12:47:05.556760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.10448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.601064Z","title":"Dit4dit: Jointly modeling video dynamics and actions for generalizable robot control","venue":null,"work_id":"fbddd7d2-e7dd-47df-8f81-fdf4dd1efdd3","year":2026},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:49ad772e9252f339dabd2e5480c1b5cd60c12056a86f3d968a49eaa3d74c0348","observation_id":"14ec14d8-ba74-4337-841e-71bfc24e38d7","resolution":{"observed_at":"2026-07-10T12:47:05.564496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":"2603.16666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-07-10T18:47:31.580281Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","venue":"cs.CV","work_id":"772d0226-9ad6-42c0-9c79-d36d37edbbe4","year":2026},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:752ed4cbd7ef891b414d07ac4b83296957c16329d9a02ea241caf5d7a33fbb9e","observation_id":"4271c867-630a-440a-9ae2-cc76dab74a2c","resolution":{"observed_at":"2026-07-10T12:47:05.586455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.622283Z","title":"Novaflow: Zero-shot manipulation via ac- tionable flow from generated videos.arXiv preprint arXiv:2510.08568, 2025a","venue":null,"work_id":"09d6ddf4-6785-49e3-999e-daccc6f38bd8","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:adf6c1b744188d322c0a0ac5a0eb04537627d1c70e4ede73ce6c2d2b83075c82","observation_id":"c8417bc1-1584-4f88-a534-a52f7b4fcd4f","resolution":{"observed_at":"2026-07-10T12:47:05.579366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:47:05.904562Z","title":null,"venue":null,"work_id":"af889ecf-fa0e-4aa9-983a-4df9f5fb0be6","year":2024},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:fc8a91ec57a3631cd3fd8d6da871cd2b041565b47a09eb6d43eba5bda9fa8d2e","observation_id":"4290ca33-3c90-4dfa-bee4-07493b0aabea","resolution":{"observed_at":"2026-07-10T12:47:05.905579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":"2601.21998","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-07-10T12:47:05.502321Z","title":"Causal World Modeling for Robot Control","venue":"cs.CV","work_id":"a33c4ee0-db06-4f9a-8852-c62e3a72fc27","year":2026},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:f94f3a334a9d657c8d47b0fe1ecda51ebac68dfab7a38c3e4404350960d76584","observation_id":"f08e2978-935b-49b3-a742-91251720779b","resolution":{"observed_at":"2026-07-10T12:47:05.503611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00795","last_updated":"2025-08-01T17:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-01T17:23:49Z","title":"Video Generators are Robot Policies","version":1},"cited_work":{"arxiv_id":"2508.00795","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.00795","snapshot_observed_at":"2026-07-10T12:47:05.545575Z","title":"Video Generators are Robot Policies","venue":"cs.RO","work_id":"0941f8fe-e893-4e3a-9ac6-0a72f26340e9","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2508.00795","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:a1e390e24fdfa10f02824a3f7d6c6d6b1a6b673b74bbada0e6fe8a327bcc15eb","observation_id":"e425b275-8049-45a8-a1c3-32dbf2236fc9","resolution":{"observed_at":"2026-07-10T12:47:05.546793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":"2503.00200","doi":"10.48550/arxiv.2503.00200","metadata_source":"pith","pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified Video Action Model","venue":"cs.RO","work_id":"fb4cc512-d1d9-40f4-8854-d35950ad20b3","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:5a2278780ea0a3f03c4d245c482fc4b296ccce8e8389a2df3dc9a8b789a8fb6b","observation_id":"6648688e-f1db-49cd-bc99-a6ccec198f6c","resolution":{"observed_at":"2026-07-10T12:47:05.509131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-08-10T02:54:28.264405Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"cited_work":{"arxiv_id":"2504.02792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.02792","snapshot_observed_at":"2026-07-10T18:47:31.709153Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","venue":"cs.RO","work_id":"c181dcf1-e774-4216-a30e-e55c3f3a766c","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2504.02792","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:b5057806480b8e7b59c7d733936962f04cb10c4ff365aeb12c6e6bcde1fd2d28","observation_id":"85df1479-7164-453d-82f9-3284f23323a1","resolution":{"observed_at":"2026-07-10T12:47:05.514716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10942","last_updated":"2026-05-11T17:59:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T17:59:56Z","title":"HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models","version":1},"cited_work":{"arxiv_id":"2605.10942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.10942","snapshot_observed_at":"2026-07-10T12:47:05.504971Z","title":"HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models","venue":"cs.RO","work_id":"355a51ce-90ea-4eb0-95fc-156dfcf68c7b","year":2026},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2605.10942","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:a7c33cfcbb739eb3c88f67d612406f840b58d36da1c5c21db09638a1638a98f3","observation_id":"119570ee-d95f-4a2c-8c80-a09a675dd0c9","resolution":{"observed_at":"2026-07-10T12:47:05.506373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:2b0f75705fc145ec09aec159cb81819b0dae49348b3752a76592ff2b200745ff","observation_id":"ae5b983d-ec53-4a84-834d-1810d045c465","resolution":{"observed_at":"2026-07-10T12:47:05.534791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":"2306.03310","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-07-10T23:17:45.328655Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","venue":"cs.AI","work_id":"662203ad-084f-42c4-8e60-977b3173755b","year":2023},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:0e2f7e08af190d35f62c6370919902efd4966bf5bcc892cbeabcbbf28ba9bbe3","observation_id":"cf025dc6-2d68-4683-901a-987c461353f7","resolution":{"observed_at":"2026-07-10T12:47:05.567257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:b8857f33b43547590fb3da2ae20916ca975781e879dd2c313c8ae51a49abd36c","observation_id":"93a57ddc-8b9b-44ab-9eef-a8c52b342bf9","resolution":{"observed_at":"2026-07-10T12:47:05.511778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:c3e4c86fef7d73baf4be522d798ce5e7c411400cba63fb9d446a55c08e4e0bef","observation_id":"ba1f6ce2-5e42-4d8f-9378-99e9e39cef01","resolution":{"observed_at":"2026-07-10T12:47:05.539606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:f6ec48330684f1ec66ec6d44b0c8edc536eb5237dc96e212ebc88157139a5b3f","observation_id":"76f30340-bcbc-4b11-9271-5033697f6d61","resolution":{"observed_at":"2026-07-10T12:47:05.537323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:47:05.901243Z","title":null,"venue":null,"work_id":"f9303f75-6657-461f-9fb0-0623f28c7afd","year":2022},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:a57e1436b086e10b666b79f1de2ab7ed08570fe3d071058b4c3636e52ed9f28f","observation_id":"5ee671f5-8511-4a4f-9047-5d9e46ee5bb8","resolution":{"observed_at":"2026-07-10T12:47:05.902324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:47:05.897940Z","title":"Allshire, H","venue":null,"work_id":"d962df3c-556b-44b6-acbe-1cd33764f402","year":2026},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:b70773f395953df5d8492d68d7c24b4afddc899464884fa2a6cdf824515f4f41","observation_id":"8d8e7162-f456-4812-8941-dd3894b7eab1","resolution":{"observed_at":"2026-07-10T12:47:05.899057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:51be175ddd0c15e407c90ed3f3e9ace219b199f865afc2779aadac209c49ff3f","observation_id":"c0bab24a-a2fe-49fe-b439-659ced80e24a","resolution":{"observed_at":"2026-07-10T12:47:05.561751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":"2604.15483","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-07-10T19:47:32.631418Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","venue":"cs.LG","work_id":"7391297f-4dff-465c-9790-cb760a2c0542","year":2026},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:7abba187ee291d819861c573a69d135d2d5845035b058a9f451a6fcbb032905f","observation_id":"a25d479e-4054-4ac3-88f9-d0e92f01adb1","resolution":{"observed_at":"2026-07-10T12:47:05.541892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:f12ed3e0e14726682355140841f530bca68eca07457839cff9a55c6e752d0641","observation_id":"0c953de5-f6c6-431c-b3fa-3cf6a6e11f08","resolution":{"observed_at":"2026-07-10T12:47:05.581716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-10T15:50:18.915523Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":"2503.20020","doi":"10.48550/arxiv.2503.20020","metadata_source":"pith","pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini Robotics: Bringing AI into the Physical World","venue":"cs.RO","work_id":"f7c5ce10-8364-4fbe-964f-2802b81c3a98","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:e0910eb50a7e87d4a40f39258c1e33463e2c4c209e1492c1d79bc5883ae9bbcb","observation_id":"5aae95c2-6358-4849-a1b5-1cc64ff5ce6a","resolution":{"observed_at":"2026-07-10T12:47:05.569714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:db902cffa1c9e1375e12fa1c3dc9a19547ed1632f6d83a2b676d9d8ea5b272d3","observation_id":"88039e0d-e590-4bef-9e81-6e2a5f164489","resolution":{"observed_at":"2026-07-10T12:47:05.529649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"cited_work":{"arxiv_id":"2505.12705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12705","snapshot_observed_at":"2026-07-10T12:47:05.582841Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","venue":"cs.RO","work_id":"8f44bbac-2812-4198-83bb-f6c857664a1d","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2505.12705","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:162eecdc5ed30c17832e9aa72a0eb729268a2a965a4533c7b08be69684190724","observation_id":"3e3ac415-6f0c-4858-93ef-06033387c0b8","resolution":{"observed_at":"2026-07-10T12:47:05.584082Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:47:05.891737Z","title":null,"venue":null,"work_id":"7cceee13-b121-4117-864f-698432604985","year":2023},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:32c34d0d24642a445b1886ff587a6d17a9ce6d90a80e3f2257d4eb30f9e50252","observation_id":"7c21f787-bf7a-49e4-b2bf-0959537f9cef","resolution":{"observed_at":"2026-07-10T12:47:05.892785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:47:05.893306Z","title":null,"venue":null,"work_id":"96ed127b-f19c-44f5-a02e-e8ca64f95dfd","year":2024},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:4b56bf1a66abb90f5fc489e5bd6b88117a0465e0167e85e953dec59bfda67794","observation_id":"9ffc32f5-b351-4610-9bff-b70fb62a930e","resolution":{"observed_at":"2026-07-10T12:47:05.894338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15840","last_updated":"2026-05-08T06:37:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:35:54Z","title":"Large Video Planner Enables Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":"2512.15840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15840","snapshot_observed_at":"2026-07-10T18:47:31.628749Z","title":"Large Video Planner Enables Generalizable Robot Control","venue":"cs.RO","work_id":"6f56b125-35ab-41da-aa0c-d118d706bf3a","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2512.15840","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:00b45ee8404b74a2ed2c92bcc1a6e2c8ae3801f9287894abb5f3bd438b59a7c4","observation_id":"4ce004e7-9966-4ce6-84fa-a0cb7feec697","resolution":{"observed_at":"2026-07-10T12:47:05.574217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:ad400559794f52209ee574bd63ebb227bc439f312782bb214dcd3d9a1647d452","observation_id":"1646ba38-3341-4f1c-b8c4-21a73701216f","resolution":{"observed_at":"2026-07-10T12:47:05.527123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:47:05.890226Z","title":null,"venue":null,"work_id":"6607c251-9fc1-4f6c-9bb6-25c9db743fe1","year":2024},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:4785f772de4540024cde7a338b026f8ae27cfbe089e7f81b8e8f8c9386f49dd7","observation_id":"c53af64e-4281-454b-ac54-17f970c39245","resolution":{"observed_at":"2026-07-10T12:47:05.891233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-08-10T09:12:51.490663Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"cited_work":{"arxiv_id":"2505.15659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15659","snapshot_observed_at":"2026-07-10T12:47:05.520966Z","title":"FLARE: Robot Learning with Implicit World Modeling","venue":"cs.RO","work_id":"0734908a-7122-4eeb-ba5d-944092bb8897","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2505.15659","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:d9b2591e137cafd0f02aa276ac2580eb4f74ae2ca5064f42ec2b09257ac98616","observation_id":"1f0ba7d0-abb0-4d0d-b9bf-f5cebd2f52bc","resolution":{"observed_at":"2026-07-10T12:47:05.522176Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:47:05.888763Z","title":null,"venue":null,"work_id":"d4c23952-bc34-4600-8481-c456b1d5ced1","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:49797846183709a7699b3a19059dbbb27ff38821f35f31f57537923449506abe","observation_id":"efba3a3c-96db-48a5-b9da-4bf06ba54e41","resolution":{"observed_at":"2026-07-10T12:47:05.889751Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:47:05.515804Z","title":"Latent action pretraining through world modeling","venue":null,"work_id":"ab4c04ef-2ffc-419a-bca8-0513d138ce0a","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:c8219caf28e96e08b39dcd3056c6cb13146738d3191d72dadf6049113d2fb023","observation_id":"9f503122-785c-4ede-b7fe-13c6512d9006","resolution":{"observed_at":"2026-07-10T12:47:05.517225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":"2412.14803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-07-10T12:47:05.518340Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","venue":"cs.CV","work_id":"62dbe235-8473-4190-8686-17e7437de50f","year":2024},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:163af8f6e53ec2c0bd5a0c5851006c5188be78af61985d1ae33bbc53112e9431","observation_id":"956c4601-37bd-440f-b7b0-a58d5e72f647","resolution":{"observed_at":"2026-07-10T12:47:05.519659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2026.367399","doi":"10.1109/lra.2026.3673995","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"IEEE Robotics and Automation Letters","work_id":"6791ae46-31ad-4310-af27-eef330347167","year":2026},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:b6c1abe743ac3dc61ca7d9b1a67ee6dbf59e14ef1edc5d27c8fbae15af52452c","observation_id":"e0883932-3c60-41e6-a635-1e501f71bcf6","resolution":{"observed_at":"2026-07-10T12:47:05.329352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:47:05.902889Z","title":"Luo and Y","venue":null,"work_id":"b1eb594b-7c27-4f7e-bd1c-5290764f300f","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:a1d9070a89678311445e5278d7baa410df843deda44441a1e993d2b98d439aa3","observation_id":"343a4f4f-0ab6-4c17-bb74-b7c246befdcf","resolution":{"observed_at":"2026-07-10T12:47:05.904034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09336","last_updated":"2025-07-25T21:42:43Z","snapshot_observed_at":"2026-08-07T04:10:49.606943Z","submitted_at":"2023-10-13T18:00:59Z","title":"Compositional Abilities Emerge Multiplicatively: Exploring Diffusion Models on a Synthetic Task","version":5},"cited_work":{"arxiv_id":"2310.09336","doi":"10.48550/arxiv.2310.09336","metadata_source":"pith","pith_arxiv_id":"2310.09336","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dick, and Hidenori Tanaka","venue":"cs.LG","work_id":"77baa306-d67f-48d3-b0c4-25f77a913ef7","year":2023},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2310.09336","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:6ae7f096e89bc5312c0db4dde9e9ac715a3b74a85139cac2dd5f1cc2b017941b","observation_id":"ee59728f-c168-4ed6-890f-7e593d1c1079","resolution":{"observed_at":"2026-07-10T12:47:05.544416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:47:05.896452Z","title":"Wiedemer, P","venue":null,"work_id":"c36937aa-0079-4832-92b1-26527fa647e7","year":2023},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:4bf37003022e50e4fe08816053be3986912cc273fb57a3b544ce14ce9f43ae39","observation_id":"0cc8e357-cc85-4784-9fa4-96f51c9fc9dc","resolution":{"observed_at":"2026-07-10T12:47:05.897441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:47:05.899663Z","title":"noise level","venue":null,"work_id":"daa01507-f0aa-48d7-bca4-37e870e46106","year":2025},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:f925204d43904e5f07580af683dff3a6b1d0c9c4e8e855f28b6f5f786325d595","observation_id":"5970d5d0-54cb-42ae-b726-ef78b8acc3e8","resolution":{"observed_at":"2026-07-10T12:47:05.900690Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":37,"verified_fuzzy":4},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 1 inbound Pith citation observation for arXiv:2607.08127."}