{"as_of":"2026-08-16T22:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef87028b5067d49fec23c87a9625a9f017fa854dece000ba35425ca0bf1a335f","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:14:51.731026Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:26:09.241377Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:09:43.333762Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-08-05T20:31:36.552950Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-15T15:38:07.042671Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:36.552950Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2508.10399"},"observation_digest":"sha256:97c323798c66286f2c492bda84a594fdbd68fb1dfd2a2007b669d86c2aa28e3f","observation_id":"da9aa6c4-60e5-45c7-9ff8-4f003dadc063","resolution":{"observed_at":"2026-08-05T20:31:36.552950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2507.14049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-07-04T09:09:43.333762Z","title":"arXiv preprint arXiv:2507.14049 (2025)","venue":null,"work_id":"efe30499-6376-4c04-bc80-f2d79bb17c40","year":2025},"citing_paper":{"arxiv_id":"2511.18082","last_updated":"2026-04-13T14:33:40Z","snapshot_observed_at":"2026-08-11T02:22:51.293115Z","submitted_at":"2025-11-22T14:44:03Z","title":"ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T06:07:42.311608Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2511.18082"},"observation_digest":"sha256:4871d70eadba83252a322244d3f69f403dd5bfa6adc64cb5d912b4b515440000","observation_id":"54c57a68-59f9-4697-a2a0-c616ee2cd437","resolution":{"observed_at":"2026-05-17T06:09:09.496820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-08-03T09:07:41.041488Z","title":"Edgevla: Efficient vision- language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.14945","last_updated":"2026-06-24T08:09:11Z","snapshot_observed_at":"2026-08-03T09:07:37.767508Z","submitted_at":"2026-01-21T12:43:11Z","title":"TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T09:07:41.041488Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2601.14945"},"observation_digest":"sha256:b4de9f06304e5da5bc82d7982e1ee290283312ea1f24d07bb1f69fda444d7c33","observation_id":"f7bbf31f-8fc3-4012-ace2-eedf8b7042b9","resolution":{"observed_at":"2026-08-03T09:07:41.041488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2507.14049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-07-04T09:09:43.333762Z","title":"arXiv preprint arXiv:2507.14049 (2025)","venue":null,"work_id":"efe30499-6376-4c04-bc80-f2d79bb17c40","year":2025},"citing_paper":{"arxiv_id":"2603.01581","last_updated":"2026-04-27T12:47:49Z","snapshot_observed_at":"2026-08-16T01:41:25.937044Z","submitted_at":"2026-03-02T08:12:03Z","title":"KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T18:39:58.095112Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2603.01581"},"observation_digest":"sha256:56e14d5aac00af763ab71b6f5f2ddd8196ba3e448e0b8624b9059300af33f044","observation_id":"d8f0805e-1214-469c-9032-b9c6bbcbe125","resolution":{"observed_at":"2026-05-15T18:40:14.582101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2507.14049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-07-04T09:09:43.333762Z","title":"arXiv preprint arXiv:2507.14049 (2025)","venue":null,"work_id":"efe30499-6376-4c04-bc80-f2d79bb17c40","year":2025},"citing_paper":{"arxiv_id":"2603.17573","last_updated":"2026-04-27T12:41:06Z","snapshot_observed_at":"2026-08-11T12:57:12.574965Z","submitted_at":"2026-03-18T10:25:08Z","title":"HeiSD: Hybrid Speculative Decoding for Embodied Vision-Language-Action Models with Kinematic Awareness","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T09:15:50.963123Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2603.17573"},"observation_digest":"sha256:7b1bb9a8f7de42a44bc340df76dc39cbd862fe72a2357e4bb17d4b4de7029179","observation_id":"6bf5f007-1226-4aec-bbca-a9fb2570e77d","resolution":{"observed_at":"2026-05-15T09:19:54.424179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2507.14049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-07-04T09:09:43.333762Z","title":"arXiv preprint arXiv:2507.14049 (2025)","venue":null,"work_id":"efe30499-6376-4c04-bc80-f2d79bb17c40","year":2025},"citing_paper":{"arxiv_id":"2603.19199","last_updated":"2026-05-16T06:32:19Z","snapshot_observed_at":"2026-08-10T22:18:18.061068Z","submitted_at":"2026-03-19T17:51:37Z","title":"FASTER: Rethinking Real-Time Flow VLAs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T08:02:13.188363Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2603.19199"},"observation_digest":"sha256:4f026a9c463a688622352c3277b34640b4b3cad3fbca18a49e448d895ddb1b88","observation_id":"002d6968-f493-4674-985d-6952177d4333","resolution":{"observed_at":"2026-05-15T08:05:15.140852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2507.14049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-07-04T09:09:43.333762Z","title":"arXiv preprint arXiv:2507.14049 (2025)","venue":null,"work_id":"efe30499-6376-4c04-bc80-f2d79bb17c40","year":2025},"citing_paper":{"arxiv_id":"2603.19199","last_updated":"2026-05-16T06:32:19Z","snapshot_observed_at":"2026-08-10T22:18:18.061068Z","submitted_at":"2026-03-19T17:51:37Z","title":"FASTER: Rethinking Real-Time Flow VLAs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T10:48:56.280105Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2603.19199"},"observation_digest":"sha256:e69a03a89e87322588cfcfd7e8173e08c6b9e14eede35c0bfe2b6562ecfdfaa8","observation_id":"50cac3e0-43bd-4d76-9562-69ca0c71d509","resolution":{"observed_at":"2026-05-21T10:50:01.129618Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2507.14049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-07-04T09:09:43.333762Z","title":"arXiv preprint arXiv:2507.14049 (2025)","venue":null,"work_id":"efe30499-6376-4c04-bc80-f2d79bb17c40","year":2025},"citing_paper":{"arxiv_id":"2604.05672","last_updated":"2026-04-15T03:34:03Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T10:18:40Z","title":"A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:23.255452Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2604.05672"},"observation_digest":"sha256:230968e264afd496ef6054ed20b2e37fc647175c158ecd9f6706db8ab7d7c5c7","observation_id":"763f57ef-d2b5-480a-bad2-867d8b36c257","resolution":{"observed_at":"2026-05-10T22:50:51.536005Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2507.14049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-07-04T09:09:43.333762Z","title":"arXiv preprint arXiv:2507.14049 (2025)","venue":null,"work_id":"efe30499-6376-4c04-bc80-f2d79bb17c40","year":2025},"citing_paper":{"arxiv_id":"2606.22540","last_updated":"2026-06-25T01:18:44Z","snapshot_observed_at":"2026-08-13T19:54:38.163011Z","submitted_at":"2026-06-21T14:54:07Z","title":"PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T10:27:00.283283Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2606.22540"},"observation_digest":"sha256:eca595cd0a6ceb5350cbad00fe6abfbf8fbf5c4eb516b0cb72bf5546ecd2bf19","observation_id":"9c12160e-3380-4ccd-b26b-127e60ada1c1","resolution":{"observed_at":"2026-07-04T09:09:43.335102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-08-15T20:26:09.241377Z","title":"arXiv preprint arXiv:2507.14049 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12932","last_updated":"2026-08-13T08:10:54Z","snapshot_observed_at":"2026-08-16T22:10:47.512089Z","submitted_at":"2026-08-13T08:10:54Z","title":"FlashDrive: Flash Vision-Language-Action Inference for Autonomous Driving","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T20:26:09.241377Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2608.12932"},"observation_digest":"sha256:f4f59b35086f66fd55b964635e54273846aec68b439003e3f8b6ff630ba4601c","observation_id":"38a9c4d0-2bbf-41ba-83b6-b07b40aa5dc0","resolution":{"observed_at":"2026-08-15T20:26:09.241377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.14049/citation-record","integrity":"/paper/2507.14049/integrity","json":"/paper/2507.14049/citation-record.json","paper":"/paper/2507.14049"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:52.108615Z","title":null,"venue":null,"work_id":"8af090e3-3152-4205-9fdc-df0d5d6d97cc","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.643918Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:037c96ce9654fa0e339bbd1f4b5fcce83ba0411c0576a18ae2394912f7a08b29","observation_id":"fcc61c4b-b9e6-4380-a4cb-ea1bec758bb6","resolution":{"observed_at":"2026-08-06T16:14:52.114122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:52.085372Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control, 2023","venue":null,"work_id":"2ea3a6e3-e46b-40a9-9462-b362ffae0491","year":2023},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.649176Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:4b360415cfebab6041527528b5b288580f08862c526d02f282c825b595f986ad","observation_id":"7cabeaff-8ea3-401f-bf07-ce88bd2fdb57","resolution":{"observed_at":"2026-08-06T16:14:52.093783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.653392Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.653392Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:5cd6d879cfef8b19df3056e0651d4e5c7468644775c4cfa6ca89b3c9c0208cd4","observation_id":"4b55040a-e5e3-4fa9-bc2f-ea89ea386e74","resolution":{"observed_at":"2026-08-06T16:14:51.653392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:52.057904Z","title":null,"venue":null,"work_id":"c9fa2f84-0bbc-4572-86ee-e21312e87533","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.658018Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:6a44dd6073ba8f6c6b5ab73cc159fed5990a9488d48f151bee82d234fadfe73f","observation_id":"b4339069-68af-4cb4-90d1-244af27c6055","resolution":{"observed_at":"2026-08-06T16:14:52.062527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.663390Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.663390Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:e65d914ccfa26bc5f39c614f572be560fff48743345dd5f239dee1538c517a4d","observation_id":"1d2cb8fd-f9c3-4f45-9572-544ca6f370f6","resolution":{"observed_at":"2026-08-06T16:14:51.663390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:52.024821Z","title":"Zhao, and Chelsea Finn","venue":null,"work_id":"8781b5f6-30cf-4207-8c84-0d6870764e77","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.668497Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:eeb2bf6c52567797aa223ec4f7e36c0c47f8d208ef6fa4168e24bc53109fe29b","observation_id":"e58dc51b-1e4d-4ff7-a6ae-16b7d2198660","resolution":{"observed_at":"2026-08-06T16:14:52.030724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:52.000032Z","title":"Flexattention: The flexibility of pytorch with the performance of flashattention, 2024","venue":null,"work_id":"618a2269-a2e8-4969-8642-e6bb3acab116","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.673240Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:91155514a1cc1bef57c5bbf348f1105fa6d742a6e4da79ea017e61b4556b04f5","observation_id":"017e0517-d1c4-42a9-828b-8ecd93c5d542","resolution":{"observed_at":"2026-08-06T16:14:52.006801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.973644Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models, 2024","venue":null,"work_id":"19b123b2-8370-48fc-b224-5238070957e7","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.677745Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:76614d414574f47b990c2254ca4b31b92b3d72d883f87de8ebe9c024338382dd","observation_id":"ba47cdc3-8731-48ee-8c30-bbe99711d169","resolution":{"observed_at":"2026-08-06T16:14:51.978880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.956039Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":"5a157ed4-9357-44fc-a87e-68476d2f83bb","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.681757Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:258937a498239f3ccea9780af14a0c954c993f925257a16c84b5724fab1da030","observation_id":"7cb397e5-b48b-4eb7-82f4-501a6295911a","resolution":{"observed_at":"2026-08-06T16:14:51.960675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.938851Z","title":"Jin Kim, Nur Muhammad Mahi Shafiullah, and Lerrel Pinto","venue":null,"work_id":"6997df1a-d368-4981-b0d6-c1e6a21fc367","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.686592Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:9183e0e7c1acab89da22613d417a1135bbd112d085f1f803d2c35a2430168400","observation_id":"f1bd67e5-551e-4282-8c46-95159e0ca72b","resolution":{"observed_at":"2026-08-06T16:14:51.943638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.691041Z","title":"Video-llava: Learning united visual representation by alignment before projection, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.691041Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:d336251e5ae8e71ec036a5d8f5719dafb23c30549138a7db317efc8c74515228","observation_id":"724075ea-6e53-4700-bb1e-5d6264548882","resolution":{"observed_at":"2026-08-06T16:14:51.691041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.910970Z","title":"Dinov2: Learning robust visual features without supervision, 2024","venue":null,"work_id":"aa1f41b3-d992-4580-b9c6-a362b90a217b","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.694992Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:94bb9add73419b72d1fc02264b1e51d95e96d1427c6e185ae7918df9f0246b77","observation_id":"5e746a9c-9553-41a7-a8eb-28ae70598b29","resolution":{"observed_at":"2026-08-06T16:14:51.916406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.890722Z","title":null,"venue":null,"work_id":"2af15f26-5760-4c94-b16b-2d96b2661ed9","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.699660Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:6a77ddcd8752b3f9a21532de333c0a97d711f0a14d633f4012c2c363ea8f543e","observation_id":"b33b3167-bea9-4fad-9bea-eae5ff169748","resolution":{"observed_at":"2026-08-06T16:14:51.895106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.873368Z","title":null,"venue":null,"work_id":"f14eee63-404b-4bf5-9cde-f3bdb03a4c1d","year":2018},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.704415Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:0fd8c52416832f4478e805e4449415badefe7ee89bf1aa5bd5161244fcca4cac","observation_id":"bb728f67-722d-45f1-a62c-cd881427c286","resolution":{"observed_at":"2026-08-06T16:14:51.878082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.852727Z","title":"Bridgedata v2: A dataset for robot learning at scale, 2024","venue":null,"work_id":"835a6f03-2393-4d40-9318-1651bb0ece8b","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.708513Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:9addd1b872e36909ab78fe94b8d0e03a9a13d7e1416ccc3beb3daf9d9f751de4","observation_id":"18e69dac-09a5-407c-b9f2-59e05049e314","resolution":{"observed_at":"2026-08-06T16:14:51.861172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.712660Z","title":"Bitnet: Scaling 1-bit transformers for large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.712660Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:74ac5747978f457449e9c0490b89e56a547b3a1b9eb11c4e1e597212ed86fda9","observation_id":"26f78f88-05c1-42de-913f-ab7c8125e026","resolution":{"observed_at":"2026-08-06T16:14:51.712660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.716782Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.716782Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:ccefe7f7ecf9b5761b037a7d41a72bf43a8808d7d72bc11720ff90f057e08916","observation_id":"259752fe-5b07-4191-99a8-1d85cd21750f","resolution":{"observed_at":"2026-08-06T16:14:51.716782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.804800Z","title":"Homerobot: Open-vocabulary mobile manipulation, 2024","venue":null,"work_id":"3c1e4017-cf31-4373-9d38-7d5dd1705bff","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.721214Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:1045c07ef7aea6dd9b3aa2e7a479fb7df90929f9fc80805f27ba43bf296eed78","observation_id":"b5798ae5-359a-4d01-b392-842f0dd672d9","resolution":{"observed_at":"2026-08-06T16:14:51.814516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.725819Z","title":"Sigmoid loss for language image pre-training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.725819Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:88896711ae30576e7d7dcb95d54bafb7ef408be4195d1918fe5d5942bc94a976","observation_id":"7d9cf56f-60fe-4b63-a7e9-e3e93e31a559","resolution":{"observed_at":"2026-08-06T16:14:51.725819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.766843Z","title":"Zhao, Vikash Kumar, Sergey Levine, and Chelsea Finn","venue":null,"work_id":"5d7cfc93-e46e-407d-8df1-d1b548a03813","year":2023},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.731026Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:25debdba366f2e2990f9e48ffcda040fad42f27f6026371fa0685ba641b0ae66","observation_id":"56a71ae0-c734-48bb-9384-25db405ab0a4","resolution":{"observed_at":"2026-08-06T16:14:51.774308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 10 inbound Pith citation observations for arXiv:2507.14049."}