{"as_of":"2026-08-08T20:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23eb9377c0159375cc46621680e3cf154d48c0d000c44fc06b73080f2c838a62","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:30:03.258938Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05738/citation-record","integrity":"/paper/2608.05738/integrity","json":"/paper/2608.05738/citation-record.json","paper":"/paper/2608.05738"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.565218Z","title":"IEEE Transactions on Neural Networks and Learning Systems , year=","venue":null,"work_id":"42a05183-78a3-479a-9971-9a2326d31d61","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.006647Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:72afe3e56558ecae01750b13a598b24f482ce391bb7460d0f22987a35733b680","observation_id":"f7eb6eb6-0e15-47ef-8527-cdc713ce9b0c","resolution":{"observed_at":"2026-08-08T00:30:04.570439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20100","last_updated":"2026-04-23T04:10:40Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-22T01:51:48Z","title":"JoyAI-RA 0.1: A Foundation Model for Robotic Autonomy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20100","snapshot_observed_at":"2026-08-08T00:30:03.014525Z","title":"arXiv preprint arXiv:2604.20100 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.014525Z"},"links":{"cited_paper":"/paper/2604.20100","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:aba3d17895c216572557395b4f57f269642e4a702f501fd2ae1d698e8d029eda","observation_id":"987ca5b0-57c6-471e-b0e4-7f1e53de1289","resolution":{"observed_at":"2026-08-08T00:30:03.014525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-08T00:30:03.020883Z","title":"arXiv preprint arXiv:2406.09246 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.020883Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:e491d1b93efd258dec614497c7770f122a1fbc0d048c9431216b248c54a74fd1","observation_id":"fa45f4ed-4fb9-453b-b8b6-afb419116e19","resolution":{"observed_at":"2026-08-08T00:30:03.020883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.028302Z","title":"Proceedings of the 60th annual meeting of the association for computational linguistics (volume 1: long papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.028302Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:32d5b00177f3aed0c1a6a4b011792cc0337d8018255efa41079dc8ce0e788d33","observation_id":"7082172c-ce99-4768-a7f8-66ccfcb83440","resolution":{"observed_at":"2026-08-08T00:30:03.028302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.034197Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.034197Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:0a4262647c7bb7cb9a53ae95c9f50aee4bafc22211bf939223cb1312aacbfd33","observation_id":"4ca46f22-ed91-4dab-a9d0-b77ea41e4422","resolution":{"observed_at":"2026-08-08T00:30:03.034197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-08T00:30:03.040411Z","title":"arXiv preprint arXiv:2204.01691 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.040411Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:fc1f7f236d7d9b4c6f9d2b3e620e476b79ad4b8b5ef0bdd4f253e8faa0d733b3","observation_id":"e6bbec38-f956-48dc-b36b-dec14083be3a","resolution":{"observed_at":"2026-08-08T00:30:03.040411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.047791Z","title":"2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.047791Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:c1b257ff10523e5dd733708c1a8e0341d74d7d378ce0e6f4a738b743d2327aa0","observation_id":"183a0138-3ca1-4870-b752-101aba51a2c4","resolution":{"observed_at":"2026-08-08T00:30:03.047791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-07T13:53:18.158133Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-08-08T00:30:03.053598Z","title":"arXiv preprint arXiv:2505.20289 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.053598Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:3bb6176bf8af03fca7f7f60a75de123a400285c7a25779dacc4fef57e4839180","observation_id":"2ecdc0a2-7efb-4598-a93b-4def83e45495","resolution":{"observed_at":"2026-08-08T00:30:03.053598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.510924Z","title":"NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI , year=","venue":null,"work_id":"dbcdb4d0-0c99-4375-8a64-7c04b9c2e271","year":2025},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.059312Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:a8cf3fcb14a47f322beb99a4bd7797cd459be6784160e3f6dffa79b4a2273de7","observation_id":"939750d8-1c9e-4f39-83ce-3080f9eb4076","resolution":{"observed_at":"2026-08-08T00:30:04.516393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.491929Z","title":"9th Annual Conference on Robot Learning , year=","venue":null,"work_id":"515864b6-b053-4f2c-ab1b-ad553ca14aa7","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.064459Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:ba3f7751365457bbe15139a0cfdd3a914b7b85b187fb6b530bb837670fafcf86","observation_id":"5812d0e6-efe0-49fa-8938-448723d2313a","resolution":{"observed_at":"2026-08-08T00:30:04.498202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-08-08T00:30:03.069585Z","title":"arXiv preprint arXiv:2508.19236 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.069585Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:25ad5b690b0f73e7b18ca5ec0a34197071d9ccad9bb3da519b2806c1d7338529","observation_id":"fd67b1d6-3ee6-447b-ae0b-1e4aeee59680","resolution":{"observed_at":"2026-08-08T00:30:03.069585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.474306Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":"046a2294-a5dc-4a1e-a8ad-5969fb81d396","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.075063Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:e3dff5753059e216b14f27e0307424b044acdafc9552bace9a6e78a4f8a3d360","observation_id":"d4782cff-fe70-40e2-962c-80cd24031efb","resolution":{"observed_at":"2026-08-08T00:30:04.479702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-08T00:30:03.081177Z","title":"arXiv preprint arXiv:2303.03378 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.081177Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:6ee75de74e9c4e652161f1837616f192777f94b8ac56934a8babc51c23e6cddb","observation_id":"36f58bce-f1f6-4c18-adfe-381d103a2ba4","resolution":{"observed_at":"2026-08-08T00:30:03.081177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-08T00:30:03.086780Z","title":"arXiv preprint arXiv:2307.05973 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.086780Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:f0e47183a9e9fa8f6de1f4e91a059f02522f38855f63a914065c1dca87859228","observation_id":"d78a3072-537f-4a59-9a36-aa028beb1cca","resolution":{"observed_at":"2026-08-08T00:30:03.086780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-08T00:30:03.092074Z","title":"arXiv preprint arXiv:2207.05608 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.092074Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:93f7d0e2e6cd3adce7152d0dd6cc3d2de4d80f1e7ab40ab29fc4b7ee1c1b3111","observation_id":"4170b60c-f2a6-4a5a-93d4-35a4a86896e0","resolution":{"observed_at":"2026-08-08T00:30:03.092074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04069","last_updated":"2026-06-01T16:57:23Z","snapshot_observed_at":"2026-08-03T18:42:08.737584Z","submitted_at":"2025-12-03T18:50:04Z","title":"SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04069","snapshot_observed_at":"2026-08-08T00:30:03.097660Z","title":"arXiv preprint arXiv:2512.04069 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.097660Z"},"links":{"cited_paper":"/paper/2512.04069","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:ab4971bf2236193035c889a97573cf7c7f835c6ec944df735a6e816e3bd01aaa","observation_id":"2b43020b-bb89-4179-b01b-d18a17b3eb1f","resolution":{"observed_at":"2026-08-08T00:30:03.097660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13119","last_updated":"2026-05-13T07:40:34Z","snapshot_observed_at":"2026-08-01T14:15:33.557028Z","submitted_at":"2026-05-13T07:40:34Z","title":"Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13119","snapshot_observed_at":"2026-08-08T00:30:03.103238Z","title":"arXiv preprint arXiv:2605.13119 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.103238Z"},"links":{"cited_paper":"/paper/2605.13119","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:ccf14f3e1abd5f30e6a442216887e2e25036117c39690a90df1ed8a168684ac8","observation_id":"1b5ba0d2-d480-4540-a2ae-53b7041dfae8","resolution":{"observed_at":"2026-08-08T00:30:03.103238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.01166","last_updated":"2026-05-08T03:58:29Z","snapshot_observed_at":"2026-07-06T22:44:00.266269Z","submitted_at":"2026-02-01T11:34:37Z","title":"Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.01166","snapshot_observed_at":"2026-08-08T00:30:03.108171Z","title":"arXiv preprint arXiv:2602.01166 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.108171Z"},"links":{"cited_paper":"/paper/2602.01166","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:916855625c17bea0e020e1674031f47e711069847004399bca965e0099e04265","observation_id":"bca905dc-e752-4eab-93fa-e195838f3fb6","resolution":{"observed_at":"2026-08-08T00:30:03.108171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.455342Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"70913d4e-da53-4186-b334-3e66423e8532","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.113661Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:d0be2b485d389d49c32c7bc55f50c5586eb4b42218ae314f16cdc213e84bccb5","observation_id":"c23256b3-56ad-49d2-be2e-0c730d7a4f1a","resolution":{"observed_at":"2026-08-08T00:30:04.461262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.118707Z","title":"arXiv preprint arXiv:2601.11404 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.118707Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:dabbbea38dceb8ddba26089c42aa615a7c60fb08c7cde7626b0f72bef33760fb","observation_id":"aac46958-56d6-4430-a0de-e5471dff2a8d","resolution":{"observed_at":"2026-08-08T00:30:03.118707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.123624Z","title":"arXiv preprint arXiv:2603.22280 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.123624Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:8cd839c16c9eb148e0807f23928dc79cd46687ab0e03af60a6b4c6ea63eb4afc","observation_id":"b73c236e-f001-4b65-a4e7-d42c3af9ab61","resolution":{"observed_at":"2026-08-08T00:30:03.123624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.127765Z","title":"arXiv preprint arXiv:2603.14523 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.127765Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:28b4636065db70a6165d2c5e78334ba976eeba5acc5a998c58342167a0db2448","observation_id":"26b69c93-ab4b-4f41-87db-c949e7e991b6","resolution":{"observed_at":"2026-08-08T00:30:03.127765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.132899Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.132899Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:c34f0dc14c0dd4a9badc6f87154d18327f132065bc256a3732e323d62c0804d8","observation_id":"f3b75b19-ac0b-4eb3-b5f6-da0aac8eba28","resolution":{"observed_at":"2026-08-08T00:30:03.132899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-08T00:30:03.137263Z","title":"arXiv preprint arXiv:2410.24164 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.137263Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:3c7376665aff49936660f97a8e2d24f8005a412b51e998e0427453f85865ab9e","observation_id":"7c618703-eda2-49e8-b18e-84832367434d","resolution":{"observed_at":"2026-08-08T00:30:03.137263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13778","snapshot_observed_at":"2026-08-08T00:30:03.142726Z","title":"arXiv preprint arXiv:2510.13778 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.142726Z"},"links":{"cited_paper":"/paper/2510.13778","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:0f0925c5c4c6791eba931e4e2071972eec1b48cbbeccec6dbd5d85b9659fd401","observation_id":"d394e4ff-3465-491a-8843-6d3bfcb0ddf8","resolution":{"observed_at":"2026-08-08T00:30:03.142726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.428152Z","title":"Forty-third International Conference on Machine Learning , year=","venue":null,"work_id":"743da55c-a25b-4c39-9d21-a4503a37ab29","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.147823Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:9f73256d3c478e1c0c83f2471b42ca05ddab58d2f9050aab312e9002fcd82c19","observation_id":"b95ac65d-b420-4422-8ce7-55c7859b323a","resolution":{"observed_at":"2026-08-08T00:30:04.433143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.153249Z","title":"arXiv preprint arXiv:2602.10098 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.153249Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:2d1015146c0a8c7854440f1c6caf3965b3e220b433f8649119a12d2b249ee73c","observation_id":"37f111f6-d03b-47dc-8e04-8cffaddf19ad","resolution":{"observed_at":"2026-08-08T00:30:03.153249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.412456Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"9de19948-2bdf-4669-8453-d3270ea35380","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.158542Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:f38cdc3d590efb018d9a40421417f743b9c0ba1b7a49382b7ea7802b03681362","observation_id":"0bb6acc2-4fcb-4a27-b008-8d0f96ce7529","resolution":{"observed_at":"2026-08-08T00:30:04.417001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-08T00:30:03.164482Z","title":"arXiv preprint arXiv:2411.19650 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.164482Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:e375b68f8a25d305c0fe079b7a3e76c66b7c60cd58e8049288ab87ecf04711f6","observation_id":"9605a5a1-b880-4e73-9d8b-a298bf1a501a","resolution":{"observed_at":"2026-08-08T00:30:03.164482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.11236","snapshot_observed_at":"2026-08-08T00:30:03.169903Z","title":"arXiv preprint arXiv:2602.11236 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.169903Z"},"links":{"cited_paper":"/paper/2602.11236","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:861af81e0efb17d97c9f57181b308a99b474d577b18bb64206495eec9d58c491","observation_id":"53eece55-de9e-4048-9e66-99fad28bd8ea","resolution":{"observed_at":"2026-08-08T00:30:03.169903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.397099Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"396a1478-2158-4501-958a-d77fc6636b39","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.176272Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:b7746048be1b48627a580ae288db24683dbda49fbbb41bb1c7aa595312a0e946","observation_id":"9bab54ad-2aea-4e55-8cc6-935a0fff07b2","resolution":{"observed_at":"2026-08-08T00:30:04.401760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.181620Z","title":"arXiv preprint arXiv:2512.16793 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.181620Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:32758a15e093ed57857167f1775f3afe90909538edbbf1050714dceed3e31ca6","observation_id":"d26d14f8-be1c-49df-a7d1-c0eb87eb3b33","resolution":{"observed_at":"2026-08-08T00:30:03.181620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.187460Z","title":"arXiv preprint arXiv:2601.14133 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.187460Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:588d9d773b1af325c26549b7587c78beb92d9e593a88dc9df8785d0fb7209f5d","observation_id":"d3eac13e-9ff4-4a6e-83a7-049686782f5b","resolution":{"observed_at":"2026-08-08T00:30:03.187460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06951","snapshot_observed_at":"2026-08-08T00:30:03.192785Z","title":"arXiv preprint arXiv:2509.06951 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.192785Z"},"links":{"cited_paper":"/paper/2509.06951","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:68c8d2700061ae6e7f3397a292e35a5b2eb7b206e39f02f46d708490df82e907","observation_id":"b31fc78e-0ab8-413d-a379-dc434b8a0e3f","resolution":{"observed_at":"2026-08-08T00:30:03.192785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-08T00:30:03.200006Z","title":"arXiv preprint arXiv:2501.15830 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.200006Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:da8edff58e8dca6bb2f637a64de99932cd2016b2c26a9988689216a47f5d4cb3","observation_id":"03e84617-c671-4265-959b-e2c0102bf50e","resolution":{"observed_at":"2026-08-08T00:30:03.200006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.205571Z","title":"The International Journal of Robotics Research , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.205571Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:b321d5e63c997dddddd94c1fa3f2d53e6c7e3828a79aedc151a1874cbc3be812","observation_id":"cac90b40-68a7-4dc2-8389-5d728c22452b","resolution":{"observed_at":"2026-08-08T00:30:03.205571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-08T00:30:03.210982Z","title":"arXiv preprint arXiv:2503.06669 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.210982Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:923bfffbf5e384bcf0be0b14169cafaf429fab0f5089b52980b7e8a2a66c4dbf","observation_id":"10af046f-e2f2-46c3-9b49-32ac84ddabd1","resolution":{"observed_at":"2026-08-08T00:30:03.210982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.216216Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.216216Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:83af5cb844f6a01b1ba27c2c8ab6f2ba77b5f40c6f9c98582080c60d310794f6","observation_id":"fcabc654-5e06-4509-8f56-234e2db5dbec","resolution":{"observed_at":"2026-08-08T00:30:03.216216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.221703Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.221703Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:1c510278a9f059209fc82934bc5a61ea31dc9b4b9f0f830e16dc398bf53884c1","observation_id":"2eae2f62-71b2-429d-8268-38737a1f2000","resolution":{"observed_at":"2026-08-08T00:30:03.221703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-08T00:30:03.227603Z","title":"arXiv preprint arXiv:2405.05941 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.227603Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:b3d0d5f7c1572c2a38f5224989571fecc4e7aa97419e2bccd4f50274c2999fcb","observation_id":"30abe21b-8325-4def-a671-800650bead3f","resolution":{"observed_at":"2026-08-08T00:30:03.227603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-08T00:30:03.233497Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.233497Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:4976719dab8f8e22dbadafd4b6e32b535945e65edbc0c796bbacaf1fc2d3dc4f","observation_id":"795120de-04e2-44e3-b023-8d31416b2d23","resolution":{"observed_at":"2026-08-08T00:30:03.233497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-08T00:30:03.239113Z","title":"arXiv preprint arXiv:2503.14734 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.239113Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:0b1985acb411596b4a7fe9868c7ed6d125afd2f4250f18282c67f4f85bad25b7","observation_id":"d74d6ebf-ad62-4be2-b055-f1c89be2d433","resolution":{"observed_at":"2026-08-08T00:30:03.239113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.340729Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":"80f09b13-7887-4bb1-851f-c66794cced5f","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.244179Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:c609be9db7c937d3fa70a66beb8e6f5e20609b2cd76db4a054386c327edece7a","observation_id":"b0d84f58-b6ef-4187-afb3-b069aafdbe19","resolution":{"observed_at":"2026-08-08T00:30:04.347498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.249206Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.249206Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:db247f1529d6e0ba873511b3f248623d9eddbcba5b5a373faf570595b6e94d4e","observation_id":"4ac47c81-6e3d-4599-a3af-04d185bdae5f","resolution":{"observed_at":"2026-08-08T00:30:03.249206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.253931Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.253931Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:df3638a6091da8cf7f10040ff0fec540309e1c428129cba52d796295fbb9fba4","observation_id":"973885bc-d72e-4e38-8ea7-39073732b0bd","resolution":{"observed_at":"2026-08-08T00:30:03.253931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.258938Z","title":"arXiv preprint arXiv:2602.01067 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.258938Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:ff3dfd6f9511ae21b93d5012f8ed16c78a84520c33d7ffc24e8a171f0c8343df","observation_id":"e9ec2099-f2a6-48dd-a2fa-c8b9eee4228f","resolution":{"observed_at":"2026-08-08T00:30:03.258938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T19:16:48.843450Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2608.05738."}