{"as_of":"2026-08-07T01:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5e076ed2bd9e63a86c6ef09b391b9b263fa68bcac5cbd541ba4403343596e723","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T13:36:04.561551Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24485/citation-record","integrity":"/paper/2607.24485/integrity","json":"/paper/2607.24485/citation-record.json","paper":"/paper/2607.24485"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:02.782724Z","title":"Robotics: Science and Systems XIX , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:02.782724Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:c5aa3afc5750357861f3a8c97a15b0105746dfe8e89e68359246189ffc09e995","observation_id":"5e5a2f82-4ab2-48d9-a96f-c068139f37fe","resolution":{"observed_at":"2026-07-31T13:36:02.782724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:02.843280Z","title":"Robotics: Science and Systems XIX , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:02.843280Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:dfce87e51d0f663aaddbfdfdd3b04511c1d8f66c5bdae87372c03b96291cf322","observation_id":"9c486f9d-a2ca-4531-96df-035c88ae4586","resolution":{"observed_at":"2026-07-31T13:36:02.843280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:02.897215Z","title":"ICRA 2025 Workshop: Beyond Pick and Place , year=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:02.897215Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:a74cedef660245e93af5b7064981eebfa12a7c495300037da92a93b9ba4ac8e3","observation_id":"37d3a780-1e1d-43b0-ae4a-381777763640","resolution":{"observed_at":"2026-07-31T13:36:02.897215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:02.956477Z","title":"Proceedings of the European Conference on Computer Vision (ECCV) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:02.956477Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:9f2e2303b78cb9ef825d704c47137e0dc59107015ab45e978b1a3bbed2c4a11f","observation_id":"a7a8e017-69c4-4b88-b80e-784740e1f76b","resolution":{"observed_at":"2026-07-31T13:36:02.956477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:03.008407Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.008407Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:b0bf84ecb1599384e5adf0f22774bfe3acc9d91be80bdd083fe95caf38ed8e83","observation_id":"8208e8ef-6e6c-4903-bb4c-b24db89c8ae3","resolution":{"observed_at":"2026-07-31T13:36:03.008407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:03.037375Z","title":"Biomimetic Intelligence and Robotics , pages=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.037375Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:57caead3ab885172bb48ef12ee4729560f4ed823c61f6c500220bd8c34ffbe31","observation_id":"c757fb3d-52d0-42f0-86d1-34b01dc13dfe","resolution":{"observed_at":"2026-07-31T13:36:03.037375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-07-31T13:36:03.073699Z","title":"arXiv preprint arXiv:2501.09747 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.073699Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:58f1deafbea6bffde9789d311989f9dc1695cb3620e2c49d5c635be817ef741b","observation_id":"ddc29a7e-3d0a-4485-ba44-61a169e3a9ca","resolution":{"observed_at":"2026-07-31T13:36:03.073699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.23864","last_updated":"2026-06-28T00:20:33Z","snapshot_observed_at":"2026-08-03T13:35:53.078536Z","submitted_at":"2025-12-29T21:06:33Z","title":"Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.23864","snapshot_observed_at":"2026-07-31T13:36:03.131191Z","title":"arXiv preprint arXiv:2512.23864 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.131191Z"},"links":{"cited_paper":"/paper/2512.23864","citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:a8df2f0448707c3b706414944139af2b2467447e89f466f8c6d859f9f40bd268","observation_id":"b55e0335-1d8f-4b7a-a57d-6a9d85a0ebe8","resolution":{"observed_at":"2026-07-31T13:36:03.131191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:03.173446Z","title":"arXiv preprint arXiv:2603.23481 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.173446Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:aa0d158a67ddeef329475d8a7e5a124c4a583d97e8fda9b3af5bc34ef9ee5ce3","observation_id":"9990b1ed-3d19-44e2-bf69-785ba28da3fe","resolution":{"observed_at":"2026-07-31T13:36:03.173446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.08737","last_updated":"2026-06-07T17:18:23Z","snapshot_observed_at":"2026-08-05T06:09:09.261687Z","submitted_at":"2026-06-07T17:18:23Z","title":"Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08737","snapshot_observed_at":"2026-07-31T13:36:03.229385Z","title":"arXiv preprint arXiv:2606.08737 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.229385Z"},"links":{"cited_paper":"/paper/2606.08737","citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:dd068162d727bd476f9f38aebdcf48caf8a72d0827d7662d7b8ea05e361f01b4","observation_id":"51d5c2f8-cf0b-4c73-ad55-b0e7bcb20779","resolution":{"observed_at":"2026-07-31T13:36:03.229385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:03.279945Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.279945Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:5a175bcaf2d40d88aa23b72fac3782eb6379b205a749a0f8519f99fe36ea32a9","observation_id":"5e2809bf-1a37-445c-98f8-fafef2c4ab78","resolution":{"observed_at":"2026-07-31T13:36:03.279945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11048","last_updated":"2026-05-11T13:27:00Z","snapshot_observed_at":"2026-07-06T23:22:57.012338Z","submitted_at":"2026-05-11T13:27:00Z","title":"ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11048","snapshot_observed_at":"2026-07-31T13:36:03.288689Z","title":"arXiv preprint arXiv:2605.11048 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.288689Z"},"links":{"cited_paper":"/paper/2605.11048","citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:3db1e6c606a564a9ec5dd3fae66c718131f3bf3aa78b83d2e3208fa4713e0b1d","observation_id":"44ded5ce-f779-44c5-954e-cac783455766","resolution":{"observed_at":"2026-07-31T13:36:03.288689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:03.345061Z","title":"IEEE Robotics and Automation Letters , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.345061Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:b4de63f831be9b1edc076a8df4efa92fee621c478236f4fc3111c8db311bf6e7","observation_id":"06cb9d94-d9db-42cc-8738-ef09c5a47d26","resolution":{"observed_at":"2026-07-31T13:36:03.345061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09160","last_updated":"2025-07-12T06:44:37Z","snapshot_observed_at":"2026-08-06T21:43:06.371713Z","submitted_at":"2025-07-12T06:44:37Z","title":"Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09160","snapshot_observed_at":"2026-07-31T13:36:03.404286Z","title":"arXiv preprint arXiv:2507.09160 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.404286Z"},"links":{"cited_paper":"/paper/2507.09160","citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:2407e8f1b4ac6c5750e4e35f7ac5715b43b597deb423eea0f38cecd3bf21fbe8","observation_id":"78431fbc-1a76-44bb-af7f-c2be8a98d209","resolution":{"observed_at":"2026-07-31T13:36:03.404286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:03.451716Z","title":"IEEE Robotics and Automation Letters , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.451716Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:4d91be04c68dc8a913317120fd338577153292454f28e2eec95f98ac0deef3b2","observation_id":"63f6a70f-ff16-4eab-b3ad-9ab658440d81","resolution":{"observed_at":"2026-07-31T13:36:03.451716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:03.490628Z","title":"arXiv preprint arXiv:2601.20321 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.490628Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:b1c64c5880e57618e3da9cf6083c7e079fcaaf1fb844bd0bd15d030ec8c81771","observation_id":"59b25292-418c-470b-bd90-7f3ef244aca7","resolution":{"observed_at":"2026-07-31T13:36:03.490628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20239","last_updated":"2026-05-13T12:53:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-28T04:22:47Z","title":"TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20239","snapshot_observed_at":"2026-07-31T13:36:03.528272Z","title":"arXiv preprint arXiv:2601.20239 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.528272Z"},"links":{"cited_paper":"/paper/2601.20239","citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:41dd3f6b526c3e0506cbc0a1f6cf320a86e4de7100f79a62db0876ef12268106","observation_id":"a5d8421c-6bbc-4e15-a564-6524d24161ed","resolution":{"observed_at":"2026-07-31T13:36:03.528272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02840","last_updated":"2026-07-03T00:23:30Z","snapshot_observed_at":"2026-08-05T03:55:15.314478Z","submitted_at":"2026-07-03T00:23:30Z","title":"TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02840","snapshot_observed_at":"2026-07-31T13:36:03.588516Z","title":"arXiv preprint arXiv:2607.02840 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.588516Z"},"links":{"cited_paper":"/paper/2607.02840","citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:54033e5a56c01f7a191c20380ac44ef8af9c975485cfc99e50ac0b75c2ff4111","observation_id":"2745500b-ffb3-4e63-9918-e0bfcab565ea","resolution":{"observed_at":"2026-07-31T13:36:03.588516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13102","last_updated":"2026-06-19T08:31:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T09:30:09Z","title":"FTP-1: A Generalist Foundation Tactile Policy Across Tactile Sensors for Contact-Rich Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13102","snapshot_observed_at":"2026-07-31T13:36:03.642363Z","title":"arXiv preprint arXiv:2606.13102 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.642363Z"},"links":{"cited_paper":"/paper/2606.13102","citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:bfef2d2254c6a994b7ecf8d14b08a0e6fcab2f251f199a71b02b59508031d06e","observation_id":"07775cca-bcd9-44d0-8d82-b2c1f6fe1742","resolution":{"observed_at":"2026-07-31T13:36:03.642363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17055","last_updated":"2026-06-18T20:58:46Z","snapshot_observed_at":"2026-07-06T23:52:42.390632Z","submitted_at":"2026-06-15T17:59:55Z","title":"T-Rex: Tactile-Reactive Dexterous Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17055","snapshot_observed_at":"2026-07-31T13:36:03.685733Z","title":"arXiv preprint arXiv:2606.17055 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.685733Z"},"links":{"cited_paper":"/paper/2606.17055","citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:14365f51e4b1e675e9ce06f742e1edeaa1dcdfe971093087555bb35755c888e5","observation_id":"b94fde0f-33b5-4d5d-8559-f52f8b0378bb","resolution":{"observed_at":"2026-07-31T13:36:03.685733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:03.743135Z","title":"arXiv preprint arXiv:2509.26642 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.743135Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:4f42ec9864c67d88384310220109fdcbfc3b8ea62267a3a186b60b247c7d5fb0","observation_id":"b5924aac-0b95-4d5a-85d6-222593745b0c","resolution":{"observed_at":"2026-07-31T13:36:03.743135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:03.799724Z","title":"Conference on Robot Learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.799724Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:5c0cbca1b0464af2c2a80da9afb04c0a8c9846e196d47dfbd887a977d9647b01","observation_id":"68cb59d0-1464-4c32-b6c5-cb8f6b347d45","resolution":{"observed_at":"2026-07-31T13:36:03.799724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:03.845046Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.845046Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:10784046148874de861c22373fd6d489a34ecf3197d2559aca955968d2b5d9a6","observation_id":"7ebef8de-02e5-4736-8373-a6188e1a6199","resolution":{"observed_at":"2026-07-31T13:36:03.845046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:03.918874Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.918874Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:2be80d5412c831e6f706b9ed3c127a590446e74e086d6288786b708922db6f0d","observation_id":"0775656c-87d3-4a35-8dae-5668a4b99577","resolution":{"observed_at":"2026-07-31T13:36:03.918874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:03.965003Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.965003Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:856f4fd6f2b68919494576f3f17a3d1a3435d9a30c3baddab68637baf96c58b1","observation_id":"ab56f5d7-203b-43db-8e99-ded114802401","resolution":{"observed_at":"2026-07-31T13:36:03.965003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12498","last_updated":"2022-11-29T16:39:06Z","snapshot_observed_at":"2026-07-06T14:21:53.002239Z","submitted_at":"2022-11-22T18:59:32Z","title":"Touch and Go: Learning from Human-Collected Vision and Touch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12498","snapshot_observed_at":"2026-07-31T13:36:03.989634Z","title":"arXiv preprint arXiv:2211.12498 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:03.989634Z"},"links":{"cited_paper":"/paper/2211.12498","citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:e5f6db7e05b0dc171076cb7b64d740bd3d5c07c7e572053f8f4c050a19896802","observation_id":"7be85646-35e2-4786-8a77-9c3c5a2388d2","resolution":{"observed_at":"2026-07-31T13:36:03.989634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:04.035763Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:04.035763Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:0dc9129e6198ddb3a1910b1047e1c3817f1e078e4a5ec046b5e1fd0fabd416a3","observation_id":"195e03a9-e069-4960-945b-210e4efba090","resolution":{"observed_at":"2026-07-31T13:36:04.035763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13042","last_updated":"2023-07-31T17:47:27Z","snapshot_observed_at":"2026-07-06T13:56:34.336341Z","submitted_at":"2022-09-26T21:50:39Z","title":"Self-Supervised Visuo-Tactile Pretraining to Locate and Follow Garment Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13042","snapshot_observed_at":"2026-07-31T13:36:04.083852Z","title":"arXiv preprint arXiv:2209.13042 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:04.083852Z"},"links":{"cited_paper":"/paper/2209.13042","citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:4f07f5e79c4d58e60156c81adc95de6f4edfbbb9f89826c956c4495c741ce5f1","observation_id":"28119619-0b4b-4581-901b-b61c11f2e116","resolution":{"observed_at":"2026-07-31T13:36:04.083852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:04.141940Z","title":"2023 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:04.141940Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:912d63aee100ab8a0e139de3d8c5529f38a730907ae3ada7fca806344e1b68c4","observation_id":"7ccc8fc2-52cc-4dc4-a4f6-258c724df17b","resolution":{"observed_at":"2026-07-31T13:36:04.141940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:04.188012Z","title":"2025 , booktitle=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:04.188012Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:713d69e6a327f17dae4eb684f098ee8fd0acdf91446e03a429f113b2c5911656","observation_id":"a3c272f2-0829-447f-8bd5-601ad9940b2d","resolution":{"observed_at":"2026-07-31T13:36:04.188012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:04.222163Z","title":"2026 , booktitle=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:04.222163Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:a89b73bb02fb23066fb3615bbcfc212f02049af72b041f7ce07b08b9a8d1e163","observation_id":"6eeb5b52-565e-4d17-bb33-aa158b279275","resolution":{"observed_at":"2026-07-31T13:36:04.222163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:04.263989Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:04.263989Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:ff166d990a2304335ec86c8ba9b34c1dabeabdbae266b4181d3331540cf3de67","observation_id":"e9099495-8848-4f36-9917-fd8e0257c96a","resolution":{"observed_at":"2026-07-31T13:36:04.263989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:04.325197Z","title":"Information Fusion , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:04.325197Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:602e75381c89336c0a41d3ead2f23fd438b7dc71556fc93fa05f388c4ff863e7","observation_id":"aee53a1a-f26b-4f82-a0eb-2a74428f4153","resolution":{"observed_at":"2026-07-31T13:36:04.325197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:04.372401Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:04.372401Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:9c585a3e59bcf205fac15fbc44abfc58697ead0a42321e748f428935bb952449","observation_id":"6ef4e0c1-91f7-41a0-b80f-49fd0c3514df","resolution":{"observed_at":"2026-07-31T13:36:04.372401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-31T13:36:04.407615Z","title":"arXiv preprint arXiv:2410.24164 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:04.407615Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:e642fd10fa902c6ed762bad34a0ef0da7a89ebefe87d347e37d38e62fcd4ff46","observation_id":"ceb5d452-a28b-467a-91fd-7050ba3597e8","resolution":{"observed_at":"2026-07-31T13:36:04.407615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:04.450500Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:04.450500Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:5cf60ebd55763d1230be2466eb786dd77fddcf6e21cb431685d42ca637708b84","observation_id":"b944ea45-6147-458d-8777-8a4f1e3527d5","resolution":{"observed_at":"2026-07-31T13:36:04.450500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:04.487387Z","title":"Conference on Robot Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:04.487387Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:ec0bed849316679b4fd761d39e82ac0a95614ada9538a8b1a1968815f0787a86","observation_id":"976c69a4-466f-4caf-92ee-fef1a87163d6","resolution":{"observed_at":"2026-07-31T13:36:04.487387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:04.524322Z","title":"Conference on Robot Learning , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:04.524322Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:a9f61eba8ffcca72b9dbdd935e431c22380588805958dbf6ab5eca6bc78222d3","observation_id":"b552bfb4-dc37-4a98-835e-a6977fbde777","resolution":{"observed_at":"2026-07-31T13:36:04.524322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:36:04.561551Z","title":"2, 2022-06-27 , author=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-31T13:36:04.561551Z"},"links":{"citing_paper":"/paper/2607.24485"},"observation_digest":"sha256:20b5628a339bed6ce71dd97f45bcd976162be8660d02f32d65fc5f9b9583599f","observation_id":"16dfccd9-82b6-4ca3-b03d-3c9071f00488","resolution":{"observed_at":"2026-07-31T13:36:04.561551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24485","last_updated":"2026-07-30T02:52:03Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-03T21:45:04.683674Z","submitted_at":"2026-07-27T14:25:15Z","title":"{\\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2607.24485."}