{"as_of":"2026-08-09T16:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8c02b1601209eb9b83e8d447d4ebcea22d885220e5778499f72f8f3e795d58b","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:09:26.504997Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T08:20:49.438388Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:05:40.612441Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"cited_work":{"arxiv_id":"2505.22566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22566","snapshot_observed_at":"2026-07-01T10:05:40.612441Z","title":"Universal visuo-tactile video understanding for embodied interaction","venue":null,"work_id":"4f581584-3b0b-4c83-a144-693f44d826c4","year":2025},"citing_paper":{"arxiv_id":"2604.24681","last_updated":"2026-05-21T05:08:13Z","snapshot_observed_at":"2026-08-02T19:33:59.938088Z","submitted_at":"2026-04-27T16:42:18Z","title":"Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T02:51:27.662262Z"},"links":{"cited_paper":"/paper/2505.22566","citing_paper":"/paper/2604.24681"},"observation_digest":"sha256:52ca681087b0ef9586ac940884d260d13a98fa81320253b3dea373038e8fa724","observation_id":"742e49d2-d20c-4ff6-bfd8-ff1b8067ab7b","resolution":{"observed_at":"2026-05-11T22:26:11.718986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"cited_work":{"arxiv_id":"2505.22566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22566","snapshot_observed_at":"2026-07-01T10:05:40.612441Z","title":"Universal visuo-tactile video understanding for embodied interaction","venue":null,"work_id":"4f581584-3b0b-4c83-a144-693f44d826c4","year":2025},"citing_paper":{"arxiv_id":"2604.24681","last_updated":"2026-05-21T05:08:13Z","snapshot_observed_at":"2026-08-02T19:33:59.938088Z","submitted_at":"2026-04-27T16:42:18Z","title":"Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T11:16:58.104663Z"},"links":{"cited_paper":"/paper/2505.22566","citing_paper":"/paper/2604.24681"},"observation_digest":"sha256:ea4516e98c1f1af3e578120125fc00eaee94d61fa585defe85c08844d36ffc51","observation_id":"38e50fb9-092a-48b4-b69d-ba9e2c9a760a","resolution":{"observed_at":"2026-05-22T11:21:29.117773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"cited_work":{"arxiv_id":"2505.22566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22566","snapshot_observed_at":"2026-07-01T10:05:40.612441Z","title":"Universal visuo-tactile video understanding for embodied interaction","venue":null,"work_id":"4f581584-3b0b-4c83-a144-693f44d826c4","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-02T12:21:23.782064Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2505.22566","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:cffaf603e35b73fc169cf307ca0b9ab10beef6629806148452e53f95a3167be9","observation_id":"0fdca6f4-85a3-4da9-adb4-c103fec5f06d","resolution":{"observed_at":"2026-05-20T12:53:17.369400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"cited_work":{"arxiv_id":"2505.22566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22566","snapshot_observed_at":"2026-07-01T10:05:40.612441Z","title":"Universal visuo-tactile video understanding for embodied interaction","venue":null,"work_id":"4f581584-3b0b-4c83-a144-693f44d826c4","year":2025},"citing_paper":{"arxiv_id":"2606.31451","last_updated":"2026-06-30T10:25:46Z","snapshot_observed_at":"2026-08-02T09:59:19.263812Z","submitted_at":"2026-06-30T10:25:46Z","title":"UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-01T05:56:03.597839Z"},"links":{"cited_paper":"/paper/2505.22566","citing_paper":"/paper/2606.31451"},"observation_digest":"sha256:d06a2c54bdfc63d1e4dad6fcec5a2f2b8a549d06d8b98c6fb48bd075b24722ed","observation_id":"34d78103-deb5-4e72-84f6-8f3bac3128f1","resolution":{"observed_at":"2026-07-01T10:05:40.614055Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22566","snapshot_observed_at":"2026-07-11T08:20:49.438388Z","title":"Universal visuo-tactile video understanding for embodied interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05131","last_updated":"2026-07-06T14:17:44Z","snapshot_observed_at":"2026-08-08T03:58:49.160758Z","submitted_at":"2026-07-06T14:17:44Z","title":"TacReasoner: A Dynamic Tactile-Language Framework for Interactive Reasoning in Real-World Scenarios","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T08:20:49.438388Z"},"links":{"cited_paper":"/paper/2505.22566","citing_paper":"/paper/2607.05131"},"observation_digest":"sha256:2971218d3bb023c2c8e7835fd1a4865e1344aa3fe210c02260e7057fa34219f3","observation_id":"48f125a2-bfc2-4656-84fb-a1c77d22f31a","resolution":{"observed_at":"2026-07-11T08:20:49.438388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22566/citation-record","integrity":"/paper/2505.22566/integrity","json":"/paper/2505.22566/citation-record.json","paper":"/paper/2505.22566"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:33.677045Z","title":"A review of tactile information: Perception and action through touch","venue":null,"work_id":"85b86674-f985-400f-9e25-de18a898dbcd","year":2020},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:19.560774Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:90eca3b1d34d7b5f13d79f757ea1888bd247de0e35eb47aef2c8597d8a5d463d","observation_id":"43cfddc7-1d6d-41b0-af88-f4bf9e6f1ad5","resolution":{"observed_at":"2026-08-07T13:09:33.774596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:33.429952Z","title":"Task and material properties interac- tively affect softness explorations along different dimensions","venue":null,"work_id":"5f9d2525-a305-405b-ac81-c3f0b77bc248","year":2021},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:19.672847Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:23696509d69d3d0fd8331f44bbbe90159f740bf51a0450011a87e22bfe38ed26","observation_id":"fbfc6331-cc9d-439c-a6d0-4d4eab314da0","resolution":{"observed_at":"2026-08-07T13:09:33.547098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:33.218144Z","title":"Predicting perceptual haptic attributes of textured surface from tactile data based on deep cnn-lstm network","venue":null,"work_id":"276acc66-7c03-4251-aba8-0319b5ad0e7e","year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:19.825495Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:dbaf637ade9a181d38632d29a56839496edc44a2c2ce2a486b8668e94c5c5a64","observation_id":"8a8dadab-e645-4958-b1e7-f92336479787","resolution":{"observed_at":"2026-08-07T13:09:33.284124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T13:09:19.929844Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:19.929844Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:f78bd4d81f986f88547c2edcc389dc599eda71d9a9604f4d195f8a82d10ac42c","observation_id":"c4f5cbb6-2d5b-4f5f-8785-90ec4adb4fd0","resolution":{"observed_at":"2026-08-07T13:09:19.929844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:09:20.070560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.070560Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:8cc195cd0c59f465a2eceb2e594a911a86dba8fa009fde91f127b795013e71ba","observation_id":"0301aa58-7e92-46ab-8142-1e633397736b","resolution":{"observed_at":"2026-08-07T13:09:20.070560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:20.167450Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.167450Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:783e257d810e11944fe17e4a77e96033da236992c872a0e93cf0218aaddc4057","observation_id":"2d442cf6-3280-4c99-8959-021be48de50b","resolution":{"observed_at":"2026-08-07T13:09:20.167450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:20.291420Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.291420Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:7aa23feb9b59a99edc0b88512dc941a2e0edd02de575314ba516258a1ccb7906","observation_id":"98429ef1-db62-4cff-bb88-2344d067e4cb","resolution":{"observed_at":"2026-08-07T13:09:20.291420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12198","last_updated":"2025-01-05T14:10:02Z","snapshot_observed_at":"2026-07-06T19:52:20.541067Z","submitted_at":"2024-11-19T03:30:06Z","title":"CCIS-Diff: A Generative Model with Stable Diffusion Prior for Controlled Colonoscopy Image Synthesis","version":2},"cited_work":{"arxiv_id":"2411.12198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.12198","snapshot_observed_at":"2026-08-07T13:09:27.068801Z","title":"CCIS-Diff: A Generative Model with Stable Diffusion Prior for Controlled Colonoscopy Image Synthesis","venue":"cs.CV","work_id":"3a957890-0439-4290-a6ee-332dd68b38a0","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.431420Z"},"links":{"cited_paper":"/paper/2411.12198","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:247d78d8b3fcefd39793feb0f5d12686be28cdcbe2265fd6fc77064ab7c3229d","observation_id":"e1106966-9d92-452e-9005-3dcd31fb4d2c","resolution":{"observed_at":"2026-08-07T13:09:27.119977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:32.948153Z","title":"When vision meets touch: A contemporary review for visuotactile sensors from the signal processing perspective","venue":null,"work_id":"d277d1c5-ed93-407b-b953-90ce228960b6","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.545737Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:441f3e9ce7f55dbe9d65905406a7fe946afbe3b15a9c1e1ba1fa70605c046e07","observation_id":"c811a921-8343-401f-ae5f-591f7be8ffad","resolution":{"observed_at":"2026-08-07T13:09:33.073625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:32.705803Z","title":"Gelsight: High-resolution robot tactile sensors for estimating geometry and force","venue":null,"work_id":"c46f7c21-9b91-42e6-bb26-4d49bac57ebc","year":2017},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.676655Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:6e700a33b0cdd83bfe407edbec3ecfb1552291f76553ed2ecf30b34cdcfbbd19","observation_id":"1a6ffca7-6dd9-4dc7-9421-2c0cd24964fb","resolution":{"observed_at":"2026-08-07T13:09:32.833076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:32.401288Z","title":"Digit: A novel design for a low-cost compact high-resolution tactile sensor with application to in-hand manipulation","venue":null,"work_id":"d3e2f2ee-3721-4dae-bc8b-f7921292f21d","year":2020},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.786246Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:3f2072d19a51892c214859efc3bc421cea6476efcb128a23b219c2d74056fb01","observation_id":"dfea851b-8f91-4e67-a99d-ace2f346f1a7","resolution":{"observed_at":"2026-08-07T13:09:32.535134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06211","last_updated":"2022-02-13T05:14:22Z","snapshot_observed_at":"2026-07-06T12:37:09.865277Z","submitted_at":"2022-02-13T05:14:22Z","title":"Tac3D: A Novel Vision-based Tactile Sensor for Measuring Forces Distribution and Estimating Friction Coefficient Distribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06211","snapshot_observed_at":"2026-08-07T13:09:20.888419Z","title":"Tac3d: A novel vision-based tactile sensor for measuring forces distribution and estimating friction coefficient distribution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.888419Z"},"links":{"cited_paper":"/paper/2202.06211","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:e6ebf841c0cfcfbe13939de3555702ecac9a81a922c83cc8dc6f9e4d60544eff","observation_id":"acebc66d-26bc-4d24-abc6-ef6bd4c66b39","resolution":{"observed_at":"2026-08-07T13:09:20.888419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:32.126289Z","title":"Anytouch: Learning unified static-dynamic representation across multiple visuo-tactile sensors","venue":null,"work_id":"343afcb3-8ca5-4b3e-a2fc-39c62c5c8f73","year":2025},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.005344Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:41daa1aec923f790220bbb613780ee583a7f7afda3f1ad005e0309c6b875c46d","observation_id":"76ef809c-43e9-4f30-8cf1-93e8632aa829","resolution":{"observed_at":"2026-08-07T13:09:32.238115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:31.880423Z","title":"Transferable tactile transformers for representation learning across diverse sensors and tasks","venue":null,"work_id":"538c988d-673a-4f52-8815-67d7c2e55495","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.115468Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:eec8219ac2b3b40bad51a4628dd2214044c46bb61d779e635f271a23c66dd36b","observation_id":"624d1181-696b-404c-ab7e-f6392e065556","resolution":{"observed_at":"2026-08-07T13:09:31.979642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02794","last_updated":"2024-06-05T01:40:36Z","snapshot_observed_at":"2026-08-07T22:53:14.214309Z","submitted_at":"2024-05-05T02:22:11Z","title":"Octopi: Object Property Reasoning with Large Tactile-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02794","snapshot_observed_at":"2026-08-07T13:09:21.199940Z","title":"Octopi: Object property reasoning with large tactile-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.199940Z"},"links":{"cited_paper":"/paper/2405.02794","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:45ebab2b88ee25e9a9ee55cd80457934d58a2890ad3e516d1ec4691d3902e8db","observation_id":"793c2a97-ea4c-4375-88da-a04937c09976","resolution":{"observed_at":"2026-08-07T13:09:21.199940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:31.559784Z","title":"A touch, vision, and language dataset for multimodal alignment","venue":null,"work_id":"16a1627a-2a3f-4478-babf-5a500557b6ad","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.303672Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:7b912a70daeb64ad65c49aab84ac3941582e52c4e243040f44bda6787fb91560","observation_id":"cdda796b-c152-44fa-914f-0ee8ff653e78","resolution":{"observed_at":"2026-08-07T13:09:31.655885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:21.437900Z","title":"Binding touch to everything: Learn- ing unified multimodal tactile representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.437900Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:e36ccc85726f7dc58ccd8e312aa94b7f35247379bd34bacabc207a55e0df5705","observation_id":"f7fbd7ce-31e4-40ec-bb6b-37ec7f3bed1b","resolution":{"observed_at":"2026-08-07T13:09:21.437900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:31.375587Z","title":"Sparsh: Self-supervised touch representations for vision-based tactile sensing","venue":null,"work_id":"0aecbea0-a0b0-47f3-bc69-d06e9f8edfcf","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.550534Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:6e3f92db7591660911abede046cb772230e182c934800cc8c100b27565c6b361","observation_id":"7ea52084-156f-4997-a910-f59c5759fb43","resolution":{"observed_at":"2026-08-07T13:09:31.436273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:31.086896Z","title":"Visuo- tactile affordances for cloth manipulation with local control","venue":null,"work_id":"08165663-89c7-4bc0-a952-eb9b22060490","year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.673000Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:56d92aa17d9621e0646c57ff85a72109778da81160bbb40f0ebb20d064b49d96","observation_id":"ebbfd123-0d6e-4b15-a32c-6d0014f2f269","resolution":{"observed_at":"2026-08-07T13:09:31.215381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11537","last_updated":"2024-08-21T11:32:09Z","snapshot_observed_at":"2026-07-06T19:04:00.888268Z","submitted_at":"2024-08-21T11:32:09Z","title":"A Survey of Embodied Learning for Object-Centric Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11537","snapshot_observed_at":"2026-08-07T13:09:21.815777Z","title":"A survey of embodied learning for object-centric robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.815777Z"},"links":{"cited_paper":"/paper/2408.11537","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:c52f31a199f9da63cf3ec308df744eebaf42abb63c47e387be5a1e5f234b96e9","observation_id":"cbec3edb-3dd7-4112-afbc-bf4784575848","resolution":{"observed_at":"2026-08-07T13:09:21.815777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:30.850220Z","title":"Touch and go: learning from human-collected vision and touch","venue":null,"work_id":"48c64253-cef9-4f80-9559-69c4ca4a8b01","year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.941510Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:fa8ea6d2e70babec67801d687dc538d6ee04e9f82907e97141256bcb3f58588f","observation_id":"208acdd1-c51d-49ff-aee7-c0666b5a9c53","resolution":{"observed_at":"2026-08-07T13:09:30.953063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:30.583099Z","title":"Objectfolder: A dataset of objects with implicit visual, auditory, and tactile representations","venue":null,"work_id":"d194ce3c-1fd6-4efe-be8b-ac61758af5de","year":2021},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.066880Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:8244688e176260f0bd958c864b8d00da3d3728d445637f6f8be241769c330c87","observation_id":"392610d5-dcb9-4574-992d-ee451a827144","resolution":{"observed_at":"2026-08-07T13:09:30.696731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:30.410033Z","title":"Objectfolder 2.0: A multisensory object dataset for sim2real transfer","venue":null,"work_id":"8b0d7355-d379-454b-a165-53128bb1524e","year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.198067Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:64d3b69f0a336d07f240a835d632964ec881ebdadeac4230b147fbea846c4711","observation_id":"0d1a6651-3972-4388-a3d7-4f43fee1f54d","resolution":{"observed_at":"2026-08-07T13:09:30.516242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:30.235034Z","title":"See, hear, and feel: Smart sensory fusion for robotic manipulation","venue":null,"work_id":"7aa61773-15f2-4643-9fa6-8c0ac790f0de","year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.334747Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:e83486273fba1f95a19728b6267a4ce75355b32eabc46f43e8aae49df030f01b","observation_id":"6dacc2bd-93f8-45eb-9a08-28d9e34f710e","resolution":{"observed_at":"2026-08-07T13:09:30.352472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:29.994056Z","title":"Active clothing material perception using tactile sensing and deep learning","venue":null,"work_id":"783860d0-743e-4839-9855-168965434a0e","year":2018},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.466478Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:a03f96187de89169449efa12373d62eac35f72939e979f37dfd8ba2e3b9f629c","observation_id":"2901758c-fe3c-4126-b33d-0b0937768079","resolution":{"observed_at":"2026-08-07T13:09:30.101643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13042","last_updated":"2023-07-31T17:47:27Z","snapshot_observed_at":"2026-07-06T13:56:34.336341Z","submitted_at":"2022-09-26T21:50:39Z","title":"Self-Supervised Visuo-Tactile Pretraining to Locate and Follow Garment Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13042","snapshot_observed_at":"2026-08-07T13:09:22.601918Z","title":"Self-supervised visuo-tactile pretraining to locate and follow garment features","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.601918Z"},"links":{"cited_paper":"/paper/2209.13042","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:0d62e45cd22cfcd385cbcaa371e2f5588ed56ec4e6e589b46180bda1aee3671e","observation_id":"8c16cee2-1899-4b26-ad14-2bd330bd1bca","resolution":{"observed_at":"2026-08-07T13:09:22.601918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:22.755242Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.755242Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:9d09c3bd2c1f6b938abcab3c224204fe88f61038a953e5c852305070dd74076e","observation_id":"beac2993-c198-4208-8264-2b4af7e285c2","resolution":{"observed_at":"2026-08-07T13:09:22.755242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:29.719457Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"d9162be0-9454-485b-94e1-e5bf4072e907","year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.850972Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:6d91817d562d2cdc144fb6dbd2f53e08b63efa4dbe9d05d23f32be9252d7a62e","observation_id":"eab5930d-261a-4dc9-a0c9-682cbba1406e","resolution":{"observed_at":"2026-08-07T13:09:29.809973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:29.473226Z","title":"Sigma: Sinkhorn-guided masked video modeling","venue":null,"work_id":"ab47530a-6ec6-4179-ad94-7176d1f1447c","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.991207Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:621b3aa206d70140897f79429bf45dd11e531d80d2b5aef1872310ec7cdd0a6d","observation_id":"cdc1cd11-5c75-4fe2-b7cf-614719443e24","resolution":{"observed_at":"2026-08-07T13:09:29.582233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:29.256146Z","title":"Mgmae: Motion guided masking for video masked autoencoding","venue":null,"work_id":"6d848873-1c8e-4701-9b44-c2b51013bdbe","year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.156250Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:1fef9ed30a1ce368e5b3d91ff3bf25ace79dc03a6b4103c567be529b11edc726","observation_id":"2f57f20a-4a5a-4dbb-8f77-630bc069549c","resolution":{"observed_at":"2026-08-07T13:09:29.355424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12332","last_updated":"2025-03-16T03:01:07Z","snapshot_observed_at":"2026-08-09T00:28:26.432901Z","submitted_at":"2025-03-16T03:01:07Z","title":"VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining","version":1},"cited_work":{"arxiv_id":"2503.12332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12332","snapshot_observed_at":"2026-08-07T13:09:26.853314Z","title":"VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining","venue":"cs.CV","work_id":"ccc4a5d8-f7d1-46bd-9606-1d718bfbaf24","year":2025},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.238850Z"},"links":{"cited_paper":"/paper/2503.12332","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:6769688607d5ea78d5a4c373c7985b13271cfaac1af1d18c9c52605d301163e2","observation_id":"8890e7dc-b217-4dbd-9e61-553736bbc3c4","resolution":{"observed_at":"2026-08-07T13:09:26.914536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:29.043751Z","title":"Videomac: Video masked autoencoders meet convnets","venue":null,"work_id":"26098f9f-1866-4bb4-a472-0d6315c14771","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.337796Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:985a0ba1a25003daa68bb17bac71738182bcfae77cd83cee2e79f5ef27843aa5","observation_id":"9cbbb563-ba2a-4b99-a2b9-4a5c98629509","resolution":{"observed_at":"2026-08-07T13:09:29.125395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.432848Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.432848Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:72ad1b4a6f911b233862cf5abfa481518b829d3124934a9161c565fca8bc669e","observation_id":"6118caa9-3120-4001-9b1f-e5fe9de1fba9","resolution":{"observed_at":"2026-08-07T13:09:23.432848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.595338Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.595338Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:834adee637a54d6d81daf132e14e5a538738cc49c3f6b9269a89e9e08ce29352","observation_id":"9995e569-a2b3-4ea4-9e92-b43426a67bcd","resolution":{"observed_at":"2026-08-07T13:09:23.595338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.681350Z","title":"Gpt4tools: Teaching large language model to use tools via self-instruction.Advances in Neural Information Processing Systems, 36:71995–72007, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.681350Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:2e3edf42bcb5c2d22833d9b8502700eb713894fd8f085d76dee02f954016987d","observation_id":"a3013d9a-5e2f-4baa-895f-36b61cf644e3","resolution":{"observed_at":"2026-08-07T13:09:23.681350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.786995Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.786995Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:2aa19662782762fc92f0b0b294a3f6a3252d3e736180f2436622c37a100a2b23","observation_id":"97709027-603c-493b-a6dc-e93839b22fad","resolution":{"observed_at":"2026-08-07T13:09:23.786995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:28.768391Z","title":"Minigpt-4: Enhanc- ing vision-language understanding with advanced large language models","venue":null,"work_id":"694d4392-3d57-4cc3-8fe3-3f9c241b0cce","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.865887Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:f9dcf3b140d09e910f4e242ddbff4f8bcd377b81a6cdb4454017a7c44985e068","observation_id":"352771ac-e717-4add-8dd5-0cdf78a2e61e","resolution":{"observed_at":"2026-08-07T13:09:28.868777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.964185Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.964185Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:e6cdf844db66605f34fe61061341d19da6d23b648d6583bafc06d6c89f606618","observation_id":"97ba6137-fecf-4e2f-b213-67f56a72c03b","resolution":{"observed_at":"2026-08-07T13:09:23.964185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:24.036960Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.036960Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:a226afe7628a373768b265c2513a70bb6792866fb0cd278b714ca523fd30513f","observation_id":"078e2ba6-a78d-4edd-a9b7-f6b6dd95d72f","resolution":{"observed_at":"2026-08-07T13:09:24.036960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:24.134433Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.134433Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:4756387970abc56b164c81fc091ac1e7fff0c50122074b370a940e2babc33b4a","observation_id":"d76a937d-66db-41a6-9a14-10efc16017b2","resolution":{"observed_at":"2026-08-07T13:09:24.134433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T13:09:24.251376Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.251376Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:d8d25cfc1665f1d2647bfa21b4c97fc778f43cdd2d85c536f894bed8900556e7","observation_id":"4d471dd7-0154-42c7-9e64-3e2961686ada","resolution":{"observed_at":"2026-08-07T13:09:24.251376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T13:09:24.344367Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.344367Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:2ed77f596e5f9b6ea3d212635626dfe709a052d3e45770e1fe7b03d7bc270f58","observation_id":"d3b73640-6507-408d-a905-1fce1cd35252","resolution":{"observed_at":"2026-08-07T13:09:24.344367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-07T13:09:24.408542Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.408542Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:b5041f08a85215a6462ca8ae9f2f915796b9f8a5637a9ae5f35d67d3bca6269c","observation_id":"50fa4dfe-7599-43b1-b803-b66e80ffddb1","resolution":{"observed_at":"2026-08-07T13:09:24.408542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04693","last_updated":"2025-01-14T22:28:39Z","snapshot_observed_at":"2026-08-06T05:51:59.730600Z","submitted_at":"2025-01-08T18:57:33Z","title":"Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04693","snapshot_observed_at":"2026-08-07T13:09:24.502357Z","title":"Beyond sight: Finetuning generalist robot policies with heterogeneous sensors via language grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.502357Z"},"links":{"cited_paper":"/paper/2501.04693","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:7d25873ca9854c2e0b797fdd53962043bd6ca9e5b3fc5b22c7224f624e0b4dde","observation_id":"a3f3347f-591d-4657-a834-23fbaa070590","resolution":{"observed_at":"2026-08-07T13:09:24.502357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08269","last_updated":"2024-09-12T17:58:07Z","snapshot_observed_at":"2026-08-02T00:50:51.161180Z","submitted_at":"2024-09-12T17:58:07Z","title":"Touch2Touch: Cross-Modal Tactile Generation for Object Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08269","snapshot_observed_at":"2026-08-07T13:09:24.596314Z","title":"Touch2touch: Cross-modal tactile generation for object manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.596314Z"},"links":{"cited_paper":"/paper/2409.08269","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:fe0e82176e483b285ba2559e10b91651c62f6c2fab3cfce32a753ec518913718","observation_id":"4426ec64-3622-445e-ae22-47279bff05cd","resolution":{"observed_at":"2026-08-07T13:09:24.596314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:28.500906Z","title":"Cubic spline interpolation","venue":null,"work_id":"4ecb9532-b28a-44a2-aaa9-142825694a1b","year":1998},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.715771Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:216533434d14f4f6e9158915833b44323ba9a3a4f78803d29d311d466ffbc14a","observation_id":"931b65ea-f382-4776-81ba-6b669b203d5d","resolution":{"observed_at":"2026-08-07T13:09:28.617259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:28.197384Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"60a56782-3b20-4d91-b924-b08312057da8","year":2020},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.840567Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:05c03faf363f3148310ecd1877c2891ce5153f90e5d29370dd274b4f6aca0126","observation_id":"d3d1544c-7f2d-4937-94c2-cc7062024bc7","resolution":{"observed_at":"2026-08-07T13:09:28.313082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T13:09:24.983127Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.983127Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:8561634c9ef83529ee4017d93265da013b9d08034d4cc39731340b8576833d97","observation_id":"efad683c-0329-41d4-8300-4b83db121f71","resolution":{"observed_at":"2026-08-07T13:09:24.983127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:25.062498Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.062498Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:e48a47a9f17da6063c5c3098366b8608569a5db79c28f4daa994727ca01f2076","observation_id":"6b0cadcd-cdd2-481d-b2d0-2be2fd96087a","resolution":{"observed_at":"2026-08-07T13:09:25.062498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:27.980524Z","title":"Gaussian mixture models","venue":null,"work_id":"151dc832-6ad5-426c-a42b-fb24dceac0c3","year":2009},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.153871Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:5a646cd425468badbbc6b97de47c1122faba1ac10179e4c28a4fb524a95ad2fc","observation_id":"d9c45fc7-ed47-49be-9795-9d6c2fc851f6","resolution":{"observed_at":"2026-08-07T13:09:28.079862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:25.284624Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.284624Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:c4316aed6fa02f5b96a6053bb70fdbf8479941eafd823faa1bee67571fbf065a","observation_id":"e15719c8-7422-4632-91e9-557f79f72825","resolution":{"observed_at":"2026-08-07T13:09:25.284624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:27.751850Z","title":"Forward and backward warping for optical flow-based frame interpolation","venue":null,"work_id":"2fd5cec1-c340-4bce-89cf-5ba7ac1a35c8","year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.397975Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:305ec7dbc997a42b42a210b470429e797f39804f72f7c246b7baf10e71fb6888","observation_id":"e6a60081-4ffb-4412-b2f8-1304ccf66c42","resolution":{"observed_at":"2026-08-07T13:09:27.860591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:27.484189Z","title":"Extrapolation-based video retargeting with backward warping using an image-to-warping vector generation network","venue":null,"work_id":"829f37f5-9776-42bc-99a5-486ba22d173e","year":2020},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.529812Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:e9444fbd835d0fd431149b4aeb1b0e94fe22a75e56eb1f8defe1c37ad91195c9","observation_id":"d6bd2af6-b91d-445a-b71f-16d16cb38fe9","resolution":{"observed_at":"2026-08-07T13:09:27.612526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:25.692625Z","title":"Cross-entropy loss functions: Theoretical analysis and applications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.692625Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:92d9b0ae42aa9d008f797c82eb0235923a952c39f63ecfc7cbc0e5f07dbcba70","observation_id":"362bd598-074d-4d98-8f7c-4449b1589cb9","resolution":{"observed_at":"2026-08-07T13:09:25.692625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T13:09:25.820834Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.820834Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:695237edffc478c8119b3b0d4fe64700e0252d261a43ac2febed30451996d691","observation_id":"b16cc7da-a388-4856-8a25-5582d5a000fd","resolution":{"observed_at":"2026-08-07T13:09:25.820834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:27.267910Z","title":"gemini-2.5-pro-preview-05-06","venue":null,"work_id":"49137ae9-6424-4a49-8bfa-06e24f0ee5e3","year":2025},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.923745Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:7e23bcc17a228521162de16611240666b995f6f2793fff92fea240105f80ea3e","observation_id":"a304cf9d-0f65-4eef-af4e-93345d8f906c","resolution":{"observed_at":"2026-08-07T13:09:27.360930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T13:09:26.070117Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:26.070117Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:d63a2eadc2a1aa8c07d9bbec2b9602659ac8b02a296612fb022808af563d3100","observation_id":"f3a13097-92b7-47d9-b443-a76e1e1f8917","resolution":{"observed_at":"2026-08-07T13:09:26.070117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T13:09:26.216112Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:26.216112Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:5516b9b464f6b1789203657058b025113f206a4a4e0d69611c0f17ae1f9b8494","observation_id":"120b31ac-4054-4861-882b-b452c3ddd294","resolution":{"observed_at":"2026-08-07T13:09:26.216112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:09:26.367593Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:26.367593Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:d1070ea02919c8f92f37ee6bad16a82ed7668429f7f21c65daa11324e31c4613","observation_id":"c51cfa79-1d7a-46af-bebb-b92b42132eb1","resolution":{"observed_at":"2026-08-07T13:09:26.367593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:09:26.504997Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:26.504997Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:25fed17c9ed15f08f32a93aeff83d7878c07706b10c52ee4eacddfca8ae52b8c","observation_id":"ee21c921-e493-4641-8370-9e04b885dc58","resolution":{"observed_at":"2026-08-07T13:09:26.504997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":27},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 5 inbound Pith citation observations for arXiv:2505.22566."}