{"as_of":"2026-08-20T15:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a4394e9dbeb145b4a8aaf6c42014108b430809492fffb9daf5a1ea4c4562b491","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:43:04.627490Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:43:04.520409Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T15:43:04.746675Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2602.02533","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.02533","snapshot_observed_at":"2026-08-15T15:43:04.746675Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","venue":"cs.RO","work_id":"9414b900-79a5-49dd-81d1-69980740b56b","year":2026},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.520409Z"},"links":{"cited_paper":"/paper/2602.02533","citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:1df32e0590cc3cc4265ff15a797cd2994731106f4474761b9794b91fd4da1537","observation_id":"b4e81357-9ff2-4195-97c7-84368156384e","resolution":{"observed_at":"2026-08-15T15:43:04.752075Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.02533/citation-record","integrity":"/paper/2602.02533/integrity","json":"/paper/2602.02533/citation-record.json","paper":"/paper/2602.02533"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2602.02533","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.02533","snapshot_observed_at":"2026-08-15T15:43:04.746675Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","venue":"cs.RO","work_id":"9414b900-79a5-49dd-81d1-69980740b56b","year":2026},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.520409Z"},"links":{"cited_paper":"/paper/2602.02533","citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:1df32e0590cc3cc4265ff15a797cd2994731106f4474761b9794b91fd4da1537","observation_id":"b4e81357-9ff2-4195-97c7-84368156384e","resolution":{"observed_at":"2026-08-15T15:43:04.752075Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.972810Z","title":"Hyperbolic Semantic Alignment Our HMVLA framework is based on the Lorentz model in hyperbolic geometry, as shown in Figure 2","venue":null,"work_id":"4fd6c23e-f84f-4782-aac2-d434f3160467","year":null},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.525749Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:f6e051a7360da1d3bf4d4e4b4eea3c19814d3492ed35a96815f125a4f3bbfde9","observation_id":"374d0762-650f-4ea5-904f-4e4928c967a9","resolution":{"observed_at":"2026-08-15T15:43:04.976355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.962854Z","title":"Specifically, we utilized four datasets: Spatial, Object, Goal, and LONG","venue":null,"work_id":"2d329a85-8e6c-48c4-a858-a8f8fdbd78a9","year":null},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.530082Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:2375def28318f378ea77568f6c62e4a8ccf9362682313a2cbb06ff9996af9617","observation_id":"3b3459f3-0e28-4d79-8c9d-f5fd089ef3dc","resolution":{"observed_at":"2026-08-15T15:43:04.966116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.952979Z","title":"By embedding multimodal features into a hyperbolic space, our model effectively cap- tures the inherent hierarchical relationships within image-text data","venue":null,"work_id":"21a0789a-3932-4fd3-951b-f50aa1262588","year":null},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.534320Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:1177cf73a48bcb83734874e9471d511d72b032bb290e138e964562f8c4d39ac5","observation_id":"7e2b28c3-31f1-4c66-a8e1-e64a33f8b7b4","resolution":{"observed_at":"2026-08-15T15:43:04.956450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.942610Z","title":"62277011), National Key Research and Development Program of China (Grant No","venue":null,"work_id":"27b33843-27fb-4d7f-b9f8-2e64a4f3e946","year":2024},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.539446Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:55410e5a587d5669f1b8439190cd4afa3f9c4745b094bf6f2b928cfa07ca2634","observation_id":"d351ea94-7afd-49cf-9086-d23d26538873","resolution":{"observed_at":"2026-08-15T15:43:04.946258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T15:43:04.543112Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.543112Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:0f82c2edcbc7d2eeeb6b4c0c63f385e9ae91ab7011af91f49bf5ee78c3e26869","observation_id":"0adcf0ee-9299-4181-839e-83cb85499538","resolution":{"observed_at":"2026-08-15T15:43:04.543112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.933101Z","title":"The llama 3 herd of models,","venue":null,"work_id":"88a2b3b8-9bec-4471-a938-98c14d4e3fc1","year":2024},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.547408Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:a1ed5b96abac96fc4c28adf036f40e18f07b848d99bfaa0f26c2cdb6cdaa52a7","observation_id":"ec1c130b-751d-47a7-8162-50061ddafd40","resolution":{"observed_at":"2026-08-15T15:43:04.936471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.923438Z","title":"Llapa: A vision-language model framework for counterfactual-aware procedural planning,","venue":null,"work_id":"b2c46a1f-4cd7-4e5f-b86d-a34f5174f57e","year":2025},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.550777Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:0f097c271a1003c9089b55ede35673ddd84944bb091c5371bc96143e2e0b742a","observation_id":"cecb79b9-8a35-4979-b63f-de2fe9d14aef","resolution":{"observed_at":"2026-08-15T15:43:04.926842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.913771Z","title":"Sage: A visual language model for anomaly detection via fact enhancement and entropy-aware alignment,","venue":null,"work_id":"f0d65f58-e54f-4e1e-8e46-c5d6a7a4973c","year":2025},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.554343Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:5051c258ef2c61465ffc13a172ec5e1cfb9d4e13ef95c4afa0256ce427debc8c","observation_id":"7d577ea6-d172-4e20-b863-7435f629a6bc","resolution":{"observed_at":"2026-08-15T15:43:04.917189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-15T15:43:04.558110Z","title":"Rt- 1: Robotics transformer for real-world control at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.558110Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:757cd58c1af3daf41244ee4815b862251e3d285fe960489a6b921e6ee26f3b28","observation_id":"2aa2faff-d727-46f1-92bf-0a2b1a174921","resolution":{"observed_at":"2026-08-15T15:43:04.558110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-15T15:43:04.561594Z","title":"Rt-h: Action hierarchies using language,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.561594Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:14a7963e1e13493acb5b07e483a6fdeae7d195fe9dc50fce88811b1a8f9b9a8a","observation_id":"4232ef47-45e8-483f-b5ba-713a3ae03824","resolution":{"observed_at":"2026-08-15T15:43:04.561594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-08-15T15:43:04.565021Z","title":"Vision- language-action model with open-world embodied rea- soning from pretrained knowledge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.565021Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:5094201464a20ea49b7ec053db549d58438ba65020438831c2fd3bc9b34f8dfa","observation_id":"c9324eb2-2f2d-4205-b7c6-30da002c49fb","resolution":{"observed_at":"2026-08-15T15:43:04.565021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.903865Z","title":"3d-vla: a 3d vision-language-action generative world model,","venue":null,"work_id":"ee4c1f6b-aec7-4d44-ba48-103efd453b66","year":2024},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.568497Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:35d0531664708fb9faeec734479db9354ef06b6df441128a1f34eaa5d3c2e664","observation_id":"f3a935ef-f69e-49ff-9339-8997b4400539","resolution":{"observed_at":"2026-08-15T15:43:04.907320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-15T15:43:04.572491Z","title":"π 0: A Vision-Language-Action Flow Model for General Robot Con- trol,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.572491Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:d4c3bcd82ebcf07380c1b91ba36f3604bfd63bbca0eee2607ec7b8f22632efd6","observation_id":"55c8244d-1f2e-41fc-88ac-3851e635161c","resolution":{"observed_at":"2026-08-15T15:43:04.572491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-15T15:43:04.575927Z","title":"π 0.5: A Vision-Language-Action Model with Open-World General- ization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.575927Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:9f6858d6e4682608bc32b09edb2a60a82c6ffc92db563c958adb65ae6b8061f0","observation_id":"0d2e091f-1111-4eab-ab2d-adb679afec2d","resolution":{"observed_at":"2026-08-15T15:43:04.575927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-08-15T15:43:04.579259Z","title":"A sur- vey on vision-language-action models for embodied ai,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.579259Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:cc493df6b4c58b1a09386a62bd7d80a618a5c1635826dd95880db1a8f8d2b0e1","observation_id":"c019518b-7f15-43c3-b7ec-ffe281ea1d04","resolution":{"observed_at":"2026-08-15T15:43:04.579259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.894021Z","title":"Vision- language models for vision tasks: A survey,","venue":null,"work_id":"503ee098-a736-48e4-baa2-c1eda78264a2","year":2024},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.582438Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:bf8349c147a195bc4465a4d3a0ebe7c9e6cedcbd2be1547f9a2720697465c195","observation_id":"ed3b8eff-bb83-406f-a334-799a3b209fc8","resolution":{"observed_at":"2026-08-15T15:43:04.897516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.884434Z","title":"Rt-2: Vision- language-action models transfer web knowledge to robotic control,","venue":null,"work_id":"30c60131-0c30-4222-b57d-1f43324571a2","year":2023},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.585455Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:83670e5563360a56693cbe41b00c87f0f8f4ccbd36b716091ac326d78d4005fa","observation_id":"a349a12c-ef24-414c-8aea-1a20004be9cb","resolution":{"observed_at":"2026-08-15T15:43:04.887837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-15T15:43:04.588623Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.588623Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:9993d21fae07b2198c8533f0523de558730bf271c73ecee44e7004c6fcd5294f","observation_id":"25bab865-bac0-4005-9ab4-1f1a06fc8f48","resolution":{"observed_at":"2026-08-15T15:43:04.588623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.873349Z","title":"Learn- ing transferable visual models from natural language super- vision,","venue":null,"work_id":"d95fb889-69b3-491f-ac95-0e18019b5277","year":2021},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.592045Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:6287ff9484e9d2d7c1137389058ced40cebc8da561828960c3ac052b8f2e4480","observation_id":"b47d593f-eb4c-453f-9fc5-d3cfe3cccebe","resolution":{"observed_at":"2026-08-15T15:43:04.877209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.862415Z","title":"An ex- tensive study on pre-trained models for program understanding and generation,","venue":null,"work_id":"aeaf3159-3ce5-4419-af0b-bb3b4860d2aa","year":2022},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.595321Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:09c735dd4d53bc5f5ce277911edd50957458dd3be1de2ff9b152a92eedd5d669","observation_id":"0e8122c4-7dcd-42c5-b4ee-676f65a607ee","resolution":{"observed_at":"2026-08-15T15:43:04.866215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.850856Z","title":"Hyperbolic spaces,","venue":null,"work_id":"82dcdf9b-396d-4837-8eb1-bdafc7d1b6e8","year":1974},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.598774Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:46be4431cfdf44aa1632551229ca393b77191d9bd5225a4c9810c0122ab5e01d","observation_id":"d262a5c5-f323-48e6-8588-3f9b9e7b8006","resolution":{"observed_at":"2026-08-15T15:43:04.854757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.840278Z","title":"Hyperbolic image-text representations,","venue":null,"work_id":"c9adae65-0204-4cca-8e74-13649e2236cc","year":2023},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.601744Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:10cbc4e110a07fa373af233db334c6bb15cde93d2e2a3cde0c698e726db701c5","observation_id":"f16ec933-ddd6-428d-8459-7595aac87099","resolution":{"observed_at":"2026-08-15T15:43:04.844027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.828612Z","title":"Libero: Bench- marking knowledge transfer for lifelong robot learning,","venue":null,"work_id":"4d4091ac-706f-4773-94f5-424e7c5abb22","year":2023},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.604742Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:965fef057ac22339366ef3490fa8eef2ff315ff1d1de6f1ae3d0ca167ae71484","observation_id":"266bde50-db5b-4ec9-bfb9-1f57b3fb541a","resolution":{"observed_at":"2026-08-15T15:43:04.832486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.818385Z","title":"Zur elektrodynamik bewegter k ¨orper,","venue":null,"work_id":"136c1e52-5f7b-45fa-93a0-c7616bc1dbf6","year":1905},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.607850Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:80c9530c9abcecaeb33b28c726f6906eafa179ba3144e95965c2094a308ce00a","observation_id":"14f30393-63f6-4484-be68-53fb55ef1699","resolution":{"observed_at":"2026-08-15T15:43:04.821653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.806422Z","title":"Dita: Scal- ing diffusion transformer for generalist vision-language-action policy,","venue":null,"work_id":"01123ac4-065e-40cb-9aff-21f9551a957d","year":2025},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.610848Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:b83b59a2d07bf44002f64ac5f946c6803c9435e68d9b2962b218eeb7a422cedd","observation_id":"85e28ff1-6b6d-4fdf-9da2-a7318ab2f29a","resolution":{"observed_at":"2026-08-15T15:43:04.810647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.794863Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":"2c330e2a-961f-4e0d-ad83-2f77757f9bb5","year":2023},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.613767Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:6814ac886b6c1c7afb11454b30ec2f0edf2628d1ed4008e019b0f016f9b70081","observation_id":"fd6e3668-c86d-4c90-adab-f88e938af3f1","resolution":{"observed_at":"2026-08-15T15:43:04.798625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-15T15:43:04.616894Z","title":"Octo: An open-source generalist robot policy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.616894Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:ae97a47034b0eb4738a123c5ee4f3b02be84fd8e85d872e89066bd6b323c7491","observation_id":"b7d81815-f5f3-4ad1-a968-98e8a21057cc","resolution":{"observed_at":"2026-08-15T15:43:04.616894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.783258Z","title":"Tra-moe: Learning trajectory prediction model from multiple domains for adaptive policy conditioning,","venue":null,"work_id":"3cb45664-3fce-4e09-9a15-b634b5cc8874","year":2025},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.620779Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:396a3accf1daf589ad775e969f8910c5373226018ad781a52568787a7e2e979a","observation_id":"895c2bbf-5bee-4c93-9995-09c5864946e0","resolution":{"observed_at":"2026-08-15T15:43:04.787292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.772106Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models,","venue":null,"work_id":"d8e2d82a-98fb-4a32-8e5b-1f3391659347","year":2025},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.624055Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:7a340f5931fd3cbe757693d9eaae13cca29bc46b930965dcf41f50e047a280d5","observation_id":"0baec4dd-c9d3-4142-830b-0b86a2662837","resolution":{"observed_at":"2026-08-15T15:43:04.775644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:04.759689Z","title":"OTTER: A vision-language-action model with text-aware visual feature extraction,","venue":null,"work_id":"464d7fa3-d317-4a0c-b15a-a134d1ab3447","year":2025},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.627490Z"},"links":{"citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:1cf7988db26c25e0c8f249f33f260768959a771dd392012fcadad7e1739e1955","observation_id":"e2e7f64e-bc1c-4d6c-8fc8-398d7eb6489d","resolution":{"observed_at":"2026-08-15T15:43:04.763546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2602.02533."}