{"as_of":"2026-08-07T16:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e513c29810232dedecc67014a4ad2b54234ba9e545ac6ed6400d832dead842a6","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:03:03.566081Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09334/citation-record","integrity":"/paper/2507.09334/integrity","json":"/paper/2507.09334/citation-record.json","paper":"/paper/2507.09334"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:02:58.124609Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.124609Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:690e7d8eb5b3d2fc9cbba0d177b39bdeae1d6a05de0d2d4dd34c24608fd9ff7e","observation_id":"f48ccb24-04c1-4af9-ab85-115adccb60b5","resolution":{"observed_at":"2026-08-06T18:02:58.124609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T18:02:58.157375Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.157375Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:d21268edb9b39d0ba4c9e0d232dc36c71689629ab31cc4e15050a76b660626f5","observation_id":"c97d3428-4d4b-4ca9-bfc9-53a764938a49","resolution":{"observed_at":"2026-08-06T18:02:58.157375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.223606Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.223606Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:7c77dcf8dd4b455f822ab4bccc243eebabddf664a808807e386d4675ea505efb","observation_id":"451f4ec4-0adb-4693-b0e8-cf0c196b7a00","resolution":{"observed_at":"2026-08-06T18:02:58.223606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-06T18:02:58.302019Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.302019Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:ab1f7ec5fa6fec70cc9fda39325f733a4f8bcb1f9d043b2f9dd63c8b4e391983","observation_id":"5ed70302-e3d8-48dd-b8b9-60d04bc948aa","resolution":{"observed_at":"2026-08-06T18:02:58.302019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.364155Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.364155Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:6b129756099c261d29108287d79c201a89b785811042fa154b825ff244df1ef7","observation_id":"3b25b53c-588f-4af3-9966-29ef4776d0ad","resolution":{"observed_at":"2026-08-06T18:02:58.364155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.422074Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.422074Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:25541110fb6bd8ee514566dfce5330ed29b8c5e5900c89dc90e6b3a22f1b1821","observation_id":"e4cbb8fe-1c56-4b2f-8079-d6820a086803","resolution":{"observed_at":"2026-08-06T18:02:58.422074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.504730Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.504730Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:6d4a3e08cf82255da7b6a3869cf44851ee514f68fb202ea8ee8de7c98da4f3d7","observation_id":"772f2383-4452-4096-8cc5-fa90cab7567e","resolution":{"observed_at":"2026-08-06T18:02:58.504730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20092","last_updated":"2024-11-17T17:05:03Z","snapshot_observed_at":"2026-08-01T16:52:27.688910Z","submitted_at":"2024-06-28T17:57:14Z","title":"Efficient Large Multi-modal Models via Visual Context Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20092","snapshot_observed_at":"2026-08-06T18:02:58.561451Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.561451Z"},"links":{"cited_paper":"/paper/2406.20092","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:dcbd2938278cc8d92baa648919416bdbf14fe101d812707ef5585e25c312faa4","observation_id":"0e65442a-8ef8-44e2-86c1-fa56cf9150ee","resolution":{"observed_at":"2026-08-06T18:02:58.561451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.638753Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.638753Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:112846a896112ceb0919d1d21be3a4eccd7c6ebb7410d02593140f63b501af2c","observation_id":"b05cc5d5-aee2-4d4d-885f-6acb86921161","resolution":{"observed_at":"2026-08-06T18:02:58.638753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.697380Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.697380Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:699120d3c83a5c0c31af66a36cd0127404f10e95a2692b67edca8fb1a1548d1b","observation_id":"015c0e41-aed1-4605-bda8-030c0e18aaa1","resolution":{"observed_at":"2026-08-06T18:02:58.697380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.759815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.759815Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:04338a5b059083294091b03a314acb61820dbeb6a67b56fdd421d8e81a8ed0f4","observation_id":"07554a33-1893-4957-9184-ecb0773e65cf","resolution":{"observed_at":"2026-08-06T18:02:58.759815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.817271Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.817271Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:ded01ade7bb594815fc4dde1198ff25bd30b5b15601e1963075737a2a08921b1","observation_id":"3c7f5ec5-5aab-427a-bf75-90febf63009d","resolution":{"observed_at":"2026-08-06T18:02:58.817271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-05T04:37:45.202508Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-06T18:02:58.856085Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.856085Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:951af8c1fc0a8290aa013965c036e24550291735d54f5b43f7fb2b875f3021c2","observation_id":"428ab502-aaaf-46c8-9e4d-2c368183afa6","resolution":{"observed_at":"2026-08-06T18:02:58.856085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.914716Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.914716Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:c6c54b41f9646775c802a39e25234a4660cfcbaea0eb9e6b2128336d72f9c12e","observation_id":"58363efd-d264-40bf-8056-4fe131cdcc46","resolution":{"observed_at":"2026-08-06T18:02:58.914716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.972389Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.972389Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:8faeb6d556863b5855ff764fb885399f2a713a1744c3f9d7686fdf6ec7356608","observation_id":"7854f2f5-0054-4eab-884b-f903fa972108","resolution":{"observed_at":"2026-08-06T18:02:58.972389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.036403Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.036403Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:99b945a35be9804d486730cf16981649051d15f769b3cdfa15a531a3a5c0951f","observation_id":"b81c9a9c-0bd5-4dd9-aa3b-85195db93ebe","resolution":{"observed_at":"2026-08-06T18:02:59.036403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-06T18:02:59.100588Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.100588Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:d58f51800b6e75f2010aebd7b538464a6176d2c196aaa48635145497d6bf916e","observation_id":"fa1e8111-6433-4fed-b898-564526b8756d","resolution":{"observed_at":"2026-08-06T18:02:59.100588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-06T18:02:59.151702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.151702Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:9ae79aea026247fcda7a44207e535612cbea6f5037a453d83ffab388a206cb59","observation_id":"fc7c0d4e-de84-4322-8dfb-1d57500b0b96","resolution":{"observed_at":"2026-08-06T18:02:59.151702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.210209Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.210209Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:ebb78a8690ac5d38e633e971fd5dd966a85efb2e7d3196fa31c259bd295f2637","observation_id":"c344f0a6-47bd-4900-b813-e89346807cdc","resolution":{"observed_at":"2026-08-06T18:02:59.210209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.260129Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.260129Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:51f1d9d77a202a45ba6402978a2c14fbc9a3ae88111a77eb0b9e143eb0c0e6be","observation_id":"9261afb5-5d0a-4769-93d5-a5c5a9b0cb68","resolution":{"observed_at":"2026-08-06T18:02:59.260129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-06T11:39:56.281668Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-06T18:02:59.310302Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.310302Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:23a2755364c61f5c43215bdd94e5e232907fc0016a8140848e449560eed9a481","observation_id":"68ae865f-2237-4e64-b034-6bb324ef0489","resolution":{"observed_at":"2026-08-06T18:02:59.310302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T18:02:59.359288Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.359288Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:76b575f6f27f18c17a85852562c2d72622cbfd665a1853b8ca4ca3e7b2c9c848","observation_id":"18c0dbd6-b05f-4c15-a4df-c38a6f616566","resolution":{"observed_at":"2026-08-06T18:02:59.359288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03905","last_updated":"2023-09-11T20:25:16Z","snapshot_observed_at":"2026-07-06T16:15:50.904062Z","submitted_at":"2023-09-07T17:59:45Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03905","snapshot_observed_at":"2026-08-06T18:02:59.427373Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.427373Z"},"links":{"cited_paper":"/paper/2309.03905","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:f095878e81f84495413458506ce3869d2e52fe910ad568908477b8c28981f7da","observation_id":"11b29fae-b0ba-4098-9893-4791cfeeef98","resolution":{"observed_at":"2026-08-06T18:02:59.427373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.538187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.538187Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:8f6951bc9c5055e6440de929fa481b850854ed247060f8b7533d8a78d93610c7","observation_id":"dac39ce8-5bc7-49d5-bca1-aad175bc498d","resolution":{"observed_at":"2026-08-06T18:02:59.538187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.785935Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.785935Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:e1ab2eaf375169bfda1508a7fb19c510c4be7a35b53ef9c87d91e485f67a23c7","observation_id":"12dbf14c-b7ad-45d6-a642-dda8bf02b171","resolution":{"observed_at":"2026-08-06T18:02:59.785935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.896886Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.896886Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:924b47f819705ba5962a9a1a0dcd8141533a1b2d75ef2ef9708077d264c90f4c","observation_id":"d3b9fa8c-0657-4b68-ac8d-f777b35998c1","resolution":{"observed_at":"2026-08-06T18:02:59.896886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.330637Z","title":null,"venue":null,"work_id":"3269ccf5-15fa-412a-99c5-56d5a9377339","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.961573Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:bc6dd697f763dbed1cca3515627d7b929d5405ef543eac0c11e42a42eec27296","observation_id":"ee98cb67-0a3a-478b-9812-a7ad333c6f60","resolution":{"observed_at":"2026-08-06T18:03:04.333211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.981076Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.981076Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:e6f21866259524a4471080bf7849e7cdb59e3573d7af48fcdce7d1d55736b387","observation_id":"3eb360f5-3190-4106-8bdc-1133acb30210","resolution":{"observed_at":"2026-08-06T18:02:59.981076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.317588Z","title":null,"venue":null,"work_id":"1bc33e25-7d24-4007-b1f2-419d2df25a82","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.100464Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:20f707c69e427765f21555032e59318c0b4bf37b5f42568dcfd799276f8dd784","observation_id":"d929c75e-a43d-4e5b-a955-1e35386283a2","resolution":{"observed_at":"2026-08-06T18:03:04.320759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-06T08:47:48.830818Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-06T18:03:00.188535Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.188535Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:cedfdac009feb31d90d452b4439d943b7149ef76fe011e4fef5c8a6860267f57","observation_id":"14f17569-c587-46af-bf64-25ab994e7398","resolution":{"observed_at":"2026-08-06T18:03:00.188535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-06T18:03:00.275263Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.275263Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:82a5040c5d6c9272827496144c26a51205f232d516d1b18f51fb571dc29e57b1","observation_id":"6d6927c8-a06d-4f62-82f4-2feec4d9382f","resolution":{"observed_at":"2026-08-06T18:03:00.275263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.309277Z","title":null,"venue":null,"work_id":"4f40ccda-d7d6-499e-a508-13bba8152c4b","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.390648Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:1f0410147d76d6671165f7746ce06a6f2694eb0e4b3622bf0b9137a856505128","observation_id":"31965077-7e67-48fe-aaa2-ced25d9f7d75","resolution":{"observed_at":"2026-08-06T18:03:04.312278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:00.515248Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.515248Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:a0243eaa150b81cb1f5b6ccd822eb56aad90eb30c41b15efa16f8077effed16f","observation_id":"e7bd4f78-18c4-45ac-8ee2-59ab9ed91133","resolution":{"observed_at":"2026-08-06T18:03:00.515248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.296641Z","title":null,"venue":null,"work_id":"549da7f8-0efd-486c-92ff-bbff1a7a4128","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.648257Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:bd0956b6dca790c7ae4ca4e7f4da3cc792e68dcc2d1dfe37030d9e5530110f8b","observation_id":"943b7901-d968-4229-9a6e-ea74284ac571","resolution":{"observed_at":"2026-08-06T18:03:04.299584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02268","last_updated":"2025-01-04T12:14:42Z","snapshot_observed_at":"2026-07-06T20:16:31.769559Z","submitted_at":"2025-01-04T12:14:42Z","title":"What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02268","snapshot_observed_at":"2026-08-06T18:03:00.712937Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.712937Z"},"links":{"cited_paper":"/paper/2501.02268","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:47a4f5d09df7493065bbf07e7842243c95025310e4e20057f785ef1cba0fe66d","observation_id":"4d279c18-dd29-4371-a6dd-b9afe731d86f","resolution":{"observed_at":"2026-08-06T18:03:00.712937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.288519Z","title":null,"venue":null,"work_id":"6aec8cc4-658e-4709-bacf-be78e6b4f70c","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.796668Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:2f66ccb4d3f4e68a6dd3a9575b5c40d7fc37af45bafeb5fdf53b1aa2250cf273","observation_id":"263f6650-c2bf-406b-bdf2-e5da196521b9","resolution":{"observed_at":"2026-08-06T18:03:04.291211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00255","last_updated":"2025-02-20T18:06:19Z","snapshot_observed_at":"2026-08-06T16:07:39.342941Z","submitted_at":"2024-09-30T21:55:38Z","title":"Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00255","snapshot_observed_at":"2026-08-06T18:03:00.870564Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.870564Z"},"links":{"cited_paper":"/paper/2410.00255","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:7e85947381164fdb2a53bd8ae5838ea5b5a6186ab52b7c4d2ffb9048a9571ac6","observation_id":"a944f717-4782-49d0-8b83-340b38a70338","resolution":{"observed_at":"2026-08-06T18:03:00.870564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:00.965145Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.965145Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:4dc3ec9597f6cfd30129450649ed34ab181e0fe2c8b066fb213e0a01a2bbe409","observation_id":"7346c2f8-6b98-4f16-8a59-a2848d296f0d","resolution":{"observed_at":"2026-08-06T18:03:00.965145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-07-06T20:28:57.453439Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19036","snapshot_observed_at":"2026-08-06T18:03:01.186306Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.186306Z"},"links":{"cited_paper":"/paper/2501.19036","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:2169c3014df1725f3798799f7a7084bf6940cc01748dbd3ea393c24d0b6d2df6","observation_id":"58936284-d05d-4d50-9943-35cc6971894e","resolution":{"observed_at":"2026-08-06T18:03:01.186306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T18:03:01.298449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.298449Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:4b12491123ffcdedec6ae79361500bae520fc5274dee593e0ba515b38d7e4b2a","observation_id":"0c424190-ddff-486c-a6ef-16aaf8b4e4ef","resolution":{"observed_at":"2026-08-06T18:03:01.298449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:01.384970Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.384970Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:7d8a8a799bfc3137e2eb8bfe450ee755f518772cab0ba88753f53104e5c0830d","observation_id":"7d46be39-c1eb-43b0-a664-74208764c257","resolution":{"observed_at":"2026-08-06T18:03:01.384970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-03T03:15:29.208149Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-06T18:03:01.459589Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.459589Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:59100f06bccef1a001c8bebe4b3ad4756e18b6b6b4b90b78ac08f2402b571864","observation_id":"ba871690-ba73-4293-b9cb-ef2c964ae505","resolution":{"observed_at":"2026-08-06T18:03:01.459589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05803","last_updated":"2025-01-25T15:59:57Z","snapshot_observed_at":"2026-07-06T18:12:05.439027Z","submitted_at":"2024-05-09T14:38:53Z","title":"Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05803","snapshot_observed_at":"2026-08-06T18:03:01.514560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.514560Z"},"links":{"cited_paper":"/paper/2405.05803","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:0a6f736544e371e7dec151fb3648cefcad418e955c72472859d1af5d2dd3c5f4","observation_id":"8b21d098-658d-4f82-8300-bd55089c689f","resolution":{"observed_at":"2026-08-06T18:03:01.514560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.265973Z","title":null,"venue":null,"work_id":"198b3476-b4da-480b-8b31-bc2ba7003555","year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.598313Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:f701496d3934b7e605d3feb75960bfe243a7dbe8aae0acac02d48e96b201b419","observation_id":"d5ab953b-5a41-4c58-abc4-31cbd716dbe0","resolution":{"observed_at":"2026-08-06T18:03:04.268643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05785","last_updated":"2024-07-22T03:21:27Z","snapshot_observed_at":"2026-08-05T03:56:22.669895Z","submitted_at":"2024-06-09T13:52:12Z","title":"A Survey on Text-guided 3D Visual Grounding: Elements, Recent Advances, and Future Directions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05785","snapshot_observed_at":"2026-08-06T18:03:01.736901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.736901Z"},"links":{"cited_paper":"/paper/2406.05785","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:71bfc65e1612ee8267f72f22a84511723ed9726adf482b006cd9021a12c1b0fb","observation_id":"4209fa98-41a5-4b90-8146-f2305a0afdd0","resolution":{"observed_at":"2026-08-06T18:03:01.736901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07403","last_updated":"2024-07-12T03:58:05Z","snapshot_observed_at":"2026-08-07T09:29:22.417640Z","submitted_at":"2024-07-10T06:57:58Z","title":"A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07403","snapshot_observed_at":"2026-08-06T18:03:01.862985Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.862985Z"},"links":{"cited_paper":"/paper/2407.07403","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:6166c3603480e9e4331545278a2d1dd123551c29d73e168247e555ef050f3093","observation_id":"63d6651f-e8da-4f2f-b415-e3cce06f15ba","resolution":{"observed_at":"2026-08-06T18:03:01.862985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.257785Z","title":null,"venue":null,"work_id":"a9eb3c5d-4dd4-46df-87cc-9ad7f8b52376","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.958274Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:d6b426d104992299c76eca0138117710447c50c6eaeee293ec18fc459cddc857","observation_id":"aaad7d22-b811-41a8-bde0-57f758a96a4a","resolution":{"observed_at":"2026-08-06T18:03:04.260407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:02.096446Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.096446Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:a4cf8e4eb411059d4b4e16bedeff8f95c55a00de5188f537a72b7d511062857a","observation_id":"c4dfc515-b507-46d5-bb4a-5c2bee356090","resolution":{"observed_at":"2026-08-06T18:03:02.096446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T18:03:02.177529Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.177529Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:3684ccb5247a209d132a1bf283749610dac824c269b0c9d510839c7ef2f4f4c4","observation_id":"8e495855-3c2f-4e86-871d-c49d21bf92f7","resolution":{"observed_at":"2026-08-06T18:03:02.177529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-07-06T14:05:02.813765Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-06T18:03:02.275383Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.275383Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:9722b942282799e617d567cfa30ba10b91f1afede147e11e713a15e89dbf20e8","observation_id":"c05b8ad3-7462-4d43-a348-e4e2897b91a0","resolution":{"observed_at":"2026-08-06T18:03:02.275383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.244560Z","title":null,"venue":null,"work_id":"2cb088ea-2873-49d3-b3eb-8fb339cc5883","year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.387663Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:1126ab8abed36f7d57594dfa11b757c27d9e29e340ab6e7abda474d52043fcad","observation_id":"cc8d66a7-de7c-48f2-ab20-092c5b8e0252","resolution":{"observed_at":"2026-08-06T18:03:04.247401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04334","last_updated":"2024-06-06T17:59:34Z","snapshot_observed_at":"2026-08-01T08:01:34.798822Z","submitted_at":"2024-06-06T17:59:34Z","title":"DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04334","snapshot_observed_at":"2026-08-06T18:03:02.529236Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.529236Z"},"links":{"cited_paper":"/paper/2406.04334","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:b2c1b714c1aa98cb491a7fd0fed1e23b6bfacfd22d2215bc572fe71a94ae0962","observation_id":"c6747194-ffa5-4fad-a468-8e298098a2ef","resolution":{"observed_at":"2026-08-06T18:03:02.529236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T18:03:02.638809Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.638809Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:f1245f6e316565fec841ceebeacdcebcb54b46d35d7a5582275f4cc4b64f853f","observation_id":"b4fb18f8-b5c6-409b-bd09-a7820b23a8e8","resolution":{"observed_at":"2026-08-06T18:03:02.638809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:02.775854Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.775854Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:4a72bee1f1e8e19087b109c6b47b69578b06f8285380f4722a3015222f20577b","observation_id":"aa459827-2401-489d-9602-c3cc74856acb","resolution":{"observed_at":"2026-08-06T18:03:02.775854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.230981Z","title":null,"venue":null,"work_id":"eaaeb1cb-07f4-4486-b9f0-1c440a139822","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.909116Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:ab414ad91e2db773d421fb13bfe09b798ec46f331a441f7d3565a52a85df820d","observation_id":"f00de20a-bd16-44f9-a5d5-e95b21d78b99","resolution":{"observed_at":"2026-08-06T18:03:04.234376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.223052Z","title":null,"venue":null,"work_id":"d10736ec-2551-4f3e-aa01-0e6ab419db69","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.982828Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:64d38525a44fa51c5c1cdcb23214a0cdaca61ca1db67b07fcf86f1985d842044","observation_id":"beb01344-99fc-4f67-8d51-9643a7b40d2b","resolution":{"observed_at":"2026-08-06T18:03:04.225873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.159380Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.159380Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:4b36427d4fc31bf7967a4bf7fa89219ca32dff6a7f2a7fc791e7471f15859eff","observation_id":"10c1911f-5be5-43f9-a8e1-23036f06c7d8","resolution":{"observed_at":"2026-08-06T18:03:03.159380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.419032Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.419032Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:2cd87ae88b02d7bd1a0e394ff1930f2c942b35f62d507b98a2f0628fa8738fff","observation_id":"85fc4b70-9b34-4241-9f9d-26410c2934b0","resolution":{"observed_at":"2026-08-06T18:03:03.419032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.193413Z","title":null,"venue":null,"work_id":"0274b822-926e-4b32-86db-8e102b4ac431","year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.476300Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:991d3562690f284876858c41f95170dfbf9d5b05d6fd157b413cc5a908397d78","observation_id":"d3d5e37a-1175-423d-9e07-11cfb0186ccc","resolution":{"observed_at":"2026-08-06T18:03:04.196313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.479044Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.479044Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:9b0eb9b611ffc0e3cf993d0ab14561411652a571453f555074b748ccf52a4221","observation_id":"1d2efe2b-79bc-4dd7-8171-3abf4037646f","resolution":{"observed_at":"2026-08-06T18:03:03.479044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17455","last_updated":"2024-06-13T19:15:53Z","snapshot_observed_at":"2026-08-03T06:49:43.570563Z","submitted_at":"2023-05-27T12:07:21Z","title":"CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17455","snapshot_observed_at":"2026-08-06T18:03:03.482002Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.482002Z"},"links":{"cited_paper":"/paper/2305.17455","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:e44562a7a3fce631b358b56617de644e64cbf5b2511ac15408a5b44938a05626","observation_id":"826bb000-010a-4fe9-af72-5ff6515c331f","resolution":{"observed_at":"2026-08-06T18:03:03.482002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.204410Z","title":"Advances in neural information processing systems 34 (2021), 13937–13949","venue":null,"work_id":"c04df3ab-15ce-4bdb-8c7b-11f63a308797","year":2021},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.473632Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:b7a3d6ee021351f177f646435b7ba11827b6ab43b7a9cbe09c77d5a75fe6eacb","observation_id":"f625af16-3a32-43a3-b587-62a26cd8d262","resolution":{"observed_at":"2026-08-06T18:03:04.207795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T18:03:03.488481Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.488481Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:5ef859c442c5b3e9b17321a61087313e28fc8c7d687f893d45cdc551df370c5c","observation_id":"8e66426c-04bb-4b6e-ba8d-17fa51174131","resolution":{"observed_at":"2026-08-06T18:03:03.488481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.491561Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.491561Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:b5b7e951655eb2ff83d7955bfe5144d5aa8b5e825fefca169c02e96e5d5ba003","observation_id":"fd9a1140-07e0-493f-9aba-660ef3bda262","resolution":{"observed_at":"2026-08-06T18:03:03.491561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.494966Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.494966Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:05959a22cb1df672c5360aa836b819e7ea66140edf60ca4d218f28dcf8e6f774","observation_id":"8cd510ac-b256-40bb-8011-9c7fe44dc19e","resolution":{"observed_at":"2026-08-06T18:03:03.494966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.485061Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.485061Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:bcdcb8ed6dd030af40008e9872d52f22011a3d7b7e0bafc74261bee965f888a3","observation_id":"a7e98b14-bf4d-4ba0-b598-48ecc44be977","resolution":{"observed_at":"2026-08-06T18:03:03.485061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.160802Z","title":null,"venue":null,"work_id":"ff3f8693-d145-4bd9-859e-cc5a69a2004c","year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.500422Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:f99216064911c161c8f9e2a91374a7bd3f9af8e0e2150b067c49d48aa997e3f9","observation_id":"12439054-5c02-4e68-95df-1195896b9604","resolution":{"observed_at":"2026-08-06T18:03:04.163793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.506443Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.506443Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:e99615caa3cd118e636d3528a3b51c19ff59149ad53b62b3263c69630114419d","observation_id":"31a64dc9-6dae-47d2-8735-d4d256d72e78","resolution":{"observed_at":"2026-08-06T18:03:03.506443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.509381Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.509381Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:e609dab9d97f0eca593391327624c3bc7fa01dd94d2fea041ab3d15ad538cc79","observation_id":"1c0768b6-6793-4731-a6e9-a2dbe0c99a8a","resolution":{"observed_at":"2026-08-06T18:03:03.509381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.169000Z","title":null,"venue":null,"work_id":"5268a00e-3f9b-4c00-9b52-3f5620140b12","year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.497751Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:4aeb38c667f23cad6d186ba8dd008fa0caca45e4817bc2516d585813cf8a3d2d","observation_id":"6db3fe3b-5dfe-4b00-85e9-0b3513d74123","resolution":{"observed_at":"2026-08-06T18:03:04.171716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.132421Z","title":null,"venue":null,"work_id":"af87b5ae-616a-4160-a376-f831faa3fca0","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.517025Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:0c83eb05f7353fc09dc3b41b35be8ff4e4ad4a02a9ae8f7ca83ead61134f8d05","observation_id":"b402ff32-e7ce-435a-9dfc-b27fa2980217","resolution":{"observed_at":"2026-08-06T18:03:04.135222Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05819","last_updated":"2024-12-08T05:29:39Z","snapshot_observed_at":"2026-08-03T19:45:14.759418Z","submitted_at":"2024-12-08T05:29:39Z","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05819","snapshot_observed_at":"2026-08-06T18:03:03.503424Z","title":"arXiv preprint arXiv:2412.05819 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.503424Z"},"links":{"cited_paper":"/paper/2412.05819","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:5795e673aaceaf76878bec3bf01e777a382aca74098a1fa804b22f2900aa2874","observation_id":"bf08dcb9-4566-433e-b52b-f72d9f749cab","resolution":{"observed_at":"2026-08-06T18:03:03.503424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-04T13:01:39.904947Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T18:03:03.521866Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.521866Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:8e6e18ed680fbd3590df85b5eaef0675c8bd43528139df3daecd7c48da75a567","observation_id":"710f3385-21c6-4bd4-b355-9f7a54843c1a","resolution":{"observed_at":"2026-08-06T18:03:03.521866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10197","last_updated":"2024-12-25T04:30:16Z","snapshot_observed_at":"2026-07-06T19:16:01.172484Z","submitted_at":"2024-09-16T11:43:19Z","title":"Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10197","snapshot_observed_at":"2026-08-06T18:03:03.524477Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.524477Z"},"links":{"cited_paper":"/paper/2409.10197","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:e3c04528c63a39766e7f3f084468b26e4b3c03f6f75df440992aff2e0aef98ec","observation_id":"9d18b4bf-9bd0-4340-9b6c-470f3b9efc82","resolution":{"observed_at":"2026-08-06T18:03:03.524477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.140867Z","title":"In Findings of the Association for Computational Linguistics: NAACL","venue":null,"work_id":"53411cf4-67ee-40f7-8087-859806f4c03f","year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.511790Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:22501195a06c1f0248b2b741ab65223b63c5fcbdcab901e9faa8493b6b0ef5d5","observation_id":"093a4a1a-8679-4475-b912-ffb8858f64e3","resolution":{"observed_at":"2026-08-06T18:03:04.144483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-02T00:22:05.597306Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-06T18:03:03.514224Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.514224Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:7920bc9bf2a8e4dbc2f6b9ba97c649c4b7209d33413536b69e990a33f6f002f2","observation_id":"787ddb93-6028-4bca-8479-89bbd6852216","resolution":{"observed_at":"2026-08-06T18:03:03.514224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-03T09:36:51.057026Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18450","snapshot_observed_at":"2026-08-06T18:03:03.534576Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.534576Z"},"links":{"cited_paper":"/paper/2412.18450","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:fae08a182c66e1fdb685c9390d4bde1ba70a5a8aaa65370177477e6973438d11","observation_id":"1643fde7-2768-4b46-bc1c-8a6a60bbdb1c","resolution":{"observed_at":"2026-08-06T18:03:03.534576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.123959Z","title":null,"venue":null,"work_id":"5f887f9f-f8be-4c7b-84cc-9036ee639d62","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.519321Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:e6b663b1b62c7ef0eb210ddb020284591f89325819c233c7872c4f5b235255ca","observation_id":"69cbbbb6-fb80-4d49-9b2c-da94686edd61","resolution":{"observed_at":"2026-08-06T18:03:04.126834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.094164Z","title":null,"venue":null,"work_id":"adf6d239-9f68-46b9-a0f4-2def9f076985","year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.542291Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:f02b1bd106a9dac213ba4c3132f1eadf5f566694f9b1f023a4fafb82e1c4eb8c","observation_id":"4583d938-0a81-440b-aa6e-02f54282bb68","resolution":{"observed_at":"2026-08-06T18:03:04.097685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00556","last_updated":"2024-12-08T04:41:32Z","snapshot_observed_at":"2026-07-06T19:59:28.832182Z","submitted_at":"2024-11-30T18:54:32Z","title":"Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00556","snapshot_observed_at":"2026-08-06T18:03:03.544777Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.544777Z"},"links":{"cited_paper":"/paper/2412.00556","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:6c64ed581eb2d08177a183682ad0e214a5804d9ea789d34d19d7a2b5aaebf970","observation_id":"35ef04ae-baf7-481c-b4bf-7ee6ea162144","resolution":{"observed_at":"2026-08-06T18:03:03.544777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.116345Z","title":null,"venue":null,"work_id":"7e01f30f-cc2a-4bb0-897e-738217c3a0bd","year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.527088Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:ff80c9aaf68524cec21268e96e7c7f57af4a36c35e25fc4c8eda620c1513dbaf","observation_id":"c5403498-287f-4bc9-8c20-0ef179aba5b5","resolution":{"observed_at":"2026-08-06T18:03:04.118907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-06T18:03:03.529576Z","title":"arXiv preprint arXiv:2406.12275 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.529576Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:6771a752f50bc0d58f814695dc193d12303922a5544929dec724f909c58c193e","observation_id":"84c13542-3f1b-49c4-b010-e4b1694cf24c","resolution":{"observed_at":"2026-08-06T18:03:03.529576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.108440Z","title":null,"venue":null,"work_id":"8d9419ee-f2b3-4b22-9fd9-f4e1d49852d5","year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.532227Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:ea444fefe8bfa6787d0001f4f8e7524cdd07a114c9eb59b5d98a2954ffa96034","observation_id":"3b558d08-a2d2-449c-80fc-1505b8cbf49d","resolution":{"observed_at":"2026-08-06T18:03:04.111097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-08-06T18:03:03.555597Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.555597Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:87fcaefa6604621439c41b076aac973bd9d4685b622b026b8cfe8bd6fbbd60f7","observation_id":"b344fd13-b7d1-46a2-af72-80b526c10748","resolution":{"observed_at":"2026-08-06T18:03:03.555597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.537492Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.537492Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:b4c5eaa90a5bfdd0d8a5d794430361d7df6c0d5d7b32a30fcd5500aae539f6b9","observation_id":"ebf472a7-2538-4504-9b01-4bad846c8f82","resolution":{"observed_at":"2026-08-06T18:03:03.537492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-06T18:03:03.539721Z","title":"arXiv preprint arXiv:2410.04417 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.539721Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:adf05c527aafdf606759ebc8147f9eb1f44eaa93163ac3e5b3ec7f9b334c3a7f","observation_id":"098af109-893c-4b64-a642-5475658e6011","resolution":{"observed_at":"2026-08-06T18:03:03.539721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.083316Z","title":null,"venue":null,"work_id":"eac57beb-7b59-4ddd-9caf-d672afc978f8","year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.563680Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:f6fbd2e31b7206203909b32e52e7464f41e077d00cca0d1e9ca3da3c89b3393c","observation_id":"688744cc-7d1a-49a3-a462-de351c6c7125","resolution":{"observed_at":"2026-08-06T18:03:04.088401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03324","snapshot_observed_at":"2026-08-06T18:03:03.547382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.547382Z"},"links":{"cited_paper":"/paper/2412.03324","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:3f9eb7491e6c82a17c9f73c84ee056479ba54b619f2334c857e46e6bc7eaf006","observation_id":"bded14ac-604b-402d-8a64-1dfa3143d598","resolution":{"observed_at":"2026-08-06T18:03:03.547382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03456","last_updated":"2024-10-09T01:01:34Z","snapshot_observed_at":"2026-08-03T12:53:03.694919Z","submitted_at":"2024-10-04T14:14:28Z","title":"Dynamic Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03456","snapshot_observed_at":"2026-08-06T18:03:03.550076Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.550076Z"},"links":{"cited_paper":"/paper/2410.03456","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:d2240edeed78e9c9e5571d1894515ddf39b13ee1ac17660f5767e17b50bb3f32","observation_id":"87499f39-b287-4cd0-b263-0a6eadf54e95","resolution":{"observed_at":"2026-08-06T18:03:03.550076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11808","last_updated":"2024-10-16T14:18:53Z","snapshot_observed_at":"2026-08-04T09:09:13.669644Z","submitted_at":"2024-03-18T14:05:52Z","title":"Dynamic Tuning Towards Parameter and Inference Efficiency for ViT Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11808","snapshot_observed_at":"2026-08-06T18:03:03.553163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.553163Z"},"links":{"cited_paper":"/paper/2403.11808","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:f3be72a2ff48aad564191b536a0eb5609cac27f427ed902d786301cfd64717f4","observation_id":"6a42d758-339c-4ce3-842c-429e342f8015","resolution":{"observed_at":"2026-08-06T18:03:03.553163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06773","last_updated":"2023-10-10T16:49:21Z","snapshot_observed_at":"2026-08-07T09:42:09.287521Z","submitted_at":"2023-10-10T16:49:21Z","title":"Uni3D: Exploring Unified 3D Representation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06773","snapshot_observed_at":"2026-08-06T18:03:03.558444Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.558444Z"},"links":{"cited_paper":"/paper/2310.06773","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:4c1c1a6fcd44c82af39b52c5ea27238d91d26d17f927aa4b824ce22b128056e4","observation_id":"5276eb9e-4006-4c13-852f-11657fbe3d35","resolution":{"observed_at":"2026-08-06T18:03:03.558444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T18:03:03.561057Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.561057Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:507c8c7f2943395b4bd3ee92fc7913b89984bff73490dc6ca140e98a43b6e7d8","observation_id":"88aba4f5-63ef-40eb-bcbc-6f0cab7a4d4c","resolution":{"observed_at":"2026-08-06T18:03:03.561057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20105","last_updated":"2024-12-28T10:17:29Z","snapshot_observed_at":"2026-07-06T20:14:03.824268Z","submitted_at":"2024-12-28T10:17:29Z","title":"ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20105","snapshot_observed_at":"2026-08-06T18:03:03.566081Z","title":"arXiv preprint arXiv:2412.20105 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.566081Z"},"links":{"cited_paper":"/paper/2412.20105","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:05aba8429a5432fc88e70c4e516ed9010cd1dca91e8bcdf817797bf7a0ba1baf","observation_id":"b6237571-f163-467e-89ff-16f506e8ad34","resolution":{"observed_at":"2026-08-06T18:03:03.566081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.680523Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence 44, 11 (2021), 7436–7456","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.680523Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:64f06225e724653dba37b3bc58e3889bbf744dce5c15abbd09492c5357ae01bb","observation_id":"ae7110bb-e2d5-42b2-8559-7285a281dae2","resolution":{"observed_at":"2026-08-06T18:02:59.680523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:01.029960Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.029960Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:e97d6e045ed59522eda6c34eec9371618bdecaa29669cabb895dfed36086f9c3","observation_id":"65fb1d5d-d32b-4f50-9781-e7455cb29b16","resolution":{"observed_at":"2026-08-06T18:03:01.029960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-06T23:31:17.110793Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-08-06T18:03:03.297222Z","title":"arXiv preprint arXiv:2501.01428 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.297222Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:a4f8f821ccbf5ce66a8a671c294689c20b8f44d3275636756b66ae18129b3ebc","observation_id":"79870942-2f3b-4997-919b-9adaf1f622a7","resolution":{"observed_at":"2026-08-06T18:03:03.297222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2507.09334."}