{"as_of":"2026-08-08T02:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52b02497bcf655b85d3fd2f26a4bd4e44539a57d6bf8ce35d01f2022c8032ac2","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:46:18.874616Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:28:28.887051Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T22:15:22.050578Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"cited_work":{"arxiv_id":"2505.21079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21079","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uni3d-moe: Scalable multimodal 3d scene understanding via mixture of experts","venue":null,"work_id":"fd9704d6-65d4-4640-817d-0fe9251b3595","year":2025},"citing_paper":{"arxiv_id":"2511.11232","last_updated":"2026-04-13T12:34:13Z","snapshot_observed_at":"2026-08-02T16:17:00.224448Z","submitted_at":"2025-11-14T12:32:45Z","title":"DoReMi: Bridging 3D Domains via Topology-Aware Domain-Representation Mixture of Experts","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T22:12:51.364157Z"},"links":{"cited_paper":"/paper/2505.21079","citing_paper":"/paper/2511.11232"},"observation_digest":"sha256:4c91d604f00bd06703cfafb42924eb682ca0eea496f662d799404e66a526864a","observation_id":"5b933114-d814-4c29-94b1-37285e3b4ebb","resolution":{"observed_at":"2026-05-17T22:15:22.052701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21079","snapshot_observed_at":"2026-08-06T04:28:28.887051Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05137","last_updated":"2026-08-05T17:56:35Z","snapshot_observed_at":"2026-08-08T02:13:15.150942Z","submitted_at":"2026-08-05T17:56:35Z","title":"SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T04:28:28.887051Z"},"links":{"cited_paper":"/paper/2505.21079","citing_paper":"/paper/2608.05137"},"observation_digest":"sha256:08849c14a6ade835d3738e18514a279c7f0ebd3af05b097e28b5dcd699b8399c","observation_id":"15f2ecf4-f69a-407a-b325-57b9f5e01fa5","resolution":{"observed_at":"2026-08-06T04:28:28.887051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21079/citation-record","integrity":"/paper/2505.21079/integrity","json":"/paper/2505.21079/citation-record.json","paper":"/paper/2505.21079"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:12.590741Z","title":"Hierar- chical open-vocabulary 3d scene graphs for language-grounded robot navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:12.590741Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:fb9725ce4d4cc52176a416bcd285c23d0f21d0711050ef36193a84dd9303bc9e","observation_id":"abe1037d-31f3-4496-9bcd-17cc3458f866","resolution":{"observed_at":"2026-08-07T13:46:12.590741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:12.656160Z","title":"Sg-nav: Online 3d scene graph prompting for llm-based zero-shot object navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:12.656160Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:11765d4de7eef3ade86a1a2e4a29745460baa4dc59731602d32cad797f23c21b","observation_id":"0e020615-500f-4fae-9edb-73a28b292d0c","resolution":{"observed_at":"2026-08-07T13:46:12.656160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:12.709715Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for perception and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:12.709715Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:64172c495739e2c95cc0fcb4a39885549c3a7db4ece01a02776c4dc8238189f4","observation_id":"66875d4e-66bb-4eda-9f02-e8ec46ad5fd4","resolution":{"observed_at":"2026-08-07T13:46:12.709715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:12.757264Z","title":"Multi-modal data-efficient 3d scene understanding for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:12.757264Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:e7246342f3f00470e493dffb28d85f9bed207240200c5afc374c38afe12de90a","observation_id":"0b088345-0db1-4df2-872f-155d2b587552","resolution":{"observed_at":"2026-08-07T13:46:12.757264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:12.826322Z","title":"Dme-driver: Integrating human decision logic and 3d scene perception in autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:12.826322Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:e368ee88c0bc5ff267733c14f9ce73ede7760a096071366c1a09e8f937018788","observation_id":"fae8e8b4-7b35-46bf-9ab1-af8a33b52cd5","resolution":{"observed_at":"2026-08-07T13:46:12.826322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:12.905153Z","title":"Drivinggaus- sian: Composite gaussian splatting for surrounding dynamic autonomous driving scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:12.905153Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:31cd8b3979e60068e8004745dde6c4334d1d203ed10e80076f89fe56a772b9fd","observation_id":"0106f186-2589-4936-9d5f-189914c03086","resolution":{"observed_at":"2026-08-07T13:46:12.905153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:12.979659Z","title":"Editable scene simulation for autonomous driving via collaborative llm-agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:12.979659Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:b43bd5376f79976ccbb0aee0c3e8c47c66a764e295193e696dc212c764a0e282","observation_id":"d46c641b-4510-45e9-98ae-738e371fd414","resolution":{"observed_at":"2026-08-07T13:46:12.979659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:13.027357Z","title":"How to enable llm with 3d capacity? a survey of spatial reasoning in llm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.027357Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:26999ec2768bec74a25e4cb648660fabecd25e3853c83e52fe1117fd54da9e0f","observation_id":"93596bd4-263d-4455-8adb-1f4d7365138f","resolution":{"observed_at":"2026-08-07T13:46:13.027357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:13.059529Z","title":"Scenecraft: An llm agent for synthesizing 3d scenes as blender code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.059529Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:088552b145a6d110d979b4c0c5b7e386ccc2569c89e9b2f58a3e5037a2e5c203","observation_id":"53c7b625-754b-420c-a522-4ec004070c13","resolution":{"observed_at":"2026-08-07T13:46:13.059529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-06T11:39:56.281668Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-07T13:46:13.113531Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.113531Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:95dcb1995eab03f51601e6f47372f7c427fdb87ada5668f52166f06321394b23","observation_id":"8adc1b71-2718-4873-932d-b18a1222c50c","resolution":{"observed_at":"2026-08-07T13:46:13.113531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-05T04:37:45.202508Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-07T13:46:13.184192Z","title":"Grounded 3d-llm with referent tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.184192Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:8d67f5e7f9b0cb8f8b1a83a6187a3e3e88dbd25c4d102fc80425c47428a7c2eb","observation_id":"55ce2427-d730-489e-881a-b95412075880","resolution":{"observed_at":"2026-08-07T13:46:13.184192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16993","last_updated":"2024-03-25T17:55:52Z","snapshot_observed_at":"2026-08-03T13:33:56.174276Z","submitted_at":"2024-03-25T17:55:52Z","title":"Comp4D: LLM-Guided Compositional 4D Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16993","snapshot_observed_at":"2026-08-07T13:46:13.236790Z","title":"Comp4d: Llm-guided compositional 4d scene generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.236790Z"},"links":{"cited_paper":"/paper/2403.16993","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:97aba3da7be2e55506357ace80b01b0b2a6966b7fa5ca2a631ee384b70dadf58","observation_id":"31d7a077-b571-46c9-ae5e-87c0b1ef5c3a","resolution":{"observed_at":"2026-08-07T13:46:13.236790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:13.286561Z","title":"Llm-grounder: Open-vocabulary 3d visual grounding with large language model as an agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.286561Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:78920dc338413f3182cd1866f505747478c901a85b114951bc5fdbf989a7c6d4","observation_id":"1f3c1414-9e44-478f-9482-700086ccecaf","resolution":{"observed_at":"2026-08-07T13:46:13.286561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-02T00:22:05.597306Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-07T13:46:13.319972Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.319972Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:9a4a11e98ea39ca0a4a8067232afe3c4ebd733049e99252c40bd47e194a4385c","observation_id":"80c3b379-7431-4a6f-a63a-360908578eb8","resolution":{"observed_at":"2026-08-07T13:46:13.319972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:13.372156Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.372156Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:f6b58ec068897a9f4b0a79342b7871558462439e62d9073de57d13d70e97f68a","observation_id":"2f8a92f6-16a5-411d-929d-e212a398ab36","resolution":{"observed_at":"2026-08-07T13:46:13.372156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-06T23:31:17.110793Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-08-07T13:46:13.435631Z","title":"Gpt4scene: Understand 3d scenes from videos with vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.435631Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:813523e4c648d66716313f7e0597afb6d06ceb5aaeb78e0bcd37e43b9d407f3d","observation_id":"59c48915-716a-45af-a6a2-7de31346977a","resolution":{"observed_at":"2026-08-07T13:46:13.435631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00493","last_updated":"2025-03-27T10:30:42Z","snapshot_observed_at":"2026-07-06T19:59:28.832182Z","submitted_at":"2024-11-30T14:28:53Z","title":"Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00493","snapshot_observed_at":"2026-08-07T13:46:13.494993Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.494993Z"},"links":{"cited_paper":"/paper/2412.00493","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:8601015d1f7c280470529b3d14428fe27da95047d20c2593cf131ee060ea7ac1","observation_id":"31acac97-89dd-432e-855f-aef3ea07a7bd","resolution":{"observed_at":"2026-08-07T13:46:13.494993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:13.552321Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.552321Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:36a2122f16f2807b197dc44dee7d26592f8934532e21bd2ff63e2571b211b2e4","observation_id":"c01c3fa4-4a1b-4a66-967e-dce7171274df","resolution":{"observed_at":"2026-08-07T13:46:13.552321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:13.583155Z","title":"Scan2cap: Context-aware dense captioning in rgb-d scans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.583155Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:e8a9a3b6241010c07eadae81c6cb5ab90fc9477876578936d1565a69fa70598a","observation_id":"5b4c3c6c-2eaf-420f-8276-b0542cabdb5d","resolution":{"observed_at":"2026-08-07T13:46:13.583155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-07-06T14:05:02.813765Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-07T13:46:13.614106Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.614106Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:73da7c3606fd9cbaf8c5d4a820320f0f7d1cc460b23aabd2c637058d8558b85a","observation_id":"0c12676b-a1a9-41a5-b575-7c99e3bc2948","resolution":{"observed_at":"2026-08-07T13:46:13.614106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:13.679474Z","title":"Pointllm: Empower- ing large language models to understand point clouds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.679474Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:970d37eb7c7cfc6ca3f43527a2f902ae1b6d1e2356463edd70d9a88b764ce1f1","observation_id":"df72ca07-5be0-496b-8169-c3e3f170f8d9","resolution":{"observed_at":"2026-08-07T13:46:13.679474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-07T13:46:13.736700Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.736700Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:a3adcd42e7a3eea2be7bdfa8ecbb93f93b9058c7d3c8c2dbccf946c941c813d8","observation_id":"1fb51303-b186-4311-81fd-ed0387cc064f","resolution":{"observed_at":"2026-08-07T13:46:13.736700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03327","last_updated":"2024-01-09T06:20:23Z","snapshot_observed_at":"2026-08-03T07:23:58.026811Z","submitted_at":"2024-01-09T06:20:23Z","title":"Uni3D-LLM: Unifying Point Cloud Perception, Generation and Editing with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03327","snapshot_observed_at":"2026-08-07T13:46:13.798999Z","title":"Uni3d-llm: Unifying point cloud perception, generation and editing with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.798999Z"},"links":{"cited_paper":"/paper/2402.03327","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:4b99a8665a8c320adaced960603c910b5d856b2b1832ebea0a007c41b56f2f66","observation_id":"fc4dd6aa-075c-4139-82bc-ad69408057e7","resolution":{"observed_at":"2026-08-07T13:46:13.798999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:23.424651Z","title":"Objvariantensemble: Advancing point cloud llm evaluation in chal- lenging scenes with subtly distinguished objects","venue":null,"work_id":"8dc5c63c-070d-488b-a162-30b7b796f1be","year":1944},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.876429Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:3dcabf747e3c21103d50e336ffa76586cbec00d1257aae71485ac5d382877a21","observation_id":"3b8ae0e8-de17-4292-8b25-e5a4f5566296","resolution":{"observed_at":"2026-08-07T13:46:23.502473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:13.932284Z","title":"Gpt4point: A unified framework for point-language understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.932284Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:7605f45c528d7a6148dfcbd72cc70cd83561a8ac4deb9eaa2b253d09e9a69ac7","observation_id":"56a74583-e0c9-4f22-b7a9-585c3006e47b","resolution":{"observed_at":"2026-08-07T13:46:13.932284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:23.205571Z","title":"Unifying 3d vision-language understanding via promptable queries","venue":null,"work_id":"44635220-c2f6-481a-a2de-a4ea4e0bffd5","year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.021149Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:6e19f6c84320ea429130e76e8ba08c2978775950df53a1346d2ab9ab828a6bf3","observation_id":"a6c9804c-9211-426a-9349-80c5d5df308d","resolution":{"observed_at":"2026-08-07T13:46:23.312411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:23.016218Z","title":"Lidar-llm: Exploring the potential of large language models for 3d lidar understanding","venue":null,"work_id":"86f1d09e-0ff9-4e1a-a9b9-eb794981cef2","year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.094545Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:bf37b29173a87ac71f610ee1f3afdee027144d9c8d5de5b6e12bd516aecbccdd","observation_id":"b2b6703b-7b06-483e-a62b-1b25f607e2a7","resolution":{"observed_at":"2026-08-07T13:46:23.130721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18937","last_updated":"2025-08-04T13:54:40Z","snapshot_observed_at":"2026-08-04T19:53:06.596660Z","submitted_at":"2024-05-29T09:43:48Z","title":"Kestrel: 3D Multimodal LLM for Part-Aware Grounded Description","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18937","snapshot_observed_at":"2026-08-07T13:46:14.135716Z","title":"Kestrel: Point grounding multimodal llm for part-aware 3d vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.135716Z"},"links":{"cited_paper":"/paper/2405.18937","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:a01b47c9b9b7427c59d9a207184d59994c0d519994d5a3b046dc625ffc4edd7c","observation_id":"2cbf34af-9941-4054-a2e0-7d34e679fe44","resolution":{"observed_at":"2026-08-07T13:46:14.135716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:22.845737Z","title":"Liba: Language instructed multi-granularity bridge assistant for 3d visual grounding","venue":null,"work_id":"9ec75a4b-f438-4d0b-be9e-de5b503ffd55","year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.140769Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:db43984b749b3637ee133b1302d48f07cfa37c7d5af3ae8243c3d2001b7352d2","observation_id":"d49dffac-20ce-4382-8ebd-b66ed401d2c1","resolution":{"observed_at":"2026-08-07T13:46:22.914612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17827","last_updated":"2025-03-22T17:55:53Z","snapshot_observed_at":"2026-08-07T16:44:00.638110Z","submitted_at":"2025-03-22T17:55:53Z","title":"4D-Bench: Benchmarking Multi-modal Large Language Models for 4D Object Understanding","version":1},"cited_work":{"arxiv_id":"2503.17827","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17827","snapshot_observed_at":"2026-08-07T13:46:19.283417Z","title":"4D-Bench: Benchmarking Multi-modal Large Language Models for 4D Object Understanding","venue":"cs.CV","work_id":"ea5c11dc-76d3-4bc4-bc77-abda5eca9a2a","year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.183457Z"},"links":{"cited_paper":"/paper/2503.17827","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:dd1f185a13dcbb670078f4567efd076a59309311cc3a9e651cfc9727e07fd7a8","observation_id":"36cd438f-6601-4aec-b961-09c236eeb544","resolution":{"observed_at":"2026-08-07T13:46:19.380964Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16662","last_updated":"2024-09-15T15:51:00Z","snapshot_observed_at":"2026-08-07T09:15:35.501379Z","submitted_at":"2024-08-29T16:05:22Z","title":"Space3D-Bench: Spatial 3D Question Answering Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16662","snapshot_observed_at":"2026-08-07T13:46:14.247666Z","title":"Space3d- bench: Spatial 3d question answering benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.247666Z"},"links":{"cited_paper":"/paper/2408.16662","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:ed318982691df888d763291b3a28042363b4545090f6ee98737deae1c0d4ba58","observation_id":"71c8085a-3bc9-40f3-acc4-0a4af09b6440","resolution":{"observed_at":"2026-08-07T13:46:14.247666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-07-06T20:29:26.524162Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00342","snapshot_observed_at":"2026-08-07T13:46:14.341180Z","title":"Embodied intelligence for 3d understanding: A survey on 3d scene question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.341180Z"},"links":{"cited_paper":"/paper/2502.00342","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:a70355dedaacc9a74762182f2fe31fbe83a6236ba77b5abfd2ecd607d2b15849","observation_id":"dfa2a3c7-da90-4b0f-a8a3-343e810bad04","resolution":{"observed_at":"2026-08-07T13:46:14.341180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-07T23:35:09.059226Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-07T13:46:14.423259Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.423259Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:f10f2f56bfa34f118d3ec10757a5764fd8f323ff356df3947851c8e1a2335a46","observation_id":"b26fd254-490e-46e6-b794-35981a26791a","resolution":{"observed_at":"2026-08-07T13:46:14.423259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-06T05:45:10.510342Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07819","snapshot_observed_at":"2026-08-07T13:46:14.473013Z","title":"3ur-llm: An end-to-end multimodal large language model for 3d scene understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.473013Z"},"links":{"cited_paper":"/paper/2501.07819","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:3796ef4846d434b8b0ee19f3df4f1637014ee98cf3154c32f1b24c432c7b662b","observation_id":"58d23528-1edd-4483-a4f0-a17c2c013d05","resolution":{"observed_at":"2026-08-07T13:46:14.473013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:14.529598Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.529598Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:ae5e344361d87228e3ff14868bd5b9a5db6d1af694789ba0a3daec9824c137a7","observation_id":"5a9cbfaa-84a7-43f0-a20b-aa0e4d0e0786","resolution":{"observed_at":"2026-08-07T13:46:14.529598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:22.683223Z","title":"Image as a foreign language: Beit pretraining for vision and vision-language tasks","venue":null,"work_id":"6d1f4fb2-fe84-494a-9944-5158e5d5c875","year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.596999Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:2d15b9b10091a23569ad65fcd60b32bb148379a2df21c3b5e420c8ae136e1eeb","observation_id":"c2fc252e-45b6-4916-941b-f3cca1a8531c","resolution":{"observed_at":"2026-08-07T13:46:22.758988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:22.496600Z","title":"Uni3dl: A unified model for 3d vision- language understanding","venue":null,"work_id":"49cb87ac-0bcf-497a-bb6d-b1c4d40c3846","year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.681514Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:27f9da25ed81f0c26fb43f8c96caeaa0bf2e452ac1e9b77e09b36863fd975428","observation_id":"0abf9120-0f6b-4356-8a78-4edca9689486","resolution":{"observed_at":"2026-08-07T13:46:22.578435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:22.369309Z","title":"Vision-language pre-training with object contrastive learning for 3d scene understanding","venue":null,"work_id":"b8c6c4de-8b16-4939-8161-37049d1c4811","year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.742528Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:056ed3cece8e32124c828cc329ad7e76fc9c3cefac7272b4e48aa2b7c38a0a95","observation_id":"c5ee0eaf-dda9-43a5-bfbd-d1e485fde89b","resolution":{"observed_at":"2026-08-07T13:46:22.457441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:14.795239Z","title":"When llms step into the 3d world: A survey and meta-analysis of 3d tasks via multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.795239Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:b5b8c39e1cfe1196e389e5f8afbcdb24e6aed267835ac00322dd241bacc20570","observation_id":"cf7acec0-b0f4-4617-8774-0a8ffe20e460","resolution":{"observed_at":"2026-08-07T13:46:14.795239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:22.215226Z","title":"Mixture-of-experts with expert choice routing","venue":null,"work_id":"5e565f80-adfa-4d54-b087-669c4828e96f","year":2022},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.893770Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:7f995f5627b7aae27c19f3af22baff8cb83c9fa19627e8e24eff30582342ddce","observation_id":"974b4501-a380-4b02-837b-c29974481829","resolution":{"observed_at":"2026-08-07T13:46:22.293795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-07T19:39:57.333135Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-07T13:46:14.957598Z","title":"A survey on mixture of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.957598Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:a1dd3b2fb06edb182165d72ff13e6c8ac57e48f630aabc54708af8b8f404ba4a","observation_id":"f4c6c5b7-6629-4ee2-a0fa-36051bc411c8","resolution":{"observed_at":"2026-08-07T13:46:14.957598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15052","last_updated":"2024-06-28T19:39:45Z","snapshot_observed_at":"2026-08-03T23:12:30.037322Z","submitted_at":"2024-05-23T21:00:53Z","title":"Revisiting MoE and Dense Speed-Accuracy Comparisons for LLM Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15052","snapshot_observed_at":"2026-08-07T13:46:15.035924Z","title":"Revisiting moe and dense speed-accuracy comparisons for llm training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.035924Z"},"links":{"cited_paper":"/paper/2405.15052","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:9c2ce046ec24b0c9116436a28607c8ea5976e4f6e57f5856f6206c17508cd366","observation_id":"4e6411fb-704c-43ea-b942-30c9f3e33ffb","resolution":{"observed_at":"2026-08-07T13:46:15.035924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22134","last_updated":"2025-09-01T03:51:09Z","snapshot_observed_at":"2026-08-06T08:03:06.640448Z","submitted_at":"2024-10-29T15:31:27Z","title":"ProMoE: Fast MoE-based LLM Serving using Proactive Caching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22134","snapshot_observed_at":"2026-08-07T13:46:15.078213Z","title":"Promoe: Fast moe-based llm serving using proactive caching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.078213Z"},"links":{"cited_paper":"/paper/2410.22134","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:aec6e06e199289361172f2a3d52c2f8425f3f94e79b0d516b791e93db30f1e67","observation_id":"a6dc91f9-957d-438f-8e46-7b78ec8f0fbc","resolution":{"observed_at":"2026-08-07T13:46:15.078213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01739","last_updated":"2024-03-27T10:21:24Z","snapshot_observed_at":"2026-08-02T08:17:59.108390Z","submitted_at":"2024-01-29T12:05:02Z","title":"OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01739","snapshot_observed_at":"2026-08-07T13:46:15.171955Z","title":"Openmoe: An early effort on open mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.171955Z"},"links":{"cited_paper":"/paper/2402.01739","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:cf2d39cb06874c7f8e36f50cdf8a17147c65d1943d0f246440df4442e8c57895","observation_id":"f67659c6-7273-469e-8866-95eb01f56ba6","resolution":{"observed_at":"2026-08-07T13:46:15.171955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:22.077209Z","title":"Vlmo: Unified vision-language pre-training with mixture-of-modality-experts","venue":null,"work_id":"2973de10-e0f7-416a-9f42-3586a6b7e07d","year":2022},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.264291Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:265072473f084f9d211b0bdb120ecc303ab791101f44982f98fd1dcb2e49ccfc","observation_id":"a6b45c4f-df13-47d0-8e59-5727b1ed5834","resolution":{"observed_at":"2026-08-07T13:46:22.152608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07226","last_updated":"2023-03-13T16:00:31Z","snapshot_observed_at":"2026-07-06T15:02:40.704180Z","submitted_at":"2023-03-13T16:00:31Z","title":"Scaling Vision-Language Models with Sparse Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07226","snapshot_observed_at":"2026-08-07T13:46:15.339882Z","title":"Scaling vision- language models with sparse mixture of experts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.339882Z"},"links":{"cited_paper":"/paper/2303.07226","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:81003624a7b4f7281e4d157356e48eb238baf8d96ab7c531e469268fc27ceeb2","observation_id":"b25f7791-3c29-4b06-a152-e42c32f6c2c6","resolution":{"observed_at":"2026-08-07T13:46:15.339882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-07T13:46:15.416411Z","title":"Moe-llava: Mixture of experts for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.416411Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:2c185211821f92b7ad9ddf54321c46053272abb3a196489978c4983dc495082b","observation_id":"44d5141c-8100-4e17-9fbf-3a6a0fe632e8","resolution":{"observed_at":"2026-08-07T13:46:15.416411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:21.949844Z","title":"Ada-k routing: Boosting the efficiency of moe-based llms","venue":null,"work_id":"265666ad-43b7-40e3-b5d2-5cc8545f03d1","year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.507691Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:a0553af9998c8d4a4624948f0e802e9e5904ca9e8b627ff1673919f6be22162c","observation_id":"a776cff8-8824-4d97-b82b-6dd8664a8bb9","resolution":{"observed_at":"2026-08-07T13:46:22.012673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:15.586583Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.586583Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:811c167503d158ab6c92a257566573da60284c6afd960b819898049639f8950a","observation_id":"7f745a5f-f77a-49d4-a003-4884aa126729","resolution":{"observed_at":"2026-08-07T13:46:15.586583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:15.641775Z","title":"Llama-moe: Building mixture-of-experts from llama with continual pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.641775Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:de3ece4c389fa2de85e2f766fc839df693a7712e99266af694afa3444f693991","observation_id":"dd29c3b7-32ed-4da1-be2b-23990d2161ea","resolution":{"observed_at":"2026-08-07T13:46:15.641775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:21.826264Z","title":"Uni-moe: Scaling unified multimodal llms with mixture of experts","venue":null,"work_id":"955da49b-01a4-4a44-a680-245538bc9609","year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.679963Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:6105baf7d7d8113af45ff089b48baf474b4c51069b4758ba1754964a03066b19","observation_id":"ab168ca7-d01a-44f8-9e8c-3d866fc399aa","resolution":{"observed_at":"2026-08-07T13:46:21.874331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16698","last_updated":"2025-01-28T04:31:19Z","snapshot_observed_at":"2026-07-06T20:27:09.296190Z","submitted_at":"2025-01-28T04:31:19Z","title":"3D-MoE: A Mixture-of-Experts Multi-modal LLM for 3D Vision and Pose Diffusion via Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16698","snapshot_observed_at":"2026-08-07T13:46:15.744253Z","title":"3d-moe: A mixture-of-experts multi-modal llm for 3d vision and pose diffusion via rectified flow","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.744253Z"},"links":{"cited_paper":"/paper/2501.16698","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:39d759a7cc639fc7e889f3c666e8e2b9f95715730e7e58afbae9515e84e75006","observation_id":"ec264051-b15b-4672-ad89-4c4289841fd2","resolution":{"observed_at":"2026-08-07T13:46:15.744253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:21.761826Z","title":"Minigpt-3d: Efficiently aligning 3d point clouds with large language models using 2d priors","venue":null,"work_id":"15ffa583-8906-49da-812d-15f5c63ddc8a","year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.796253Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:b3c2f57877da707410c460474dbdf0d329dc9dbeeac6a5db569485780858838a","observation_id":"b39e2d56-872c-4d1e-953c-087506ebb4cf","resolution":{"observed_at":"2026-08-07T13:46:21.795066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T13:46:15.889974Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.889974Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:d197cf13156c726699108333044bf8ed5f40422069d8c8f73e0d24f7ca7402bd","observation_id":"9d0e7d08-ea5f-4681-8d38-ac38b5b22f3c","resolution":{"observed_at":"2026-08-07T13:46:15.889974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:21.650215Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"bad00d63-2e06-4e1d-bc9d-5730f3351e39","year":2021},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.929697Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:9ffadd0b42f314f4fd8868d206e89161e472e4d19bbae5ffb2b0955561352f18","observation_id":"9900a261-95af-4cf3-96b6-77ae5aa9c000","resolution":{"observed_at":"2026-08-07T13:46:21.704411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:15.963506Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:15.963506Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:3e46e0a313238e1a73df40d443c7b9100edad5d29953e85d5c0992a9e9f5632e","observation_id":"a50b727f-c45f-49bd-a102-77120c739898","resolution":{"observed_at":"2026-08-07T13:46:15.963506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:16.039764Z","title":"Mask3d: Mask transformer for 3d semantic instance segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.039764Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:0900e1deca1d2296542c764ac1d58e90672f4fde9f40d55a42413a4464155773","observation_id":"8dd7b16f-a899-4752-a93f-7586404e5a80","resolution":{"observed_at":"2026-08-07T13:46:16.039764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:16.132585Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.132585Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:093ae39d4a4c5d04d451ae58a49a305332c5bf4763d47260c98b2f7ebcaedbab","observation_id":"d4fc414e-856d-4cc6-be66-fcf3f8a21dc4","resolution":{"observed_at":"2026-08-07T13:46:16.132585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:16.200732Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.200732Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:b780ecffbb39ba01e9e63a362cd68690c5c1c78cfd1e4e5867eb4d6a02716623","observation_id":"e62bd513-2842-4d28-9f94-4c3d807f284d","resolution":{"observed_at":"2026-08-07T13:46:16.200732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:21.508874Z","title":"Multi3drefer: Grounding text description to multiple 3d objects","venue":null,"work_id":"80bc3aea-1eae-46ff-bc94-c3daae4fba8f","year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.245785Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:c1446ae7bee2e94624f9f5e4c7f692c7073c234eb6987a711fb7eb692fd11610","observation_id":"f138a48c-270f-4626-abab-eb9a6e134db9","resolution":{"observed_at":"2026-08-07T13:46:21.544501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:16.300556Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.300556Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:d31453cb85a84ce7c967eab5c942b35bd670a1e5929f89a1775a0d6420c480d1","observation_id":"41cd88d9-8585-4d71-b565-5a69a56e54f6","resolution":{"observed_at":"2026-08-07T13:46:16.300556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01901","last_updated":"2025-04-02T16:59:55Z","snapshot_observed_at":"2026-08-07T16:14:03.001458Z","submitted_at":"2025-04-02T16:59:55Z","title":"Ross3D: Reconstructive Visual Instruction Tuning with 3D-Awareness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01901","snapshot_observed_at":"2026-08-07T13:46:16.379978Z","title":"Ross3d: Reconstructive visual instruction tuning with 3d-awareness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.379978Z"},"links":{"cited_paper":"/paper/2504.01901","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:c65945cdcda9e11f3aada93d0983b7524d2c7d913cc555820398b96483902905","observation_id":"8504db6e-dd20-4c52-a550-76c5b5c5afae","resolution":{"observed_at":"2026-08-07T13:46:16.379978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:16.425498Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.425498Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:cd8f17325122e6df22c7c15382115d9b5c8726b97ade3cf8fc42ed78dac7c844","observation_id":"40031675-6144-4b68-a221-1d878f6e210a","resolution":{"observed_at":"2026-08-07T13:46:16.425498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:16.457621Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.457621Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:1252c88fa8cd1ae1e8b762105a2027cf410b452db5267006f124dbdeba1e9c3a","observation_id":"ee138cc5-f44e-4883-ba44-1dbf94c066b0","resolution":{"observed_at":"2026-08-07T13:46:16.457621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:16.494360Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.494360Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:785d4200660129c604e0dfef18ca67bdb34c51ff454ca712e749b244dbad30e6","observation_id":"38de929c-ac86-41a9-9fc0-e410279ffcab","resolution":{"observed_at":"2026-08-07T13:46:16.494360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:16.515497Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.515497Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:c7604f516d2294c7af64170dee3893db650b6a2a528ac391934f2d145e452cfe","observation_id":"7d724260-e5ea-4175-8c9d-ca14fe7e6c5a","resolution":{"observed_at":"2026-08-07T13:46:16.515497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:21.379622Z","title":"Context-aware alignment and mutual masking for 3d-language pre-training","venue":null,"work_id":"e0ce06bd-974d-438e-b1f0-3cff55532239","year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.563766Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:f59ad1bed6374da85119eae4787530c4fc26cf23cd97fc3f8b85d08a6db97837","observation_id":"fab14a4f-c41b-4382-9de3-42f4c6b02548","resolution":{"observed_at":"2026-08-07T13:46:21.433344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:16.625470Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.625470Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:e49e8273d351099e0806402cef1eb8790b508028ff47b03de9d106526fc389cb","observation_id":"a461d938-a693-48f4-b239-95aa8b05a8b0","resolution":{"observed_at":"2026-08-07T13:46:16.625470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21307","last_updated":"2025-03-27T09:31:35Z","snapshot_observed_at":"2026-08-07T16:33:24.689717Z","submitted_at":"2025-03-27T09:31:35Z","title":"InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21307","snapshot_observed_at":"2026-08-07T13:46:16.681525Z","title":"Internvl- x: Advancing and accelerating internvl series with efficient visual token compression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.681525Z"},"links":{"cited_paper":"/paper/2503.21307","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:c910aadfd3a9886108e504d76c440b4492e6df56949b4330fc5fa6136f5c94d9","observation_id":"a11f7e75-7d53-4f32-8fc8-0fb0710c46c6","resolution":{"observed_at":"2026-08-07T13:46:16.681525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:46:16.756757Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.756757Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:43a9c81fb47aeeeb70ac1884835230c783adadac5606ef2f84120fd329cefec5","observation_id":"2d9e9fbe-b150-4716-a71a-1cf7ec52cda5","resolution":{"observed_at":"2026-08-07T13:46:16.756757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T13:46:16.849356Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.849356Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:19c0640e80e7a31a76c8cdfc3ab3698a2449daa1c35dcf01eb569b1001b24929","observation_id":"123279b9-48f2-448e-98d8-9f2e0c7aed8f","resolution":{"observed_at":"2026-08-07T13:46:16.849356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:21.236781Z","title":"Lamm: Language-assisted multi-modal instruction-tuning dataset, framework, and benchmark","venue":null,"work_id":"ea81beef-205e-4e82-a04d-a52aa9977ee4","year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:16.948131Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:88db97470db6ecb7c32f235fcb8a4639c6f068c69cade65a22c0d105a350fb91","observation_id":"12c600fc-3b43-4561-a1ad-6e931994fde7","resolution":{"observed_at":"2026-08-07T13:46:21.316454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:17.076369Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:17.076369Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:ec6de36d1ce6377c10645b817128a7504b3dfacfdafd238ba13871c177e7e605","observation_id":"fde67467-ac28-41b9-8fff-4ab2b418bd52","resolution":{"observed_at":"2026-08-07T13:46:17.076369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-07T17:07:05.445620Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-07T13:46:17.141359Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:17.141359Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:c40604eac9d0686ad5eeed7a140531c3b1d871a310508787c5449ac5e5f7d695","observation_id":"f1d2de7e-81d4-459f-9cda-97874fd4f2d5","resolution":{"observed_at":"2026-08-07T13:46:17.141359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:21.135472Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":"e274bfb1-2ee4-41b0-ae20-9a544fba0919","year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:17.215388Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:7e7a202e3c7d86c0f7681cafcba9858954fe29a652a546e57a40c4c18468ad9c","observation_id":"b896d076-9b48-4ca8-b16b-c194431e4349","resolution":{"observed_at":"2026-08-07T13:46:21.190400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-07T13:46:17.324846Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:17.324846Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:43139c8013bc17fb654bf8b0abc5e03cda1025fa1bec9b56d2b5b59dda16ea49","observation_id":"59aa549d-4755-4f82-9b60-f94b16bdc241","resolution":{"observed_at":"2026-08-07T13:46:17.324846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:21.027022Z","title":"Principal components analysis (pca)","venue":null,"work_id":"d78a5b87-7efb-4c35-9877-2887e0de6d72","year":1993},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:17.434535Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:891c9dd7a6dedca3a352db7119e870d058cbd4d8e2acd2258cd680939266f38f","observation_id":"20c4dede-de2a-4823-9071-1ec931fa9b06","resolution":{"observed_at":"2026-08-07T13:46:21.080412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:20.937793Z","title":"3djcg: A unified framework for joint dense captioning and visual grounding on 3d point clouds","venue":null,"work_id":"82275f5c-7d6d-4ec7-bba4-fc68902e1997","year":2022},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:17.554741Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:699ad648d93668e8573d90decc86c4f66559a826aa2917307d9cfd8b4cf09687","observation_id":"5b455741-a976-4bd0-921d-51a0d97dbf53","resolution":{"observed_at":"2026-08-07T13:46:20.967618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:20.845655Z","title":"End-to-end 3d dense captioning with vote2cap-detr","venue":null,"work_id":"c02f3270-3f38-4d0b-94c7-01680615719a","year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:17.671882Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:9a975c22d13fe81ea1bc3708bf3613d6f95a15dba78bbef198de9158b2af364d","observation_id":"4f9e6749-68c8-4694-aa86-00fe14be757c","resolution":{"observed_at":"2026-08-07T13:46:20.892441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:20.709355Z","title":"X-trans2cap: Cross-modal knowledge transfer using transformer for 3d dense captioning","venue":null,"work_id":"315e2f9b-c46b-4499-80c5-3585e2714edb","year":2022},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:17.746676Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:ec5940d3d2d6f1468b08f64cd178ed72acd3842aaa242a740e2a5f156147e0fc","observation_id":"407a0d21-38d9-435a-b446-64c737fc95eb","resolution":{"observed_at":"2026-08-07T13:46:20.765740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13083","last_updated":"2021-10-25T16:23:25Z","snapshot_observed_at":"2026-08-04T03:27:23.016575Z","submitted_at":"2021-10-25T16:23:25Z","title":"MVT: Multi-view Vision Transformer for 3D Object Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13083","snapshot_observed_at":"2026-08-07T13:46:17.813022Z","title":"Mvt: Multi-view vision transformer for 3d object recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:17.813022Z"},"links":{"cited_paper":"/paper/2110.13083","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:b37d7be9027e7ed9e4e8159d51643fc8af18e9a2c99e835cc497845bb989383f","observation_id":"8cdb7196-3760-4303-a22a-0f95b1a3480d","resolution":{"observed_at":"2026-08-07T13:46:17.813022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:17.891316Z","title":"3dvg-transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:17.891316Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:a681e2d29ac6e2392d406bf474f4a4d1440c42f385b67ded3a581efaa8a59a76","observation_id":"7438619f-e002-4e53-97e7-4dff0e2a6e5b","resolution":{"observed_at":"2026-08-07T13:46:17.891316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:17.973560Z","title":"Language conditioned spatial relation reasoning for 3d object grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:17.973560Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:e159a1a8f104dc1a7365b85bb600fb2ecfe891d5eab6557b6139c18255b8b57c","observation_id":"c3f666bd-9bc5-431a-83a9-3e99b6aa9ec4","resolution":{"observed_at":"2026-08-07T13:46:17.973560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:20.532174Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"ba7ca55e-f1ca-4886-baef-61bf616142bc","year":2021},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:18.077406Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:200cf942ac8a5d12465fec78977c684186f982f85ad979bedd15fb6549975f73","observation_id":"b1a8eeff-6005-43f8-a02d-35249b7e51d2","resolution":{"observed_at":"2026-08-07T13:46:20.643575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:20.370450Z","title":"Text-guided graph neural networks for referring 3d instance segmentation","venue":null,"work_id":"39b46e84-f3d3-4a0f-a799-ae2ef3e166a9","year":2021},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:18.161114Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:768e5a138b2a89256b711c4ba12dcf14f34c9155a818b32b87e404acfcff1da3","observation_id":"d502179a-f70d-436b-beb5-3d0aed48b469","resolution":{"observed_at":"2026-08-07T13:46:20.435493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:20.300793Z","title":"In- stancerefer: Cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual referring","venue":null,"work_id":"57cd1ee7-ff86-42ba-b323-6034837d5f40","year":2021},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:18.270692Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:53e3ab99c83258da0ac04b96597a5260227f770fdd84e54898f03bbc3772ce1e","observation_id":"fb3fdcde-5000-4ef4-b0d5-4f987f3f9322","resolution":{"observed_at":"2026-08-07T13:46:20.326600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:18.389743Z","title":"3d-sps: Single-stage 3d visual grounding via referred point progressive selection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:18.389743Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:2d3033f7f5f96cb5cf021e8b9050f6859c2b6437ae4b2570f7c0107966eb51aa","observation_id":"19ee3c74-9ecb-4d4d-a1cb-2f1b8e355a85","resolution":{"observed_at":"2026-08-07T13:46:18.389743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:20.098336Z","title":"D3net: A speaker-listener architecture for semi-supervised dense captioning and visual grounding in rgb-d scans","venue":null,"work_id":"a0200b2d-e362-47db-8a19-ea8986a37c5a","year":2021},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:18.491669Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:58ffdd6713807c35885083bbbddfaf97ec3f926c667e8ce1edc20b6e78a68dbc","observation_id":"9595cc4c-1e4c-4f43-b63d-3fcfb8f4460a","resolution":{"observed_at":"2026-08-07T13:46:20.194643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:19.961723Z","title":"Bottom up top down detection transformers for language grounding in images and point clouds","venue":null,"work_id":"1feb8e34-a9ab-4c9a-99d4-a0aa562287e4","year":2022},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:18.602704Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:1aa456b1ee2985eb5b970bb19b7d7249955e21e1a3e92f1748b28617e4352713","observation_id":"e307ec8a-2d47-4424-a4bc-f77ca43fa1c3","resolution":{"observed_at":"2026-08-07T13:46:20.036900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12513","last_updated":"2023-06-09T04:06:39Z","snapshot_observed_at":"2026-08-06T12:48:28.228223Z","submitted_at":"2022-10-22T18:02:10Z","title":"Learning Point-Language Hierarchical Alignment for 3D Visual Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.12513","snapshot_observed_at":"2026-08-07T13:46:18.684551Z","title":"Ham: Hierarchical attention model with high performance for 3d visual grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:18.684551Z"},"links":{"cited_paper":"/paper/2210.12513","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:ac001426abd8a858fe88593c0b4f2735e349c219ed80c4a0a3b4d5455f2a7f9e","observation_id":"7a183bd7-3cec-47e5-9641-643389b45c1f","resolution":{"observed_at":"2026-08-07T13:46:18.684551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13363","last_updated":"2023-07-25T09:33:25Z","snapshot_observed_at":"2026-08-03T14:35:47.250280Z","submitted_at":"2023-07-25T09:33:25Z","title":"3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13363","snapshot_observed_at":"2026-08-07T13:46:18.790770Z","title":"3drp-net: 3d relative position-aware network for 3d visual grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:18.790770Z"},"links":{"cited_paper":"/paper/2307.13363","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:8fa642fb37f280bca804696fb38613bc12df6e6a0c6cab975e14067e24326506","observation_id":"75982f4f-e0f7-44c8-aaef-8312fa98d3bc","resolution":{"observed_at":"2026-08-07T13:46:18.790770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:19.784111Z","title":"Eda: Explicit text-decoupling and dense alignment for 3d visual grounding","venue":null,"work_id":"3368eef3-883e-467a-ab56-83a8c4fbae38","year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:18.827522Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:10f969924be34400b3616737b309ae9bd94ea9015b86c404602d17b9142929d4","observation_id":"8fa273ce-e506-408c-8999-0442de193403","resolution":{"observed_at":"2026-08-07T13:46:19.857840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:19.645140Z","title":"the bed, which is rectangular in shape, is located adjacent to the door","venue":null,"work_id":"f84b93e0-4492-43e8-9436-83fc581319c7","year":2024},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:18.874616Z"},"links":{"citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:f18609d309952db62b48cc33e30a761d826ffddb10711b0ae6f1b587df7fb9a3","observation_id":"bdfbdf3c-1840-450a-abc8-6f0425535a05","resolution":{"observed_at":"2026-08-07T13:46:19.736225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:33:53.897790Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 2 inbound Pith citation observations for arXiv:2505.21079."}