{"as_of":"2026-08-07T13:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:84a3ce7d4a6e317ed0db993547151e93af7a5a24650ad2f6981ec10264915065","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:48:06.435172Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T15:16:35.591649Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20110","snapshot_observed_at":"2026-07-31T15:16:35.591649Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.591649Z"},"links":{"cited_paper":"/paper/2507.20110","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:25eba8818ad44e6cc29d090082fd955ef32070db65541079073dd7dc8c582a35","observation_id":"a33bd187-fc65-4803-86b4-289a43d4f062","resolution":{"observed_at":"2026-07-31T15:16:35.591649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20110/citation-record","integrity":"/paper/2507.20110/integrity","json":"/paper/2507.20110/citation-record.json","paper":"/paper/2507.20110"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T13:48:00.428975Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:00.428975Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:7c1313769a1921eed6c171a61cd42e61c4beb26bc72311fb24af14b7aebb7343","observation_id":"b835252d-3b07-40c9-a903-615b1f03eb5e","resolution":{"observed_at":"2026-08-06T13:48:00.428975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:14.709894Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"be895d69-112c-4501-9a5b-5436cc76da39","year":2020},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:00.496994Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:f6cee13c037927ac44f85ca021c343bf0d80bf58073c47d3cb9bf8a851b2b293","observation_id":"f86a609e-f11a-4be5-a3ef-d675240390ea","resolution":{"observed_at":"2026-08-06T13:48:14.765120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:00.578854Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:00.578854Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:849d9c1375523ecff867d2d62880c949e18ed963a0e47500087a785595c9db4a","observation_id":"e36935a6-65fa-4b73-8f8e-fc504753a67f","resolution":{"observed_at":"2026-08-06T13:48:00.578854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:14.504741Z","title":"ShapeNeRF–Text: A Dataset of Neural Object Renderings with Rich Language Descriptions","venue":null,"work_id":"24f351f2-2e23-4312-9d34-af03ea2281d8","year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:00.679459Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:bd1d5ebd21c6a7568ec1c0b93a88326f6f298d2dd490479bbd86697b76b4d888","observation_id":"e5e5bd75-cc94-48f5-9124-46710c5f20eb","resolution":{"observed_at":"2026-08-06T13:48:14.614753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:14.225738Z","title":"Llana: Large language and nerf assistant","venue":null,"work_id":"1094e933-3748-4096-ba9c-559210da377d","year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:00.771850Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:bbd48e3e6daee75667ef881a1c3d0041c185862860667dbe46297eb738c1baf7","observation_id":"859c74ae-622a-44d6-ac40-5754879b1047","resolution":{"observed_at":"2026-08-06T13:48:14.356360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:13.962380Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"1cda0db0-bc04-441f-b872-20647224f7b2","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:00.863694Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:2a7610547e31af11ceaa36a95640b186b42beaf2df00f680343ffacd852a9e5b","observation_id":"49a81f53-61a3-430e-ad8c-099f512b945e","resolution":{"observed_at":"2026-08-06T13:48:14.077094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13843","last_updated":"2024-09-24T11:28:21Z","snapshot_observed_at":"2026-08-07T04:04:34.065888Z","submitted_at":"2023-03-24T07:37:09Z","title":"CompoNeRF: Text-guided Multi-object Compositional NeRF with Editable 3D Scene Layout","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13843","snapshot_observed_at":"2026-08-06T13:48:00.939274Z","title":"Componerf: Text-guided multi-object compositional nerf with editable 3d scene layout","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:00.939274Z"},"links":{"cited_paper":"/paper/2303.13843","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:47cc2d0a99ca5d22e7e8fa4bd3fbc045eb861087d740e12fda729675b5356b80","observation_id":"48de0090-5227-4d2e-bdf0-c66f75c7874f","resolution":{"observed_at":"2026-08-06T13:48:00.939274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:13.814742Z","title":"Connecting nerfs images and text","venue":null,"work_id":"516e0717-188d-459f-a092-5fe101fe851d","year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.003325Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:53cbc9f48f63b929fe34708b3cf53b1c7512a82a948459b7661316b38d58005a","observation_id":"a5a0aff7-ee4b-4aac-8dd4-51cc63de8dbc","resolution":{"observed_at":"2026-08-06T13:48:13.890929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01140","last_updated":"2024-01-30T11:02:30Z","snapshot_observed_at":"2026-08-06T22:05:20.851653Z","submitted_at":"2023-10-02T12:27:22Z","title":"Neural Processing of Tri-Plane Hybrid Neural Fields","version":3},"cited_work":{"arxiv_id":"2310.01140","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01140","snapshot_observed_at":"2026-08-06T13:48:06.673495Z","title":"Neural Processing of Tri-Plane Hybrid Neural Fields","venue":"cs.CV","work_id":"aaccb776-bde9-468e-9e95-cde7b87987a5","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.072728Z"},"links":{"cited_paper":"/paper/2310.01140","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:0a5bed0bcb15252865a66a20790ec11e42195a23af9ce5283a048559388ad100","observation_id":"55ebde29-211c-475b-8f50-c6dcd892dc9c","resolution":{"observed_at":"2026-08-06T13:48:06.723178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03012","last_updated":"2015-12-09T19:42:48Z","snapshot_observed_at":"2026-08-07T11:28:03.211074Z","submitted_at":"2015-12-09T19:42:48Z","title":"ShapeNet: An Information-Rich 3D Model Repository","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03012","snapshot_observed_at":"2026-08-06T13:48:01.163710Z","title":"Shapenet: An information-rich 3d model repository","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.163710Z"},"links":{"cited_paper":"/paper/1512.03012","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:0b4e3b4f94dc44344190f0919c6e147738353dfa5e9aafaa8f19e5a7c4af93d7","observation_id":"e9faa312-f256-4234-ba8a-60dc2e4e8714","resolution":{"observed_at":"2026-08-06T13:48:01.163710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:13.585821Z","title":"Tensorf: Tensorial radiance fields","venue":null,"work_id":"0de79c45-6c0b-4039-b7e8-49d653144bc2","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.279694Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:7a7aa199eb4e8215a278c0e89effc4d96b675f7f3bce71cee789cbca9991e9e2","observation_id":"cd0eecff-d970-49c6-aabd-b21a89877cfd","resolution":{"observed_at":"2026-08-06T13:48:13.652976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:13.414318Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"ced609bb-0219-4fbc-9904-43be8b595346","year":2020},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.369319Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:0659102dd2d2d126148f9b4e96fc59fde29156886100aa37189082feb7fad530","observation_id":"00532071-50f2-4488-8960-5bd6eb9173f0","resolution":{"observed_at":"2026-08-06T13:48:13.481865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-07-06T15:30:49.735343Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-06T13:48:01.473477Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.473477Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:7f00a0430f30082746bc75c3b6fc48ecbaa699fc3f4b10204bc96eeb241d48e2","observation_id":"73726ca9-4546-48a2-8657-49909d9a5b56","resolution":{"observed_at":"2026-08-06T13:48:01.473477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T13:48:01.574668Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.574668Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:d8028610876de535e6a7bd502233b166d5a02dad2009dc2ada5e86dd55736eaf","observation_id":"727cc961-4c35-487d-a8bf-dac8ce28af14","resolution":{"observed_at":"2026-08-06T13:48:01.574668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:13.106749Z","title":"Language conditioned spatial relation reasoning for 3d object grounding","venue":null,"work_id":"564ea699-b5bc-4b29-a4a1-4a4c8a64342e","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.692980Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:0df7b47a29c7076e86aa19fd2ada008a05b89c21e1cfda9af72863919a25618c","observation_id":"dd635596-703e-4a63-891b-c16b2191c493","resolution":{"observed_at":"2026-08-06T13:48:13.212722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13083","last_updated":"2021-10-25T16:23:25Z","snapshot_observed_at":"2026-08-04T03:27:23.016575Z","submitted_at":"2021-10-25T16:23:25Z","title":"MVT: Multi-view Vision Transformer for 3D Object Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13083","snapshot_observed_at":"2026-08-06T13:48:01.770602Z","title":"Mvt: Multi-view vision transformer for 3d object recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.770602Z"},"links":{"cited_paper":"/paper/2110.13083","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:1f989c2d3864c3a33d0e2794aef66901f7407cb357335608d4029e2f1eb114e0","observation_id":"a794db84-808c-4359-958e-c65bedd801ef","resolution":{"observed_at":"2026-08-06T13:48:01.770602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:12.817424Z","title":"End-to-end 3d dense captioning with vote2cap-detr","venue":null,"work_id":"b58af788-0d8c-41a9-9521-85ec9b899d3a","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.848099Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:ac1cad7edc32cbf492e1961aa899ba8bc8fc2290da6c617ad1e452d0f1fb45e2","observation_id":"55d7e0a5-0106-4e12-834e-ce23aca332a4","resolution":{"observed_at":"2026-08-06T13:48:12.970121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:12.593494Z","title":"V ote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning","venue":null,"work_id":"4736397d-c92a-4920-9377-1e95bdb461b8","year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.891419Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:d38b19de334a1b07d3de34e9bee303a04f26d322fcd83a6460a71cd8f11a810a","observation_id":"82fc555f-bfa3-451f-8a38-164ed370c518","resolution":{"observed_at":"2026-08-06T13:48:12.694743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:12.300038Z","title":"Scan2cap: Context-aware dense captioning in rgb-d scans","venue":null,"work_id":"ae70dd5d-73c2-427d-8ffc-54b67e10ee97","year":2021},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.992505Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:d14db74d007df17e9b63e7a8078fd068f74855cbc9f5f3ad23a8e8faa2452248","observation_id":"e1446d83-51db-4fcf-a3b8-66c076d2442c","resolution":{"observed_at":"2026-08-06T13:48:12.439190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:02.079180Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.079180Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:3f98f371b2eed2026e76858f3b0354fb2c6d3b6915506dd4c0404274f4a9607a","observation_id":"d6765e62-af05-47a1-9011-d774999b51dd","resolution":{"observed_at":"2026-08-06T13:48:02.079180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:02.159298Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.159298Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:0743f817f80a4d487f12b34dbc3b15e9e15eaac35b3f9a76898d4c8d74d1e78d","observation_id":"af419120-34fd-4192-a135-a411acd978fb","resolution":{"observed_at":"2026-08-06T13:48:02.159298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:12.120542Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks","venue":null,"work_id":"80d0ed03-305a-4ef3-9842-2958358422f4","year":2019},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.221622Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:88f85feec1cfcaff08eb57efc264d0a45ed413bdc2e7e5f431dcec23fa99e915","observation_id":"065b0130-dd3d-409c-a974-e36d59ad6895","resolution":{"observed_at":"2026-08-06T13:48:12.204744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:02.293828Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.293828Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:eff52269690f7f250f0491475dfb03ea8c59a20f7f5af84ab6e7ccd6ed99875f","observation_id":"cd05eb91-d402-4192-a399-1bf84ed228f3","resolution":{"observed_at":"2026-08-06T13:48:02.293828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05438","last_updated":"2023-02-10T18:55:49Z","snapshot_observed_at":"2026-07-06T14:50:37.130425Z","submitted_at":"2023-02-10T18:55:49Z","title":"Deep Learning on Implicit Neural Representations of Shapes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05438","snapshot_observed_at":"2026-08-06T13:48:02.358997Z","title":"Deep learning on implicit neural representations of shapes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.358997Z"},"links":{"cited_paper":"/paper/2302.05438","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:9a72564eb59b48a194e416f5feba97d4a58df7ee489297436d8096e44f94bee9","observation_id":"9926460a-97ca-4bfd-a2bb-22b378356e87","resolution":{"observed_at":"2026-08-06T13:48:02.358997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:11.883950Z","title":"Plenoxels: Radiance fields without neural networks","venue":null,"work_id":"46d0ff09-52e4-46b3-a43b-154a8dc2db67","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.442410Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:50362ca701153c300e7593f2cda8edf94e57af6267277b3594fe1a7445b43e19","observation_id":"e5fda67a-8459-4d87-b922-00f8072cd5d5","resolution":{"observed_at":"2026-08-06T13:48:12.001115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:02.507765Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.507765Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:ededa1d46736488770ca4e022d7b5a06fe8ebf7d8acd2f9df537302068a44b7b","observation_id":"b9e72428-3e69-451d-aee5-8c228bc6e688","resolution":{"observed_at":"2026-08-06T13:48:02.507765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.01307","last_updated":"2017-06-05T13:25:24Z","snapshot_observed_at":"2026-07-06T05:45:33.208413Z","submitted_at":"2017-06-05T13:25:24Z","title":"Submanifold Sparse Convolutional Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.01307","snapshot_observed_at":"2026-08-06T13:48:02.590072Z","title":"Submanifold sparse convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.590072Z"},"links":{"cited_paper":"/paper/1706.01307","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:eb1c2eab190baa3c4726de2aa2018d28047ad9f26fd1d3a6c2b0bd8d307a2ed5","observation_id":"feff426a-774c-4815-9685-3b213ec08e13","resolution":{"observed_at":"2026-08-06T13:48:02.590072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T13:48:02.658757Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.658757Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:6bcf8d522aa8398d27e75397b26562d1d2cf13ba8f0376b31e2cf486c901e07b","observation_id":"cb278c4f-bce7-469a-87bf-a312ab79e322","resolution":{"observed_at":"2026-08-06T13:48:02.658757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03905","last_updated":"2023-09-11T20:25:16Z","snapshot_observed_at":"2026-07-06T16:15:50.904062Z","submitted_at":"2023-09-07T17:59:45Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03905","snapshot_observed_at":"2026-08-06T13:48:02.757425Z","title":"Imagebind-llm: Multi-modality instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.757425Z"},"links":{"cited_paper":"/paper/2309.03905","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:97e785c89c3e9ed72911d9705f1462ad6b8c4432f6903e157689363c5d167a53","observation_id":"d2973317-16b8-4964-b73f-f263517d2860","resolution":{"observed_at":"2026-08-06T13:48:02.757425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:02.816058Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.816058Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:38a252f6776e2330eab3b1db55bf2a07b835f3b0f3660c55772dba152220036b","observation_id":"ca87ad9f-727f-4812-bd8e-5e505887a124","resolution":{"observed_at":"2026-08-06T13:48:02.816058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:11.568554Z","title":"Unlocking textual and visual wisdom: Open-vocabulary 3d object detection enhanced by comprehensive guidance from text and image","venue":null,"work_id":"01ebf943-02c1-46eb-8e76-756da1c4daf1","year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.907456Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:1d87c671614bb6a198fe46d848758228b6c24a9072c01b2dc90b312b28f0e870","observation_id":"d914a6a7-9378-490b-9cf8-88bbbce0b9ff","resolution":{"observed_at":"2026-08-06T13:48:11.700595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:11.166481Z","title":"Cg-nerf: Conditional generative neural radiance fields for 3d-aware image synthesis","venue":null,"work_id":"42827f9a-4972-4cf8-a5a3-1dfe0d1839b7","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.982517Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:5affdc2150191ce1521bc689522dab2bc4afdfae7e7d26101e1ee6d95a92e724","observation_id":"d71c5897-53fa-4b90-9a72-fa17546ffe10","resolution":{"observed_at":"2026-08-06T13:48:11.411758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:03.089857Z","title":"Lerf: Language embedded radiance fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.089857Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:ad0ff84a7c3524f60cdfa1bf18ede4641e47a2098cb52801aa67073608cc24df","observation_id":"95bd0d92-258c-4530-b5ef-fa2ef0bf7a2a","resolution":{"observed_at":"2026-08-06T13:48:03.089857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:10.987878Z","title":"Parameter prediction for unseen deep architectures","venue":null,"work_id":"6872f721-749c-4678-9bc4-e6570b3c2fad","year":2021},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.146553Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:e5409c44724e646f3d2be11f75047bd52c5da4907229e3e56deaca685335a62c","observation_id":"dc9dc57e-ee69-4c7c-b0ed-9d020a56507b","resolution":{"observed_at":"2026-08-06T13:48:11.074926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:10.748297Z","title":"Decomposing nerf for editing via feature field distillation","venue":null,"work_id":"e4d149b1-07e5-45df-b091-ad215ea7e33d","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.232106Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:f70a54ae7de68b5707175c8efb955262e7bd48ae862414ce5efd6aefe6e8c991","observation_id":"dd5eacd8-8f49-4559-ad18-2ec9140bc9e4","resolution":{"observed_at":"2026-08-06T13:48:10.848571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:03.295549Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.295549Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:ab6ba40add5a0d303cc9c30761a65105ce32932a18e93f08d07e6cc8b87f248b","observation_id":"4fa7979e-e56e-433e-b381-8c28eef6ed37","resolution":{"observed_at":"2026-08-06T13:48:03.295549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:03.448698Z","title":"Visual instruction tuning.Advances in neural information processing systems , 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.448698Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:e4f63f3e403be4a981aaee76a0e53bb058be7dccddedd6b860ccf1055080cfa4","observation_id":"bc8b862d-b2c8-4184-be75-ca34c3a74c6d","resolution":{"observed_at":"2026-08-06T13:48:03.448698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-07-06T14:05:02.813765Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-06T13:48:03.529117Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.529117Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:a05230d96870548a34f7337031c03036844f29086f4a702f671b0ae54d7ca73a","observation_id":"6fe358d8-c9ab-4143-9eb9-a6092229c0b9","resolution":{"observed_at":"2026-08-06T13:48:03.529117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:10.600346Z","title":"Latent-nerf for shape-guided generation of 3d shapes and textures","venue":null,"work_id":"b629f73d-795c-4290-bc73-0b8136c50cf6","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.611561Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:f3cc99fbd6b5b23430d407aadcf36276c5b70c4607253fb089fae31b630944c0","observation_id":"ed082235-5ada-49a8-b6ce-4448fc336630","resolution":{"observed_at":"2026-08-06T13:48:10.648473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:03.693150Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.693150Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:541c7c05e63b79cacf2836e3b5172ffb25c4ebb074b0adea43e0eebed6e14b05","observation_id":"0ab68ad0-8ce8-4a2e-8744-6d0a94f2a2de","resolution":{"observed_at":"2026-08-06T13:48:03.693150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:10.332127Z","title":"Reference-guided controllable inpainting of neural radiance fields","venue":null,"work_id":"25f2fda8-eeef-4938-a403-7944d83fe38b","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.827743Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:93f3e53eb93f0bbba5c98b7881c10207b068a5897bb2b0066345bd8cdbee1c85","observation_id":"03f8bf14-fc30-4bc0-ae0a-4347db1d2674","resolution":{"observed_at":"2026-08-06T13:48:10.418059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:10.091331Z","title":"Instant neural graphics primitives with a multiresolution hash encoding","venue":null,"work_id":"1256cf25-4554-45ae-aeea-0c3494622aa6","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.944069Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:3787f83169170745e71bce688be4ac0440e6c0456cedd775e0471691902402b0","observation_id":"9c1c88e3-d0f9-4d2b-b417-f781fc681767","resolution":{"observed_at":"2026-08-06T13:48:10.270091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:09.872324Z","title":"Equivariant architectures for learning in deep weight spaces","venue":null,"work_id":"0a5f2174-df0c-42a8-94bd-bf166f29033e","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.043245Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:e356878b101a27c619c0c75d27362cb1ebc40504a9b0344b6c0d7748526c906f","observation_id":"9bc5e0dc-e54a-4875-b7d5-06c7b83c3145","resolution":{"observed_at":"2026-08-06T13:48:09.985271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:04.154064Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.154064Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:20d4b77ce0abb10ea809462565096891b6ef17aeb3f4d4fe0564749055682313","observation_id":"15e8539a-c6ac-4045-ad6e-c6a8c7bd55f3","resolution":{"observed_at":"2026-08-06T13:48:04.154064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:09.567118Z","title":"Masked autoencoders for point cloud self-supervised learning","venue":null,"work_id":"395d8818-4454-44fb-a22a-4fd4c2fd987f","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.258152Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:e850019c1936101b65218798e1fd222e3266bab0fe169b6d234e496b386df452","observation_id":"84b6e44b-455f-48fc-91fa-e73a312161cd","resolution":{"observed_at":"2026-08-06T13:48:09.688603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:09.390889Z","title":"Clip-guided vision-language pre-training for question answering in 3d scenes","venue":null,"work_id":"c3a3fce9-1d68-4a8c-af1b-a153fdc0691f","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.375622Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:ece7ba89cec218befcb38a497789b067227bdc34c28e7cd56b37bc6f57452f6f","observation_id":"aaaaf3dd-d9ab-4154-806c-bc80019219c5","resolution":{"observed_at":"2026-08-06T13:48:09.476881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:09.181914Z","title":"Pointnet: Deep learning on point sets for 3d classification and segmentation","venue":null,"work_id":"4ed8fb55-3b8e-444d-bb80-cfc9af7f5359","year":2017},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.457692Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:e288d965f07a585a5e7dddba41d2671fc28e7864d568da2c8cf8530bb05b1bf7","observation_id":"c595a8dd-67a0-4e6b-b0e5-2e043fbe2b37","resolution":{"observed_at":"2026-08-06T13:48:09.286251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:04.572299Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.572299Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:c871a2dec25a205d357c043c42578b78aeebd91137cb888c8d0fdc0f767fa067","observation_id":"4ef90906-4887-4eca-b3ee-c40f8caca8e1","resolution":{"observed_at":"2026-08-06T13:48:04.572299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:09.116217Z","title":"Gpt4point: A unified framework for point-language understanding and generation","venue":null,"work_id":"57809789-da50-407e-8785-548e50543f80","year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.654947Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:b2f8932ab90237a68d96071e0ff59baa3e998d3c59449c2b6ca76d3df88bd178","observation_id":"7d5414bd-801c-4c3a-965a-656b6cab5d4f","resolution":{"observed_at":"2026-08-06T13:48:09.172978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:04.733648Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.733648Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:70f1270288caf9c2b02656416c8523cb19ee9075823435a8112b01af0601ed3e","observation_id":"f0555abe-8de2-4fe9-bd2f-5259c254993f","resolution":{"observed_at":"2026-08-06T13:48:04.733648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:04.824771Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.824771Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:7ce7b3ef78c42949f2a0cf6977fa254beddab7d174ee74b4361a38ea7e2a535c","observation_id":"7f1f3255-25a4-409f-b8db-ad2aada69b32","resolution":{"observed_at":"2026-08-06T13:48:04.824771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:08.964937Z","title":"Deep learning on 3d neural fields","venue":null,"work_id":"997daab4-1a4b-4b56-9986-a8c3d3de4e91","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.878956Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:a6ed3bdcd98c49abd51a747eca23ecd23dfc52abab9a921bfc249caf3d0d2cd0","observation_id":"aaafabc3-ada5-4583-a0c4-3fa7d65fcc89","resolution":{"observed_at":"2026-08-06T13:48:09.021935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:08.823168Z","title":"Self-supervised representation learning on neural network weights for model characteristic prediction","venue":null,"work_id":"eab06c66-8de0-474e-9ff7-a9494095371c","year":2021},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.976553Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:2cffa96904d4fb3ef60299e9fcd460d07d40074bddaa8e3263058488308a26fb","observation_id":"f5cff35a-9bd2-4f52-b085-9c7540cc7b53","resolution":{"observed_at":"2026-08-06T13:48:08.884051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:08.591810Z","title":"Hyp-nerf: Learning improved nerf priors using a hypernetwork","venue":null,"work_id":"ed3e8308-c352-4820-9253-dd7f89b00893","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.036929Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:9aabaa5ed01d05c10160fa2bcbdf8f9e06863129922ae5aa979f8f9e0ce1149d","observation_id":"05ddafe5-0fd2-4c7e-a577-807a5d1a5299","resolution":{"observed_at":"2026-08-06T13:48:08.684422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02827","last_updated":"2023-04-06T02:27:22Z","snapshot_observed_at":"2026-07-31T05:10:46.717320Z","submitted_at":"2023-04-06T02:27:22Z","title":"DITTO-NeRF: Diffusion-based Iterative Text To Omni-directional 3D Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02827","snapshot_observed_at":"2026-08-06T13:48:05.108713Z","title":"Ditto-nerf: Diffusion-based iterative text to omni-directional 3d model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.108713Z"},"links":{"cited_paper":"/paper/2304.02827","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:6910710f27932f5e78e3e6ee7351c66330b13630b904bf2b377b7cbce64f0ece","observation_id":"c7584855-5479-456e-bce9-44e78b81a67b","resolution":{"observed_at":"2026-08-06T13:48:05.108713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:08.443414Z","title":"Direct voxel grid optimization: Super-fast convergence for radiance fields reconstruction","venue":null,"work_id":"70c6102c-201b-4d55-9999-fca70cb723c4","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.219841Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:fda8c9e33d7f00de011e5f2f6e4990e35f611f2c135393efc05a3a0851a218e2","observation_id":"2da05fd7-dc3e-405a-9a4d-542bcf4e24e0","resolution":{"observed_at":"2026-08-06T13:48:08.521012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:08.267327Z","title":"Nerfeditor: Differentiable style decomposition for 3d scene editing","venue":null,"work_id":"bca101a4-ca77-4427-bf40-f4eaee9cfda4","year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.281748Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:fa68a748fcf92ee8ceac8f7e952740f7a85bf3dea0f85ece5e079a72a8c68a8e","observation_id":"8d1602de-0b8a-4ce9-932f-42e1e4f763ba","resolution":{"observed_at":"2026-08-06T13:48:08.354300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T13:48:05.330695Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.330695Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:02f63b82a3b0bc0ad05d328c444b6d10c30ac0f7dd069db1104c88c2038a6699","observation_id":"c26e365b-d88e-4c53-a69c-b6714aff5e66","resolution":{"observed_at":"2026-08-06T13:48:05.330695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11448","last_updated":"2021-04-09T10:38:15Z","snapshot_observed_at":"2026-07-06T09:00:15.310896Z","submitted_at":"2020-02-26T13:06:14Z","title":"Predicting Neural Network Accuracy from Weights","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11448","snapshot_observed_at":"2026-08-06T13:48:05.407676Z","title":"Predicting neural network accuracy from weights","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.407676Z"},"links":{"cited_paper":"/paper/2002.11448","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:91c9cc0ead7ca0ca488c66ab64be23cafcd71117192b3f86a3a26bc91343b467","observation_id":"7ab09c0b-a41a-48e8-8a2b-cbebe2789cee","resolution":{"observed_at":"2026-08-06T13:48:05.407676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:08.101941Z","title":"Nerf-art: Text-driven neural radiance fields stylization","venue":null,"work_id":"e09f21d2-08c8-4d44-88ac-13f94253384c","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.468093Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:165e2e217c54bd4d5a87aea6efbd2c00a46b12e13f5409bce008f555a64261f0","observation_id":"eb4e30a1-0393-473c-82ee-5b520211aa20","resolution":{"observed_at":"2026-08-06T13:48:08.173686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:07.929329Z","title":"Sparsenerf: Distilling depth ranking for few-shot novel view synthesis","venue":null,"work_id":"e4f5e012-e0a7-4aec-a6d8-69fbf6466c46","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.572795Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:e6211a996c770bcf65ddb8018b1610c916937359aa60e6fed38be9f514189c05","observation_id":"c31f8e96-e0b5-4c36-90b5-40368345e440","resolution":{"observed_at":"2026-08-06T13:48:08.035248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.13298","last_updated":"2023-03-02T04:54:00Z","snapshot_observed_at":"2026-08-01T05:19:34.423939Z","submitted_at":"2022-07-27T05:09:54Z","title":"Is Attention All That NeRF Needs?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.13298","snapshot_observed_at":"2026-08-06T13:48:05.618712Z","title":"Is attention all that nerf needs? arXiv preprint arXiv:2207.13298, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.618712Z"},"links":{"cited_paper":"/paper/2207.13298","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:c1b08c6bb74c081db6491eb16cdac04790f4e91f5afa74f102d20405b30071c7","observation_id":"a28ae1b7-f897-400a-b58d-e9bba72b171f","resolution":{"observed_at":"2026-08-06T13:48:05.618712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:07.800946Z","title":"Dynamic graph cnn for learning on point clouds","venue":null,"work_id":"b2355c47-fd54-439d-93c9-2450bdf594a6","year":2019},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.692671Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:cd0daafcf2239572ea1d058593d96075abf464b4b5162c636e5077a4907f07d5","observation_id":"e300df26-04ea-4ae6-bf17-4223e3601067","resolution":{"observed_at":"2026-08-06T13:48:07.858689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-06T13:48:05.768385Z","title":"Finetuned language models are zero-shot learners","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.768385Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:a1097ab6f20470343adfd0bf90d505131df79c6614364a721076a59aa865aeef","observation_id":"e9f58a95-666a-48b2-a049-35d35c33e215","resolution":{"observed_at":"2026-08-06T13:48:05.768385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:05.820539Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.820539Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:bacc04809390960e6af0134f804d9ff80ad3ac2a6598efcf23d334a025eb22cd","observation_id":"b478d53e-5480-4da5-990a-df037edf46ed","resolution":{"observed_at":"2026-08-06T13:48:05.820539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:07.665270Z","title":"Ulip: Learning a unified representation of language, images, and point clouds for 3d understanding","venue":null,"work_id":"25fca249-9eaf-4e57-a1e9-197d3b0cfd63","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.907856Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:c67af0aa53e499daace9ae50230b4962078a34b69e6963014961c957ab6bd74a","observation_id":"77673273-a29c-48a8-8cc6-4ad89b536166","resolution":{"observed_at":"2026-08-06T13:48:07.719762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:05.963623Z","title":"Ulip-2: Towards scalable multimodal pre-training for 3d understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.963623Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:30efaeb45574c543b37cb59b9fb181971444e96cd6b8faf9cbeb7d7879fffc2a","observation_id":"cc5f76cf-c860-463d-83c8-058c219d105a","resolution":{"observed_at":"2026-08-06T13:48:05.963623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:07.514517Z","title":"3d question answering","venue":null,"work_id":"000136e5-e466-40ec-aa3e-9577e8f846cc","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:06.031130Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:eea09d60a95481943c21cad16074f925233320c6cf996a781cd721981dc7a3d4","observation_id":"3033ed8b-c1f1-48f7-9586-27403ce950e1","resolution":{"observed_at":"2026-08-06T13:48:07.607741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:07.375492Z","title":"Point-bert: Pre-training 3d point cloud transformers with masked point modeling","venue":null,"work_id":"3031a073-aa86-4419-913a-722c80645ce7","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:06.098632Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:e97fe0a75f370698e84348dd2ccf5fa7b78b8a804c5a8e36b04c31af7f6aa6c2","observation_id":"519ceebc-6da5-49eb-a4ce-2838b03b8532","resolution":{"observed_at":"2026-08-06T13:48:07.431484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:07.245377Z","title":"X-trans2cap: Cross-modal knowledge transfer using transformer for 3d dense captioning","venue":null,"work_id":"ab3da7f3-1465-4896-a938-82a6266e5517","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:06.200728Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:c22cb42ede55721e53e7312409dfd4bdf2a28bc6e02f2e5d3ddaf40369321e5d","observation_id":"7dd928f8-0435-4871-bd4e-afac0d0200df","resolution":{"observed_at":"2026-08-06T13:48:07.306267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-06T13:48:06.283815Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:06.283815Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:4f0febf0b7c753d65c72708cfe602d25d86f94e00e310f9f813ce83a876088df","observation_id":"784c7428-fff6-409c-9438-38c5d308cb57","resolution":{"observed_at":"2026-08-06T13:48:06.283815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:07.042234Z","title":"Multi3drefer: Grounding text description to multiple 3d objects","venue":null,"work_id":"7b1d94a9-b95c-4e67-b5ac-2dd467db4746","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:06.345597Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:1fff0fded38e1cd9acbc1cb3dbcb9b69dc79f46de34c63338358d8203da04643","observation_id":"9aba2e05-f1e7-4d15-a6cb-3153795430b5","resolution":{"observed_at":"2026-08-06T13:48:07.168973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:06.869839Z","title":"Toward explainable 3d grounded visual question answering: A new bench- mark and strong baseline","venue":null,"work_id":"87aa8d8c-8541-45db-88ab-13174ae78b09","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:06.435172Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:454b358931cd9864f796cd8b57a9ba8cff43597757c5a128f666607fffb16076","observation_id":"b311e841-d93d-4903-8c7a-c1aef28fea23","resolution":{"observed_at":"2026-08-06T13:48:06.944632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":39},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 1 inbound Pith citation observation for arXiv:2507.20110."}