{"as_of":"2026-08-14T15:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e36f1638f2d20ce7a24822a9fb39ca68dae491a5ef4ae511fc5816de14b46511","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T14:26:43.963945Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T09:11:24.423975Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:59:45.933006Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"cited_work":{"arxiv_id":"2604.01388","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2604.01388","snapshot_observed_at":"2026-07-10T02:19:35.684810Z","title":"arXiv:2604.01388 (2026)","venue":null,"work_id":"b03f2efa-296c-458c-a7dc-16bc19c5528e","year":2026},"citing_paper":{"arxiv_id":"2606.23031","last_updated":"2026-06-22T08:42:16Z","snapshot_observed_at":"2026-08-14T09:01:04.086901Z","submitted_at":"2026-06-22T08:42:16Z","title":"DrivingVoxels: Compositional Sparse Voxel Rasterization for Dynamic Driving Scene Reconstruction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T09:11:24.423975Z"},"links":{"cited_paper":"/paper/2604.01388","citing_paper":"/paper/2606.23031"},"observation_digest":"sha256:b627ca8e700bb9e309fbf694c54dc5fdb9d82be1d2ffa1b2b18f2e5f3c3301ca","observation_id":"f009c65b-50ba-4cd1-8923-836aa89eb22a","resolution":{"observed_at":"2026-07-10T02:19:35.684810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.01388/citation-record","integrity":"/paper/2604.01388/integrity","json":"/paper/2604.01388/citation-record.json","paper":"/paper/2604.01388"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: International Conf","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:b52de865dec7f324cc42ea2024602c150354d5b01131c808159e853dcb47d0f5","observation_id":"da58445d-eecf-4935-a065-fe0f86fb1c77","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19704","last_updated":"2026-04-10T00:50:03Z","snapshot_observed_at":"2026-08-11T14:26:55.408955Z","submitted_at":"2025-11-24T21:15:01Z","title":"RADSeg: Unleashing Parameter and Compute Efficient Zero-Shot Open-Vocabulary Segmentation Using Agglomerative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.19704","snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"arXiv:2511.19704 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"cited_paper":"/paper/2511.19704","citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:bc578ccf92056de6293633c6b4770aa0e52d17b7b60459b6f01fc425c83870fd","observation_id":"0d7d0866-bcea-4831-8804-65cf45051247","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"arXiv:2601.04754 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:b13ab43a9462418f3cfbbe6d81c50ca8118bbef364e21f819c789bdbf3425a53","observation_id":"b9d36c9e-fde1-445b-8d43-7888811a93cb","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: IEEE Conf","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:cd624d1df0691f3268384502d2b73056d0da8955e502b1ef71e2da7ec21a35ae","observation_id":"ea720afb-8df5-4ec2-930f-1c175b063193","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:1a00b878a4fd98d52900c89c8bcfd05613b2c6a309b1953abfd5897200bb2ab1","observation_id":"5ff7361c-d853-44ab-8f96-342b7826d582","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"IEEE Robotics and Automation Letters (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:699498fa28b99f34f44bf2ae694b2a101cd5480cf966f0133e3ec87a5bdbb5d6","observation_id":"a959017a-5be6-448b-9c19-b09c99cba19e","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"Splat: Directlyreferring3Dgaussiansplattingviadirectlanguageembeddingregistration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:52bc3e1536f290bcc267e97280bbe468ca66b65f3f7e38eb9e98092d26870af2","observation_id":"ce441ead-b289-441f-80de-82acbea472d5","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:a707958a78ceb2d7fd19dd88e61c76184b281935a556f9eec40fb73f8ca389a1","observation_id":"a5df5588-d26a-4a84-a155-032bd81e71d2","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: Proc","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:ead84a1c7f600a24d05fc47efcd0326eb2d1746a7f3ea32d077240241c8ded79","observation_id":"49291999-3682-4793-a6e1-a4584a5cd3cf","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:093efe65b3cd91f5212e10a22f002f9ef47590061bccde6d123405802301cd24","observation_id":"64d12eb0-f63a-47f1-a1c6-895aa67b5389","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: IEEE Conf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:466d21d9b679fc7ad084a7772acbe322e7e5efa701378029c5a5ebb93355adcd","observation_id":"f50f6d80-cf20-4028-9dec-f115c17350f4","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:ab1f59080eaa83044a4a9a7989ed06a85fdd66098978f65db7b983c59871bf50","observation_id":"f68e1e48-c9b6-4a61-b225-a8afebec7299","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: IEEE Conf","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:455432bec07c68af992e47faf9e4de0ad5a10cf8d7ec9c78b33a264ecd97d82a","observation_id":"9d5c13da-83c0-4bab-a084-e65b602fc366","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence45, 3292–3310 (2021),�������������������������������� ������������������","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:055b9eddfaf9a850f66a6bdaec1a1dedf6d0f8e547327d4134339b8597285183","observation_id":"7e43287f-ba91-4c1f-add9-33b41fdbf6ef","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"Advances in Neural Information Processing Systems36, 53433–53456 (2023) Abbreviated paper title 9","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:8f1041caff82cd467181e1cb4f4c8478f54902418e7729804c4f50f4fc6a1d07","observation_id":"a3519194-6c20-4ccb-a16d-99f8c9cba200","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: Proc","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:57f4eb53c6abf93c35ef24a6f155c1461c9bde7c8002cf4bbea7c7aca5bbef85","observation_id":"cf518d68-5c69-4453-967d-197c82575d76","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"arXiv preprint arXiv:2304.07193 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:89c96f6782c07bc71162622520fc5374e55b5ac48d63ca88a1c3d04355c50fc8","observation_id":"18fea0df-f5cf-4290-aca8-072b7fea6131","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: Proc","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:8ec4c5f33e7952033e706e616407bc3e67f7a496b8c09231a46d59a2c200b5bc","observation_id":"c00f90cf-d478-4188-8ca0-6990f1801d3d","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: IEEE Conf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:e9eb74a280f84f718795d7f38648bb045f3b6ca11266f42c710c48396907ab36","observation_id":"80ede637-3c1d-464a-bfe5-9289f30e9245","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: Proc","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:d5bce83528dccea136987d54638aa3fb66a1d8cbca354930a6739b5f912f17a7","observation_id":"d1fc44be-89fa-445f-8102-02cc1285563f","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:a2f637d2b85dca620632175f0475848d2d296d2e50afebb62ef9cd58d4a10004","observation_id":"a6f117fb-b82e-4989-a727-2daf49e51daf","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: IEEE Conf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:ba70aa807bec6cac3d1baaf51e60915862ad757ddff445c0ec3027d87e651519","observation_id":"30b8b2d8-1b08-4d71-bdbc-73834adbd029","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"ArXivabs/2511.16301(2025),������������ ��������������������������������������","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:a5952892d2f7bb966fdc8da6574c0bed7c24ff929a7da5a90d1988642c5de0e1","observation_id":"135e2c87-85d4-4ff5-85ad-22e25b6d4fc9","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: IEEE Conf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:0b98c03822c396d19960cd985ac8fb8f2a5d2d8259d48d2de84b4b19882988e1","observation_id":"877ed66f-d9be-4229-bde3-4c6905dcfc3b","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: IEEE Conf","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:5602814d6b4f8ff70b80586dde18af21a4e8e1f4993c6f96b4d81dd296b70d00","observation_id":"e5731aec-aff6-493e-ba2b-f7df088cd885","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"arXiv preprint arXiv:2501.03932 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:08d140631866ae56b894bfca6d31e4d6f98ea6c6ff270421b14f5031f310be96","observation_id":"8689e2ad-28ef-4ce0-8442-2bd43ff7e291","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: International Conf","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:409c6d59e5bb8246556e018e84c40da4ad16fe28d81f87d0038be739df873bc6","observation_id":"5c940556-a0c0-47fb-b6f0-e173ef0c9bef","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS) (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:8b6eaab6af2a9dae8231286788317f08746979c28e0cbe9fb7cfa9770c6a7ddc","observation_id":"276eb924-2398-43e1-9052-64c148a18f8d","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS) (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:fa5d888f640be5a896caa1cd6b08ed64c8e67deddc088490871b30c4b9926f84","observation_id":"86617ca2-2112-404f-b114-421a3d56789f","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":"Wang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:123a59e2a2d82de6048d12200e223e2da95594cf956427d35bdf3b08e3c3165c","observation_id":"d550e8f5-7cda-425e-9b7c-271c79c95259","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T14:26:43.963945Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T14:26:43.963945Z"},"links":{"citing_paper":"/paper/2604.01388"},"observation_digest":"sha256:fc2a33a31df7bed18993d1700874a87096b1e31c129d6c2b5d90106378125736","observation_id":"5d33eac9-e9ba-4fc6-8894-b21df512e96c","resolution":{"observed_at":"2026-07-13T14:26:43.963945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.01388","last_updated":"2026-07-09T16:05:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:26:10.253620Z","submitted_at":"2026-04-01T20:48:06Z","title":"LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2604.01388."}