{"as_of":"2026-08-19T18:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83900f5ec2dc7532a19776d31754b12896f5fe2db73a2c327baeaf797130cac4","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T06:01:20.008438Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.19266/citation-record","integrity":"/paper/2504.19266/integrity","json":"/paper/2504.19266/citation-record.json","paper":"/paper/2504.19266"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:19.884012Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.884012Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:20fd1a8e4a5f87ee4050127fc8e5cab61c76a5d7fba6a585848f2c7698e0f238","observation_id":"211a10ca-b3a2-4fb7-9e80-5b2890714ac7","resolution":{"observed_at":"2026-08-16T06:01:19.884012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2412.04434","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04434","snapshot_observed_at":"2026-08-16T06:01:20.333852Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","venue":"cs.CV","work_id":"c4f471b8-dc3e-4b8c-abba-5a93ea07e3fd","year":2024},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.889564Z"},"links":{"cited_paper":"/paper/2412.04434","citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:04c09b665305bb6acf2b175fab4c57133a6d9af33567bb3148ea7de96141e444","observation_id":"ba96b6eb-c730-4041-940b-ce05dfa59553","resolution":{"observed_at":"2026-08-16T06:01:20.339228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:19.894678Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.894678Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:a7ad5955a207e5545ec2f98d610473c99d50c1b7567e538171abfba5aecd463a","observation_id":"8e1b0f0f-0f9e-4af3-b1a3-d4618f754737","resolution":{"observed_at":"2026-08-16T06:01:19.894678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:20.539854Z","title":"Open-fusion: Real-time open-vocabulary 3d mapping and queryable scene representation,","venue":null,"work_id":"f508ef7c-3cab-413c-90aa-4e89d4da8196","year":2024},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.899601Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:88f5786ae0fc338da8c2ee08163d9160a4a1ba23a561f0b05eefd606cbe5f64b","observation_id":"0b1f0870-de5a-4075-aef6-f77843ef9e90","resolution":{"observed_at":"2026-08-16T06:01:20.545563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:20.522462Z","title":"Segment everything everywhere all at once,","venue":null,"work_id":"20445d21-6295-4a63-99c0-bef5405d2de3","year":2024},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.904379Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:78a6c90f851c31919a239065049b2ec9e0076a9a815f63c42b46d9ad6bf9cb38","observation_id":"aaa9dcf7-3b82-47ac-987b-4107aba062b8","resolution":{"observed_at":"2026-08-16T06:01:20.528518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:19.909434Z","title":"Emerging properties in self-supervised vision trans- formers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.909434Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:4e98ef3b2e39ef1c76c43bac183d026b678691be2afe5cd7e649e884aebe384f","observation_id":"48d4f719-6b1d-4ce2-a721-cfd3df2940a1","resolution":{"observed_at":"2026-08-16T06:01:19.909434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-16T06:01:19.914668Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.914668Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:5942f935191322331fd4eaad620de13663de79eca7d0bba9e95583e2eb5c084b","observation_id":"f4c9d245-538a-4a60-bfeb-7d5ffb57cf0d","resolution":{"observed_at":"2026-08-16T06:01:19.914668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:19.919561Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.919561Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:5d0d288164e0c81436ccbe5a3d4d852af647879d3d569957fe172705c373ed7f","observation_id":"6d5890fa-2329-46ef-b887-9ea8c5bf8d60","resolution":{"observed_at":"2026-08-16T06:01:19.919561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:20.486264Z","title":"Groupvit: Semantic segmentation emerges from text su- pervision,","venue":null,"work_id":"ca3d105f-ae99-4716-9b1c-e737ef22fb77","year":2022},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.924146Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:a7059c6d73d86e3eb3dc4ac21c90e64f194c42314da46d03ca059f72f866b04d","observation_id":"78c7aaaf-2ae8-4f83-8065-b15d0b4dc6cf","resolution":{"observed_at":"2026-08-16T06:01:20.491569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:20.470751Z","title":"Segclip: Patch aggregation with learnable centers for open-vocabulary semantic segmentation,","venue":null,"work_id":"45810b40-9667-4f72-894f-78653aa45922","year":2023},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.928719Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:0959611f8d778477e9104df0c39abf618087d050c18a51b179f863e9ea0dc31e","observation_id":"78867969-f314-4e6b-bffa-7ed5313e4cc2","resolution":{"observed_at":"2026-08-16T06:01:20.474991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07241","last_updated":"2023-10-23T14:56:15Z","snapshot_observed_at":"2026-08-16T15:55:21.590710Z","submitted_at":"2023-02-14T18:40:26Z","title":"ConceptFusion: Open-set Multimodal 3D Mapping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07241","snapshot_observed_at":"2026-08-16T06:01:19.933372Z","title":"Conceptfusion: Open-set multimodal 3d mapping,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.933372Z"},"links":{"cited_paper":"/paper/2302.07241","citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:26a0b3b57b29f8a4fecd5afcf90196a7f46d6c750f61533ef238877ff40dfc34","observation_id":"80d092ab-a67f-4dbd-9b95-e47135bd7a3e","resolution":{"observed_at":"2026-08-16T06:01:19.933372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13631","last_updated":"2023-10-29T14:04:25Z","snapshot_observed_at":"2026-08-16T15:21:36.291027Z","submitted_at":"2023-06-23T17:36:44Z","title":"OpenMask3D: Open-Vocabulary 3D Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13631","snapshot_observed_at":"2026-08-16T06:01:19.938518Z","title":"Openmask3d: Open-vocabulary 3d instance segmen- tation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.938518Z"},"links":{"cited_paper":"/paper/2306.13631","citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:d96a626f138959f53a71cbd419412d063ef9020f3762767f0ae60d5d60b865ea","observation_id":"e4d06987-2b26-49da-8241-5494471f59a6","resolution":{"observed_at":"2026-08-16T06:01:19.938518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14279","last_updated":"2024-09-15T20:14:42Z","snapshot_observed_at":"2026-08-16T13:32:44.038388Z","submitted_at":"2024-07-19T13:01:12Z","title":"OpenSU3D: Open World 3D Scene Understanding using Foundation Models","version":2},"cited_work":{"arxiv_id":"2407.14279","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.14279","snapshot_observed_at":"2026-08-16T06:01:20.258344Z","title":"OpenSU3D: Open World 3D Scene Understanding using Foundation Models","venue":"cs.CV","work_id":"d74a78dd-e108-40b1-8b1e-8f9adea5754a","year":2024},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.943725Z"},"links":{"cited_paper":"/paper/2407.14279","citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:5e76a9c0a145df4178ce7844b25b09b0706b88aa2282bdebd620104292d11f09","observation_id":"6c54ed42-9483-43ac-a740-76096e5b125c","resolution":{"observed_at":"2026-08-16T06:01:20.265661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:20.456784Z","title":"Open3dis: Open-vocabulary 3d instance segmentation with 2d mask guidance,","venue":null,"work_id":"4a858a2e-73e4-4f2d-8be7-ce80aa78e9c8","year":2024},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.948573Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:8d3f8b9019ffbf1fead3fbdf5e79921aada970f9af2b0bea2d3989761129fd06","observation_id":"e513ed1c-06c7-4855-9105-b31b1197a44e","resolution":{"observed_at":"2026-08-16T06:01:20.461007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:20.440015Z","title":"Openins3d: Snap and lookup for 3d open-vocabulary instance seg- mentation,","venue":null,"work_id":"5cdcae87-2c5f-4b92-8f64-fc113a9a9dda","year":2024},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.953359Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:bdf43857775ae8674fd2cfc9d1d792e19e9ee924414b5cdf6d682fcdfdc45a33","observation_id":"c6d641b0-8571-402b-8a56-9cd7c8fec23a","resolution":{"observed_at":"2026-08-16T06:01:20.445353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:19.957962Z","title":"Openscene: 3d scene understanding with open vocabularies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.957962Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:2178360363b0f10bf582a36a9e55e7f39a5ac3246545a3a9d8549784de3ff6f2","observation_id":"ef83b21e-3546-4ea2-8714-fd4293978937","resolution":{"observed_at":"2026-08-16T06:01:19.957962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03908","last_updated":"2023-06-06T17:59:51Z","snapshot_observed_at":"2026-08-18T18:47:42.890158Z","submitted_at":"2023-06-06T17:59:51Z","title":"SAM3D: Segment Anything in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03908","snapshot_observed_at":"2026-08-16T06:01:19.962484Z","title":"Sam3d: Segment anything in 3d scenes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.962484Z"},"links":{"cited_paper":"/paper/2306.03908","citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:ba1ca39b556fac22a9aaa4690c0d3ac1630cb1c86918179c830460ed7768b8e5","observation_id":"3f78897c-78ed-4d60-8899-83c5098246be","resolution":{"observed_at":"2026-08-16T06:01:19.962484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:20.414037Z","title":"Maskclustering: View consensus based mask graph clustering for open-vocabulary 3d in- stance segmentation,","venue":null,"work_id":"8a733a0e-d48a-45b0-9659-ed590d4db0f1","year":2024},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.967223Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:77e3026bf8b907605ab40936e734f4b027a5b8d6943e51c4fa21e2fda82c5f6a","observation_id":"301e25d7-72d8-4695-bad8-47271c290d2f","resolution":{"observed_at":"2026-08-16T06:01:20.418923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11811","last_updated":"2025-02-12T05:16:17Z","snapshot_observed_at":"2026-08-19T02:47:06.163542Z","submitted_at":"2024-08-21T17:57:06Z","title":"EmbodiedSAM: Online Segment Any 3D Thing in Real Time","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11811","snapshot_observed_at":"2026-08-16T06:01:19.971626Z","title":"Embod- iedsam: Online segment any 3d thing in real time,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.971626Z"},"links":{"cited_paper":"/paper/2408.11811","citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:fde373f0972b990af0f99a497433ef362f1ff3c9e28de17703a5433e02106410","observation_id":"73ca5631-1d76-481f-bb24-95b6dd1cb2b5","resolution":{"observed_at":"2026-08-16T06:01:19.971626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-08-19T15:15:13.657700Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-16T06:01:19.976378Z","title":"Fast segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.976378Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:b5aa4d7b1a1e7665e5bc6f49695ce40919b238aacd4f0506bc70207589463693","observation_id":"a2e383e4-5220-4a32-ba2b-201533813b99","resolution":{"observed_at":"2026-08-16T06:01:19.976378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00352","last_updated":"2024-12-31T08:58:10Z","snapshot_observed_at":"2026-08-17T03:26:51.508544Z","submitted_at":"2024-12-31T08:58:10Z","title":"PanoSLAM: Panoptic 3D Scene Reconstruction via Gaussian SLAM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00352","snapshot_observed_at":"2026-08-16T06:01:19.980414Z","title":"Panoslam: Panoptic 3d scene reconstruction via gaussian slam,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.980414Z"},"links":{"cited_paper":"/paper/2501.00352","citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:b1f7f5ac57abddd0eb0e3846b491649da9ed494fe48d6054b7952301d6764fd9","observation_id":"14d6a0eb-a576-445e-b201-d9f559e5bf3e","resolution":{"observed_at":"2026-08-16T06:01:19.980414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:19.984489Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.984489Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:b5e2b03550c6c901835e5c6edf3277189c772b7d873228cd88e53aa9c0ef1cf5","observation_id":"a444c903-3256-4a98-8f5d-6a79b65147fd","resolution":{"observed_at":"2026-08-16T06:01:19.984489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:19.988243Z","title":"Ovo-slam: Open- vocabulary online simultaneous localization and mapping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.988243Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:b4fb4e1bc8bc206e0dee6a5475a70af9a4a547c66a4f30cd6ba6d087fd469553","observation_id":"cc05642a-3518-478c-9f91-21d2b644ba70","resolution":{"observed_at":"2026-08-16T06:01:19.988243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:20.387988Z","title":"Alpha-clip: A clip model focusing on wherever you want,","venue":null,"work_id":"03125162-ede8-4fc4-ac6f-ff0050394765","year":2024},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.992078Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:d25f42c4b8891b6cb1b9fec2d6932c5ab7700d3bbd1e9d8dd3cb548c17047fcd","observation_id":"6b04ccc2-b69f-4f5e-a606-861d050d0271","resolution":{"observed_at":"2026-08-16T06:01:20.393256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:20.372429Z","title":"A benchmark for rgb-d visual odometry, 3d reconstruction and slam,","venue":null,"work_id":"afcccce6-4787-41d9-8773-f2e54bfde48c","year":2014},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.995911Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:2dd8c895f97c767554a349c72bee541e8a11922e9043e9b6667f9cfa9a8c7cf4","observation_id":"e89a8251-3c5c-4a60-a70e-315bda75d025","resolution":{"observed_at":"2026-08-16T06:01:20.377365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:19.999615Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.999615Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:98ca7784e22e7ce9fe9bd9920630eab6f20d5324948a80fad31edd83f69c1ee5","observation_id":"014c1a8b-09b6-42b5-ba89-65535de154eb","resolution":{"observed_at":"2026-08-16T06:01:19.999615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:01:20.003349Z","title":"Scannet++: A high- fidelity dataset of 3d indoor scenes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:20.003349Z"},"links":{"citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:02d87faefbe6640844d906e84f327286e150e657ace2af49cd563b821d4a7815","observation_id":"c5647868-c814-4cf8-8953-8095915f61b7","resolution":{"observed_at":"2026-08-16T06:01:20.003349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05797","last_updated":"2019-06-13T16:29:58Z","snapshot_observed_at":"2026-08-16T20:27:41.336890Z","submitted_at":"2019-06-13T16:29:58Z","title":"The Replica Dataset: A Digital Replica of Indoor Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05797","snapshot_observed_at":"2026-08-16T06:01:20.008438Z","title":"The replica dataset: A digital replica of indoor spaces,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:20.008438Z"},"links":{"cited_paper":"/paper/1906.05797","citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:686a81f4be5f8e2f8aa90b60dc03025ed918440ed6e991fc5f90d0ca9e68b106","observation_id":"4dd3d3ca-0aad-430f-b188-43c28522d0eb","resolution":{"observed_at":"2026-08-16T06:01:20.008438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":2,"verified_fuzzy":9},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2504.19266."}