{"as_of":"2026-08-09T20:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6211ef1da129818c0277d54722bceca2e72af6007085ce52ece64c2b27aee32","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T16:39:53.448383Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06097/citation-record","integrity":"/paper/2607.06097/integrity","json":"/paper/2607.06097/citation-record.json","paper":"/paper/2607.06097"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.067634Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"631cd836-5c9f-4fb3-99d7-ff7398562843","year":2020},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:703d1c195931aae12ca6a8384039796fb008e04ba5f5f563b01903b7c4146dbe","observation_id":"770cf900-7afa-4733-9f33-39959fc5b2bf","resolution":{"observed_at":"2026-07-08T16:45:08.068846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.069163Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":"c51142c3-e721-4905-a18a-bb946c793429","year":2005},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:98b2fea4cf138b764ebd949986488f2790d8d1426818d598c09e880159034c1c","observation_id":"2c946741-9a0c-4648-be0f-92d6f0977cbb","resolution":{"observed_at":"2026-07-08T16:45:08.070455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.092583Z","title":"3djcg: A unified framework for joint dense captioning and visual grounding on 3d point clouds","venue":null,"work_id":"b1338cc8-3625-4307-960f-d32e87018dc5","year":2022},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:f41593fd3ec2b9d043f0140989689dee4d7a7279a1ea2bf2b8ae162ec282fa05","observation_id":"5a8dc24a-39b3-4a2e-9951-97b85b7a79be","resolution":{"observed_at":"2026-07-08T16:45:08.093792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.090865Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"418eafad-5856-4f58-b39c-80ca60e75460","year":2020},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:9612ae0fd5ed286f3c0aef408f5e6bf0f7556502fa48c9434daa9c6dff014b0f","observation_id":"7995818b-976a-4a7b-92f5-cb1da9b0de65","resolution":{"observed_at":"2026-07-08T16:45:08.092047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.061892Z","title":"D 3 net: A unified speaker-listener architecture for 3d dense captioning and visual grounding","venue":null,"work_id":"1a518a22-6a4d-40c2-9a89-128cb1569a6c","year":null},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:78a6c3dc722fe8b7095c28a84e775387cc5a3f9b0dfc8b82c4c39060cd6c7039","observation_id":"968b226e-7f3d-4e69-ad5d-54b99e90cf27","resolution":{"observed_at":"2026-07-08T16:45:08.063322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.065902Z","title":"End-to-end 3d dense captioning with vote2cap-detr","venue":null,"work_id":"6e0e8195-4fce-4ac6-b4e9-958146b8b167","year":2023},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:37ce92cbac4c5c3831c89818ae3706e7768db552998c9607deba5fcd753efcf0","observation_id":"857daf50-1891-4fdf-ba81-64f5b0b19714","resolution":{"observed_at":"2026-07-08T16:45:08.067137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.069471Z","title":"V ote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning, 2023","venue":null,"work_id":"cd262c79-021c-4368-a7c0-c7ee8e659657","year":2023},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:771714cd476e6eac8facb8ccda761f56070ddde3fe57ddb414db2f5651bc1f59","observation_id":"b9b56170-c9d7-4ce9-b064-c85786464f7f","resolution":{"observed_at":"2026-07-08T16:45:08.070675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10594","last_updated":"2026-06-09T08:58:59Z","snapshot_observed_at":"2026-07-06T23:49:47.137691Z","submitted_at":"2026-06-09T08:58:59Z","title":"Segment and Select: Vision-Language Segmentation in 3D Scenarios","version":1},"cited_work":{"arxiv_id":"2606.10594","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10594","snapshot_observed_at":"2026-07-08T16:45:07.675734Z","title":"Segment and Select: Vision-Language Segmentation in 3D Scenarios","venue":"cs.CV","work_id":"c402da3e-d579-4408-9e5f-f139f1f90279","year":2026},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"cited_paper":"/paper/2606.10594","citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:87a00dcb6d16e5d70f16635290917a0135e75985f2e2aed05973766e96a69bfc","observation_id":"a393026d-9d76-4cfc-929c-073404d8e129","resolution":{"observed_at":"2026-07-08T16:45:07.676993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.094005Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":"2407a8b7-39af-40a3-9023-1dc5267526d5","year":null},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:f40a6d176342716b416d1ac881fd946108bd8ee58b6021f2623dc2b2acef0740","observation_id":"fa03f646-0c25-40ff-8fbb-f3f4c1cec50f","resolution":{"observed_at":"2026-07-08T16:45:08.095248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.054096Z","title":"Scan2cap: Context-aware dense captioning in rgb- d scans","venue":null,"work_id":"5e8890a3-74b1-4512-ab7c-cd3b2107b58b","year":null},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:b6e5705f77689cf1b26bc0e48039e31a144a6ffdf9ee37ad99ae9c9e3c3d17cc","observation_id":"46e1c952-63e7-4e4e-ac5e-040a46854904","resolution":{"observed_at":"2026-07-08T16:45:08.055428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.050311Z","title":"Unit3d: A unified trans- former for 3d dense captioning and visual grounding","venue":null,"work_id":"8a7ee0ff-3fe6-49b3-83c8-ca869a5ae3b1","year":2023},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:24a0ba6b6403bb0d2727f1c713a2071892a2edf662e8532a6b62ef29b61c2bac","observation_id":"d517a76e-1d56-4441-8de4-e4494312825f","resolution":{"observed_at":"2026-07-08T16:45:08.051526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.052203Z","title":"Back-tracing representative points for voting- based 3d object detection in point clouds","venue":null,"work_id":"99aeb6b7-c9a9-4547-b6bd-eb66a243d6b2","year":2021},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:84b37e4aebfcff2aebf07dd7a7093cfa3dd4b61cae1ab25471d542d6db4d442e","observation_id":"69dc074a-e70a-4b58-b9a8-68ae88779ae0","resolution":{"observed_at":"2026-07-08T16:45:08.053576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.060071Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks, 2019","venue":null,"work_id":"2266e34d-1688-46d0-8f67-5431a34e2004","year":2019},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:da0c1d90cd6da7fccf3e18df895805c93a9c469b4b51b76f5c75aea259106112","observation_id":"6f8b0d8d-a725-405a-ba53-9a6c8f64b670","resolution":{"observed_at":"2026-07-08T16:45:08.061281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.081456Z","title":"Chang, Manolis Savva, Maciej Hal- ber, Thomas Funkhouser, and Matthias Nießner","venue":null,"work_id":"edbba1c9-aea3-468c-bfdd-dff464f2c5cf","year":2017},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:bd686d2ee392cd4c0b3736982aca4539c034ca20fe3ee9cd05ed75310fe2ad74","observation_id":"bb682023-94e7-4dd0-8de3-e105e7967eae","resolution":{"observed_at":"2026-07-08T16:45:08.082660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.044454Z","title":"V otenet: A deep learning label fusion method for multi-atlas segmenta- tion","venue":null,"work_id":"94adbaeb-c0e8-4bf4-bd67-96f536156dfd","year":2019},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:aa820955c940be768312e5bf34045c226bfc918fda05382060a5b58badd069a0","observation_id":"0c37d686-f28e-44b4-88c5-f3e78b0c0fe3","resolution":{"observed_at":"2026-07-08T16:45:08.046074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.048417Z","title":"An empirical study of training end-to-end vision-and-language transformers","venue":null,"work_id":"69afeac7-9799-4a02-9241-6d3c9b9a78aa","year":2022},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:8e84462d4b7694a8f75796a87e2b41eb88522dd969f6baa97b7f277d4bd8d6a9","observation_id":"6c6aa963-c870-4022-8526-6430dc607748","resolution":{"observed_at":"2026-07-08T16:45:08.049835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.015135Z","title":"Learning lightweight lane detection CNNs by self atten- tion distillation","venue":null,"work_id":"fb6dba98-0941-4116-834f-eb5c02e8de21","year":2019},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:bf33e9ba03affc7ae0722e707d7027aa9497ec2b56e6a98409834fb4785614d5","observation_id":"5ca690bb-f449-47eb-ad4d-3b06f20a5d27","resolution":{"observed_at":"2026-07-08T16:45:08.016672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.023980Z","title":"Point-to-Voxel Knowledge Distillation for Li- DAR Semantic Segmentation","venue":null,"work_id":"05736648-7cb2-48b9-8904-e4fdf5a7e167","year":null},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:edd685b033cbe04e68d4a42d9d5d6af61dd0bec2d29417e002085db148d21e35","observation_id":"5d5521b8-bc05-4580-8616-3beeca30e485","resolution":{"observed_at":"2026-07-08T16:45:08.025710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.014236Z","title":"Scaling up vision-language pre-training for image captioning","venue":null,"work_id":"d1d7e68c-8ad2-4300-9b01-f666e15933ef","year":2022},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:85f55decf3f56c63b88f6e099925d4712138a5187386daee8f8dc8a2812f265f","observation_id":"bb32d021-743e-4184-a67d-c1db2e4ac1fe","resolution":{"observed_at":"2026-07-08T16:45:08.015541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.005084Z","title":"Nerf-det++: Incorporat- ing semantic cues and perspective-aware depth supervision for indoor multi-view 3d detection.IEEE Transactions on Image Processing, 2025","venue":null,"work_id":"5d1b3645-b48c-4f1d-850c-301928a01df0","year":2025},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:0571ee2862cd781adac0ae71a741eaa154b28c899776791c774215e9383b69aa","observation_id":"c82a5b9a-1dae-4fe3-b802-998d7dd0a511","resolution":{"observed_at":"2026-07-08T16:45:08.007184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.026372Z","title":"Perturb, predict & para- phrase: Semi-supervised learning using noisy student for im- age captioning","venue":null,"work_id":"acb42dc8-aa90-4580-8a20-0c073e851b60","year":2021},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:520cb90e6acef22c7524f2c47c70b7a31ea855cea23c84809b1ca868bc362799","observation_id":"49ebd448-0871-44d6-a417-5ec01004c8ca","resolution":{"observed_at":"2026-07-08T16:45:08.028092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.040666Z","title":"Recurrent fusion network for image captioning","venue":null,"work_id":"f7d9d8f8-f901-4a3e-85dc-733556b8b4b3","year":2018},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:4f04ce74f74c014ba40b26012ecb569b836402b43fe8e6e8318abbb72d61ac0e","observation_id":"2ba7fa23-cc38-42ff-bc3a-dc6805539583","resolution":{"observed_at":"2026-07-08T16:45:08.042013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.083152Z","title":"More: Multi-order relation mining for dense captioning in 3d scenes","venue":null,"work_id":"35c213ed-1eb7-4677-8c45-a21c17aa9f50","year":2022},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:de7d3cbfeaed2a5f79978b0b024cd4234de883b147772b468e499b0f25059ab0","observation_id":"ace88239-e12d-494b-aa21-3a6de33b8bda","resolution":{"observed_at":"2026-07-08T16:45:08.084358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.102071Z","title":"Context-aware alignment and mutual masking for 3d- language pre-training","venue":null,"work_id":"5f9e8b1e-300f-459a-b528-6f79b18a3e73","year":2023},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:7e06bd964e59bc8aec6c5a2ebd3f4e28ba67e6b50dda699d7c27fa3594a09512","observation_id":"51eada91-8947-4a2a-9920-1917e97ea4c0","resolution":{"observed_at":"2026-07-08T16:45:08.103381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12956","last_updated":"2023-08-24T17:50:21Z","snapshot_observed_at":"2026-08-08T09:10:54.543652Z","submitted_at":"2023-08-24T17:50:21Z","title":"DLIP: Distilling Language-Image Pre-training","version":1},"cited_work":{"arxiv_id":"2308.12956","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.12956","snapshot_observed_at":"2026-07-08T16:45:07.684747Z","title":"DLIP: Distilling Language-Image Pre-training","venue":"cs.CV","work_id":"24bda0fc-55c4-4ab6-bbc2-a34614894606","year":2023},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"cited_paper":"/paper/2308.12956","citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:11d8f36538a5cf4310798fcab6fed74dd4e3720ba27d6daacdb7bc375dc890b9","observation_id":"dc1c7fd1-f2a1-42b7-8d6c-70c35142d45f","resolution":{"observed_at":"2026-07-08T16:45:07.686511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.096220Z","title":"Align before fuse: Vision and language representation learn- ing with momentum distillation.Advances in neural infor- mation processing systems, 34:9694–9705","venue":null,"work_id":"20892920-48d4-4f02-8ccf-9d7e7689279a","year":2021},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:6b142746ab6d7aab976f0124e7d04f765ff29bc66246f943931577e0e8689451","observation_id":"ac293cb5-3f5a-4f4e-a4b5-6ada96e398f3","resolution":{"observed_at":"2026-07-08T16:45:08.097444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T13:26:17.130621Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":"5e36d1d9-74a3-4461-b5b9-f7e701788ca9","year":2022},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:e2541626f113cf6a240efa3393fee9dcded7d1f238f5bd7e5105d3f8d14d142a","observation_id":"ac034ae4-5770-439d-bba8-0701697233c1","resolution":{"observed_at":"2026-07-08T16:45:08.088568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.089130Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":"897055a0-bc81-46ca-8f34-e142096b1b36","year":2020},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:fac40a7962585d9c9c7c4286123986939efb8b5f1ef7dad703d6a72d9e6ab477","observation_id":"fe1ff3a3-27a5-44c5-9619-369381b78827","resolution":{"observed_at":"2026-07-08T16:45:08.090362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.22103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:07.681039Z","title":"MoE3D: Mixture of Experts Meets Multi-Modal 3D Understanding.arXiv 2025","venue":null,"work_id":"c403d436-4c86-4814-bb91-6f49f2baecb2","year":2025},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:4c8af67902f1f2bdb54787cd626f7e68b7bad45c3d4a62574b234f79594058a2","observation_id":"b2ab76ca-055c-4786-be4d-185cb75fef55","resolution":{"observed_at":"2026-07-08T16:45:07.682981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.094292Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"cfa238ae-1503-4956-ab35-8dec3a13b5a0","year":2004},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:1b9516509b473623db638f307991d0029c87458e68e09c0f959d8e494bb589ec","observation_id":"6db7c481-5339-4174-8308-920c24d3d103","resolution":{"observed_at":"2026-07-08T16:45:08.095433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.103906Z","title":"Complete 3d relationships extraction modality align- ment network for 3d dense captioning.IEEE Transactions on Visualization and Computer Graphics, 2023","venue":null,"work_id":"11308ddd-94b5-4630-a704-5f6ca6063d75","year":2023},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:bd01b7275e5a7afd566310fc207722b46df1a296f484800788a5f213162f0116","observation_id":"646f077b-536c-43b1-bd6e-da1d1cc4596b","resolution":{"observed_at":"2026-07-08T16:45:08.105503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.084022Z","title":"An end-to- end transformer model for 3d object detection","venue":null,"work_id":"56348e9f-eff5-4ee6-adaa-62964e9b701e","year":2021},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:215beaa62709a6120408492ff4b27d2a7a5a08443a48b9bd6b1d1199adaeb5d2","observation_id":"7b7d8d4d-9552-4b08-9b80-34fc72754ab8","resolution":{"observed_at":"2026-07-08T16:45:08.085182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.098053Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"2670955d-43d2-4a62-9370-91b0ea9b3281","year":null},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:e4e440b0637e3eebdd0932f082a90ac031f40f721471c6c850cf916ac1521e58","observation_id":"9132598e-e2ba-42d3-a77c-d75faeadf435","resolution":{"observed_at":"2026-07-08T16:45:08.099619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:15:09.606701Z","title":"Pointnet: Deep learning on point sets for 3d classification and segmentation","venue":null,"work_id":"45c3ecf6-4dcf-4a97-b4e6-9af89630c33a","year":null},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:95880d62cd490b42750496041d64cb7493b4727a31c5d04c8e5d25630dd58ae1","observation_id":"b6075cc7-32ed-41c5-b104-b6b5ddb31d35","resolution":{"observed_at":"2026-07-08T16:45:08.101499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.077879Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"ef3b4252-e369-45f4-93a1-c9e442b4253a","year":2017},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:b696601a9d0a0df671eb8c05614606daa04209deba8218736a8ab2e5ced48dcd","observation_id":"e65cc2fb-4474-4c2f-aa3e-7e2f27e373c5","resolution":{"observed_at":"2026-07-08T16:45:08.079181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.080408Z","title":"Qi, Or Litany, Kaiming He, and Leonidas J","venue":null,"work_id":"dafd7cd8-126c-4048-afa5-8c91e7dc30e3","year":2019},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:4f1d7631045da64349730806abbc555b72ed6da52c3ad6e3b3cb6c3b3ea93d38","observation_id":"d9b72fbd-de5f-4b21-b9e9-0ab36724dd4b","resolution":{"observed_at":"2026-07-08T16:45:08.081669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.082354Z","title":"Rennie, Etienne Marcheret, Youssef Mroueh, Jarret Ross, and Vaibhava Goel","venue":null,"work_id":"a87c7047-c6fd-48e2-b569-f1761b9e05fb","year":2017},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:164cf33a6edd0fd34ec99e66fec5f2188a7076cfdde3d3d72cfb04a580c43e78","observation_id":"06a05bf8-35a4-4a7c-9472-b64c4e205fd7","resolution":{"observed_at":"2026-07-08T16:45:08.083499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.090078Z","title":"Octnet: Learning deep 3d representations at high resolutions","venue":null,"work_id":"73d65b7d-6184-4ad9-9352-38fcffd184f8","year":2017},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:a6f51e4fdac9c0c4bafefbe42cb9cb346c81aea6dbd85c2f6e874216ec4c10c7","observation_id":"f23972b7-ab42-4b7d-bb5f-85c097badd53","resolution":{"observed_at":"2026-07-08T16:45:08.091236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.070935Z","title":"Fcaf3d: Fully convolutional anchor-free 3d object detection","venue":null,"work_id":"962c0356-1858-472f-bde3-6f2189353dcd","year":null},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:f5b16ab7d74283a89b3f948c5971d253f87e6735a87f0d483014fe9ff8c67bcd","observation_id":"892a1f4d-15d4-49a2-bad3-af402d4079a5","resolution":{"observed_at":"2026-07-08T16:45:08.072951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.065691Z","title":null,"venue":null,"work_id":"3decef5b-6a37-48c0-978d-bc2230d157c2","year":2022},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:d88c7cbb2ca2de07aaa151efd5fc344f9bbb7f6c18187c76c7b0cc14f36e5641","observation_id":"76db27ec-5603-4ef8-8737-61444b85fab7","resolution":{"observed_at":"2026-07-08T16:45:08.066933Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-08T09:19:20.381840Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":"1908.08530","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-07-08T16:45:07.678174Z","title":"Vl-bert: Pre-training of generic visual-linguistic representations","venue":"cs.CV","work_id":"99831dfd-bb0e-4086-a062-0719d32891cd","year":2019},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:715351ac0850706a014e0561049f0abdc09738850ae0d54ca0f8b15e1aeb7f3d","observation_id":"e438d67d-24ca-44e6-8b77-6e4ecf96f82e","resolution":{"observed_at":"2026-07-08T16:45:07.679500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.087736Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"a638ddcf-f2f6-489f-b8cb-267e18eac60b","year":2015},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:2cef3e53345a585874a55dbc8149cc9fe0d9642c296cb27bf643d7d3220e1352","observation_id":"dfcecb9e-7e53-4638-b14d-87e9fff93cdb","resolution":{"observed_at":"2026-07-08T16:45:08.089264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.057740Z","title":"Cagroup3d: Class- aware grouping for 3d object detection on point clouds","venue":null,"work_id":"376e58b2-b6c0-4caf-a418-4f23be030af4","year":2022},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:a161334933a650d93415ebf4ea2bab316ebbc3a19511b6a338fc2865fcbf4153","observation_id":"65cc72ba-d572-4462-9755-2aaa13a88a01","resolution":{"observed_at":"2026-07-08T16:45:08.059134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.053956Z","title":"Rbgnet: Ray-based grouping for 3d object detection","venue":null,"work_id":"0f22ef84-cdb1-4808-a2c5-12ae6a4a3f46","year":2022},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:059c38799e5ac544dfffb1ab33a488890f80d6e0bdbb60a4a73900f95bee8f6a","observation_id":"843ef6ab-92be-4618-9218-1b0916d1afc5","resolution":{"observed_at":"2026-07-08T16:45:08.055231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10688","last_updated":"2022-04-22T13:07:37Z","snapshot_observed_at":"2026-08-05T15:14:12.049063Z","submitted_at":"2022-04-22T13:07:37Z","title":"Spatiality-guided Transformer for 3D Dense Captioning on Point Clouds","version":1},"cited_work":{"arxiv_id":"2204.10688","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.10688","snapshot_observed_at":"2026-07-08T16:45:07.673120Z","title":"Spatiality-guided transformer for 3d dense captioning on point clouds","venue":"cs.CV","work_id":"bd4bbb55-10ac-4560-b59f-a57af8574780","year":2022},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"cited_paper":"/paper/2204.10688","citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:58e5ddb0d92c94492c5c014f8ac9dad72372d3f9eecdce9e0bf8ef787c2ad883","observation_id":"4f20f37f-a401-4d89-90ef-215406087962","resolution":{"observed_at":"2026-07-08T16:45:07.674452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.055773Z","title":"Point transformer v2: Grouped vector atten- tion and partition-based pooling, 2022","venue":null,"work_id":"29494736-5cea-4594-9281-1f2dbd2bd2c7","year":2022},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:adb54fab57b2d8abda66f87fdbab60d221cd83d579a08e86ee04896195fb1f0b","observation_id":"473c21da-dfb2-4285-b3c8-2732efcefc86","resolution":{"observed_at":"2026-07-08T16:45:08.057219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.045323Z","title":"Taseg: Temporal aggregation network for lidar semantic segmentation","venue":null,"work_id":"2a03b7fd-170e-4537-8e5c-c786d519b11e","year":null},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:1c05242261df2054a717e77e9be8fb2ac91ecff7f4c6d3502d3bcc33e79f2929","observation_id":"3eef39bf-dfb0-4a07-ab9d-3a66fcc82be4","resolution":{"observed_at":"2026-07-08T16:45:08.046852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.106047Z","title":"Second: Sparsely embed- ded convolutional detection.Sensors, 18(10):3337","venue":null,"work_id":"af9ee31b-a760-4e21-8d8e-baee1ad4066d","year":2018},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:2c9c33121cc3f4f24bdcf3f01c684a61e194450bbff3c6ca409abb604b9cb0de","observation_id":"3e809ed1-5a40-47b4-aa28-94c4dbec1535","resolution":{"observed_at":"2026-07-08T16:45:08.107399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.052080Z","title":"Vision-language pre-training with triple contrastive learning","venue":null,"work_id":"0cb3bb81-04ae-4afd-899f-c64639048e3f","year":2022},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:92d2639ce3be2cbf44ce117f502d5292b3316174e120b2907fce5a0b3c2d9c8d","observation_id":"126695a3-1139-4a12-902b-90a0e4eac2bf","resolution":{"observed_at":"2026-07-08T16:45:08.053448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.067450Z","title":"Swin3d: A pretrained transformer backbone for 3d indoor scene understanding, 2023","venue":null,"work_id":"aa342dcd-fb12-4069-a833-d929e1c504a2","year":2023},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:c003875731439b315e6427f542eca3742270078cde75b97de309320c739560e0","observation_id":"9b088032-702b-491d-b486-7351219afa1b","resolution":{"observed_at":"2026-07-08T16:45:08.068658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.097892Z","title":"X-trans2cap: Cross- modal knowledge transfer using transformer for 3d dense captioning","venue":null,"work_id":"7d528e63-417f-4378-a2c6-1e327943cc82","year":2022},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:583ad18729261e563771cf50b1b4e3b40a71138001ac279a6f9ffafd94079d4a","observation_id":"20835cc4-818b-4f34-9c78-5bd570f1c944","resolution":{"observed_at":"2026-07-08T16:45:08.099452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.021892Z","title":"H3dnet: 3d object detection using hybrid geometric primi- tives","venue":null,"work_id":"ea5c8621-eb56-41d7-88d0-05f293c7345c","year":2020},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:4c7d15e718e38b7e7de8b4bb502f5ee90f3c3f30149d5916ab45fccd2a29975e","observation_id":"6557e455-29be-498b-a661-e0e011d43a58","resolution":{"observed_at":"2026-07-08T16:45:08.023270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.023823Z","title":"Contextual modeling for 3d dense captioning on point clouds, 2022","venue":null,"work_id":"bf7365f9-2172-4011-908b-7dc7fa45955b","year":2022},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:d484584a2b16f8a69972115c2f63c0c042eb3083f4eed9cc00583780bf056c4d","observation_id":"fb825369-20a4-4810-b10a-8977896acd63","resolution":{"observed_at":"2026-07-08T16:45:08.025537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.012686Z","title":"V oxelnet: End-to-end learning for point cloud based 3d object detection","venue":null,"work_id":"95e1dc7f-a126-45cd-91b0-7ed0546d4250","year":2018},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:c86d0bc4d383baadbc2e8b392fa1874d7ec2efacdf3d2a98cc76a7c8273b7b08","observation_id":"01df9144-44bd-4d80-8a35-2f8247dfedd1","resolution":{"observed_at":"2026-07-08T16:45:08.014418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.010420Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"d6b7e778-7e74-4a94-8e47-7beccf1a17be","year":2023},"citing_paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-08T16:39:53.448383Z"},"links":{"citing_paper":"/paper/2607.06097"},"observation_digest":"sha256:72f5dda164d09ae7dff5de53e82910c7ea64a6e4d636575c5a9c883a03886ceb","observation_id":"9b2aa759-6b9f-4e44-bba0-7200dcde6860","resolution":{"observed_at":"2026-07-08T16:45:08.012034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06097","last_updated":"2026-07-07T10:11:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T06:14:56.153441Z","submitted_at":"2026-07-07T10:11:35Z","title":"PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":0,"verified_exact":5,"verified_fuzzy":49},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2607.06097."}