{"as_of":"2026-08-08T10:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48b5223f5045d09f77967c44acddc5caada1ff1248e713db374418e48c11dd06","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:26:53.124448Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:49:46.926492Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T12:04:39.334589Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15232","snapshot_observed_at":"2026-08-06T10:49:46.926492Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23478","last_updated":"2025-07-31T11:59:06Z","snapshot_observed_at":"2026-08-07T03:56:49.161093Z","submitted_at":"2025-07-31T11:59:06Z","title":"3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T10:49:46.926492Z"},"links":{"cited_paper":"/paper/2505.15232","citing_paper":"/paper/2507.23478"},"observation_digest":"sha256:d2f93e39b28381d7fc4f2d18d7a551a2d478317163d107ebad1919f94bb2d0cb","observation_id":"f3984c54-92ce-43b4-b1e2-c0987b8b5f55","resolution":{"observed_at":"2026-08-06T10:49:46.926492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15232","snapshot_observed_at":"2026-08-04T17:31:40.726038Z","title":"Dc-scene: Data- centric learning for 3d scene understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-06T23:06:21.884601Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:40.726038Z"},"links":{"cited_paper":"/paper/2505.15232","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:663c426de0bab3702481fab7976af61f867730b72eb48c2d283f0476d90e8cb2","observation_id":"1b58e7ea-5237-4524-a269-f9889b875a63","resolution":{"observed_at":"2026-08-04T17:31:40.726038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"cited_work":{"arxiv_id":"2505.15232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15232","snapshot_observed_at":"2026-06-30T12:04:39.334589Z","title":"arXiv preprint arXiv:2505.15232 (2025)","venue":null,"work_id":"e74aa373-b208-427e-ac64-7b8e4a931dff","year":2025},"citing_paper":{"arxiv_id":"2604.17472","last_updated":"2026-04-19T14:53:38Z","snapshot_observed_at":"2026-07-06T23:04:32.734175Z","submitted_at":"2026-04-19T14:53:38Z","title":"UniMesh: Unifying 3D Mesh Understanding and Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:42.679323Z"},"links":{"cited_paper":"/paper/2505.15232","citing_paper":"/paper/2604.17472"},"observation_digest":"sha256:46ca0d6e321f757b9cf6453a2c9199f2eece7da12f025bc3e37450f911fc20f3","observation_id":"9e02fe53-9b0b-4661-8468-f0fdab1f9c13","resolution":{"observed_at":"2026-05-10T06:56:47.335709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"cited_work":{"arxiv_id":"2505.15232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15232","snapshot_observed_at":"2026-06-30T12:04:39.334589Z","title":"arXiv preprint arXiv:2505.15232 (2025)","venue":null,"work_id":"e74aa373-b208-427e-ac64-7b8e4a931dff","year":2025},"citing_paper":{"arxiv_id":"2606.26694","last_updated":"2026-06-28T04:16:09Z","snapshot_observed_at":"2026-07-07T00:01:01.437499Z","submitted_at":"2026-06-25T07:27:09Z","title":"PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-30T10:19:06.268547Z"},"links":{"cited_paper":"/paper/2505.15232","citing_paper":"/paper/2606.26694"},"observation_digest":"sha256:f523c16294312db4bddf84e35126254058cfe066572f31a11535ab6eaebc351d","observation_id":"99a746a1-d813-427d-8906-1105caa2fb4f","resolution":{"observed_at":"2026-06-30T12:04:39.336112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15232","snapshot_observed_at":"2026-08-01T17:36:37.820236Z","title":"arXiv preprint arXiv:2505.15232 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17599","last_updated":"2026-07-20T06:40:45Z","snapshot_observed_at":"2026-08-07T05:08:52.783534Z","submitted_at":"2026-07-20T06:40:45Z","title":"ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T17:36:37.820236Z"},"links":{"cited_paper":"/paper/2505.15232","citing_paper":"/paper/2607.17599"},"observation_digest":"sha256:bcbd8626284c750f0b435e64d4fa252e3c34637d7def32518dec89e91ed30b07","observation_id":"4788b30a-fbe9-49ae-a47d-90ac4ef8cef6","resolution":{"observed_at":"2026-08-01T17:36:37.820236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15232/citation-record","integrity":"/paper/2505.15232/integrity","json":"/paper/2505.15232/citation-record.json","paper":"/paper/2505.15232"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:57.610515Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real- world scenes","venue":null,"work_id":"125395ef-d706-4f30-85f3-a4474b1e078b","year":2020},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:49.560959Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:4a03d67a569ed760e77a25b83e5254fdf234c4a0e6c2caa5b57674bbf299e9f9","observation_id":"fa1094bb-e7d6-4cfd-b7f4-b56dc6180eff","resolution":{"observed_at":"2026-08-07T15:26:57.707974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/rs15030627","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:53.949847Z","title":"Leveraging self-paced semi-supervised learning with prior knowledge for 3d object detection on a lidar-camera system","venue":null,"work_id":"0a49da36-8e98-4a5e-9080-12939436cc18","year":2023},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:49.646839Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:d9bf8699d781dbc5fe333eb20f6392a21a4e3ab45b711c2b2e3e5b6ef7fc372a","observation_id":"3357db62-e625-4cf4-9824-1bc9538ce272","resolution":{"observed_at":"2026-08-07T15:26:54.064623Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:49.714641Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:49.714641Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:25cb9bbdfca1140047df42917a4d0e57ed8fdff1b5006383a9a1a0a0d6f609f3","observation_id":"80d4bc5d-70f2-496a-ae08-c86255ee387c","resolution":{"observed_at":"2026-08-07T15:26:49.714641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:57.414876Z","title":"METEOR: An automatic metric for MT evaluation with improved correlation with human judgments","venue":null,"work_id":"f5542c60-4834-4bab-be03-a3d457fde843","year":2005},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:49.809541Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:1e8d2f46b2f8b144addb031b327a9842ca341bcd75ab26a8836b7ade054fdb83","observation_id":"e39df8ce-072a-4a1e-ab4f-be1439f0f3b3","resolution":{"observed_at":"2026-08-07T15:26:57.506257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:49.933464Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:49.933464Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:420dca815a6701af5c507c922d96e57ab6f2d887af82542d5c272583a4c0056b","observation_id":"51d2ad2e-d31d-439e-9499-3bbdd84db02f","resolution":{"observed_at":"2026-08-07T15:26:49.933464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14769","last_updated":"2025-06-20T04:11:14Z","snapshot_observed_at":"2026-07-06T19:36:10.759412Z","submitted_at":"2024-10-18T17:45:42Z","title":"Medical Artificial Intelligence for Early Detection of Lung Cancer: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14769","snapshot_observed_at":"2026-08-07T15:26:50.024332Z","title":"Medical ai for early detection of lung cancer: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.024332Z"},"links":{"cited_paper":"/paper/2410.14769","citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:187bb7afd2ea9c71db4b7c2b4e16bf51db5e3bc70acf646b226c6cbec1988935","observation_id":"10554952-f0be-4279-9213-ad9d9138ce33","resolution":{"observed_at":"2026-08-07T15:26:50.024332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14028","last_updated":"2025-01-27T22:03:44Z","snapshot_observed_at":"2026-08-07T18:52:11.028179Z","submitted_at":"2024-09-21T06:08:23Z","title":"MSDet: Receptive Field Enhanced Multiscale Detection for Tiny Pulmonary Nodule","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14028","snapshot_observed_at":"2026-08-07T15:26:50.141634Z","title":"Msdet: Recep- tive field enhanced multiscale detection for tiny pulmonary nodule","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.141634Z"},"links":{"cited_paper":"/paper/2409.14028","citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:a7de589f81a83d7aabf77e5e09e6eb571facd3c8fa3beec26d54b39993053252","observation_id":"06d42139-ce94-45f9-85d5-3a52e3400988","resolution":{"observed_at":"2026-08-07T15:26:50.141634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:57.205930Z","title":"Scanrefer: 3d object local- ization in rgb-d scans using natural language","venue":null,"work_id":"44b09215-c29c-4e70-be6d-168d9d846ed6","year":2020},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.256009Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:909ff098f45513f77445dd59954114996981987699bb1362cbf059ae0c19ad4e","observation_id":"703f5852-9581-41e7-8372-15adb0fed33b","resolution":{"observed_at":"2026-08-07T15:26:57.339755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.01551","last_updated":"2022-07-22T11:49:32Z","snapshot_observed_at":"2026-08-06T22:54:09.744241Z","submitted_at":"2021-12-02T19:00:06Z","title":"D3Net: A Unified Speaker-Listener Architecture for 3D Dense Captioning and Visual Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.01551","snapshot_observed_at":"2026-08-07T15:26:50.349909Z","title":"D3net: A speaker-listener architecture for semi-supervised dense captioning and visual ground- ing in rgb-d scans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.349909Z"},"links":{"cited_paper":"/paper/2112.01551","citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:750989f05f502a853b97726d8f20132a1fba0f9027f568244f6bbeeaeac24d06","observation_id":"150b2214-50d8-468f-8c57-f63aedd7638b","resolution":{"observed_at":"2026-08-07T15:26:50.349909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.00321","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:54.662027Z","title":null,"venue":null,"work_id":"09923964-ce34-4f65-8dce-2c4684af8392","year":2021},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.440304Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:7908355c8e8fd3640a676812e0a935be3cc743b29351c105c982ef9f98dec0f6","observation_id":"fe59c19f-8c83-43e5-9094-fd149b09d2c0","resolution":{"observed_at":"2026-08-07T15:26:54.754408Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:50.526384Z","title":"End- to-end 3d dense captioning with vote2cap-detr","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.526384Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:ca019d7e678d4d94c99d103d4455360c16a152d5ba8e1d72c74e9846aa945fe9","observation_id":"f9e9b4f1-32a4-42c5-a38c-eff72b078fa6","resolution":{"observed_at":"2026-08-07T15:26:50.526384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:50.634869Z","title":"V ote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.634869Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:b7edf15b99e30333638be21c28bc7cbb898752a249d3ef9af2d2c5d1be9ebb39","observation_id":"0d4c34c6-5b9f-44c9-ac8f-b538923391cb","resolution":{"observed_at":"2026-08-07T15:26:50.634869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:57.021766Z","title":"Tightcap: 3d human shape capture with clothing tightness field","venue":null,"work_id":"c115679f-3fff-4ead-8816-b1b616c08548","year":2021},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.713735Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:881e85c7c142b3fe7d6a9a0395d251fef7fefd51802ee7bae55322ef9e5b602d","observation_id":"b3069ab7-9d8e-4e8d-804b-61a089966410","resolution":{"observed_at":"2026-08-07T15:26:57.126442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:56.822674Z","title":"Sportscap: Monocular 3d human motion capture and fine-grained understanding in challeng- ing sports videos","venue":null,"work_id":"4af81873-70ed-4323-b8f7-c7fa973d8017","year":null},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.787524Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:7c00f1153f1add50007b6421516df8b8bdee2d49817b9ce066a0789edd3becab","observation_id":"f8085e3b-3afc-43a7-aec1-c04183fb5e0b","resolution":{"observed_at":"2026-08-07T15:26:56.892942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:50.951831Z","title":"Chang, Manolis Savva, Maciej Halber, Thomas Funkhouser, and Matthias Nießner","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.951831Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:563eb93cf195d9ebe6a951ebc1b97fb47b4c8adad29f9e77271b7d2b4697ed98","observation_id":"43304b8f-70e7-4aeb-ad4e-8e6bef68a48f","resolution":{"observed_at":"2026-08-07T15:26:50.951831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:56.640946Z","title":"Scene-llm: Extend- ing language model for 3d visual reasoning","venue":null,"work_id":"a527b541-063d-4fc5-8411-e8cd30903154","year":2025},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.048446Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:5b1a398a0ff856e6fa4275acd4a2ce39db5504cff02d5dd72ff40615f276c29b","observation_id":"3b5464cd-1f29-4547-9706-605214c2c04b","resolution":{"observed_at":"2026-08-07T15:26:56.718530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09518","last_updated":"2025-04-13T11:10:47Z","snapshot_observed_at":"2026-08-07T16:06:10.395071Z","submitted_at":"2025-04-13T11:10:47Z","title":"3D CoCa: Contrastive Learners are 3D Captioners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09518","snapshot_observed_at":"2026-08-07T15:26:51.170268Z","title":"3d coca: Contrastive learners are 3d captioners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.170268Z"},"links":{"cited_paper":"/paper/2504.09518","citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:b4510175a1f56a841cccf776213eab3ece32d6282768095f53e1a7c30f2b3557","observation_id":"a3c1de17-0300-4299-9f16-94523ebd6244","resolution":{"observed_at":"2026-08-07T15:26:51.170268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:56.455088Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene understanding","venue":null,"work_id":"8a17efd4-e0a6-4abf-9f95-c1b85428be2c","year":2024},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.287618Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:3d30f9dfd2306e1e4a4fd94c7a9b0955725d2bcd5c448c4917c853f815ce27e3","observation_id":"fa011f6d-8a59-45f7-9bad-40edbd02e863","resolution":{"observed_at":"2026-08-07T15:26:56.551014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:56.256262Z","title":"More: Multi-order relation mining for dense captioning in 3d scenes","venue":null,"work_id":"72d85fb4-7dc9-4c1d-982d-844eddbee013","year":2022},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.386178Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:6fa36b66041fa3485160e64822efdfb98dd7e74bcfaa79db0ebac9ef758b4131","observation_id":"61e0c71d-58c3-40ed-8701-8a2c69f23f80","resolution":{"observed_at":"2026-08-07T15:26:56.362359Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:51.503663Z","title":"Tod3cap: Towards 3d dense captioning in outdoor scenes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.503663Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:07dd710410c52716a7176a43c3fdb3e8d7b8167718eee566e1f0671573345492","observation_id":"8dade158-1c9e-408c-b25f-e2dee8f05433","resolution":{"observed_at":"2026-08-07T15:26:51.503663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:56.073042Z","title":"Duoduo clip: Efficient 3d under- standing with multi-view images","venue":null,"work_id":"bf331a1c-1296-4efe-9c85-56e8045cbff6","year":2025},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.616487Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:22030862e38f7faebef93871e5d575b75b9cc01caba347a41bdf1b4526bcdcbe","observation_id":"9defbe52-80fe-409b-b493-7fc059f2adc9","resolution":{"observed_at":"2026-08-07T15:26:56.139402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:55.889632Z","title":"Point cloud instance segmentation with semi-supervised bounding-box min- ing","venue":null,"work_id":"15b67f3a-5a19-4f7d-88b5-93f4ad94ae8d","year":2021},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.698248Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:3d6aa3f4bae9f618bc40706d997f6406e8c1ca9b5ef8d4c4d6016e56327c05ac","observation_id":"c0ac162d-17dc-420f-8a83-a785f5f0968d","resolution":{"observed_at":"2026-08-07T15:26:55.968230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:55.729201Z","title":"ROUGE: A package for automatic evaluation of summaries","venue":null,"work_id":"e8686519-f316-4c95-98b2-23400bae2857","year":2004},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.784578Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:83bbc291ad289720310891feecae9c3a85ad0ef64a2f3a19f896c8c56c1b8fb1","observation_id":"5e0cddec-d4a0-45aa-9849-c015a4761447","resolution":{"observed_at":"2026-08-07T15:26:55.816726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-72751-1_11","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:53.707134Z","title":"View selection for 3d captioning via diffusion ranking","venue":null,"work_id":"68c97641-1611-4343-b38a-ac3cfa9997b9","year":2024},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.879837Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:ea7bba3cbe19f8f17dd5cce741d0f249f64aeca78ef044a00978fa8ff7f11dc7","observation_id":"24b646e8-201f-4062-a0f2-ecd1839a0d06","resolution":{"observed_at":"2026-08-07T15:26:53.856471Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-07-06T14:05:02.813765Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-07T15:26:51.975970Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.975970Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:de19cba3a5d6bb2769d69a36aa1c9cbb99176ea1bf07ae91034a843d6932ec5d","observation_id":"167fd060-4958-473b-b1af-9bbd11db0d31","resolution":{"observed_at":"2026-08-07T15:26:51.975970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:52.072673Z","title":"Bleu: a method for au- tomatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.072673Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:f91c035cfa547c64645adaf257eccc0542bf38067e8757e1c3125b026143e19b","observation_id":"4fb14b19-13a5-48fd-814f-fdbefe5f8e88","resolution":{"observed_at":"2026-08-07T15:26:52.072673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:55.526949Z","title":"Dense multimodal alignment for open-vocabulary 3d scene understanding","venue":null,"work_id":"8e10997c-3494-4d5d-a9d9-2a478376fec3","year":2024},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.209309Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:b0e94a7805d344988a159ad9fc130a8999c95e4d69b2ef3238c174f6134dc7ec","observation_id":"0fc8a084-a645-44f1-839c-4c0f70bd5226","resolution":{"observed_at":"2026-08-07T15:26:55.652933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11263-021-01555-0","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:53.498199Z","title":"Curriculum learning: A survey","venue":null,"work_id":"cfa41672-2bc0-4fe2-af1b-87f7a71a63a4","year":2022},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.323674Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:3ccd58f73e7b2d1b46b9dcda164346936ad816b712777906aa9ea40f7438c26c","observation_id":"da5a2097-b13a-4000-9eee-19e774419395","resolution":{"observed_at":"2026-08-07T15:26:53.603908Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:52.459540Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.459540Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:0f177235af96933c22592e62769864dcb20d6113fcbec219f7a77955e4229536","observation_id":"9910eece-4a65-45a6-af10-0dabef8bb079","resolution":{"observed_at":"2026-08-07T15:26:52.459540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2022/194","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:53.257247Z","title":"Spatiality-guided trans- former for 3d dense captioning on point clouds","venue":null,"work_id":"e63eba30-92a3-4e7a-a701-f6b9c1d28e9b","year":2022},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.574725Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:4dcb81a22701aebae2846bc6ff3ddb3d5025e4f1f1448248f990148fcb09e493","observation_id":"05317bb5-a672-42a3-891d-a48da2c20d97","resolution":{"observed_at":"2026-08-07T15:26:53.375185Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:55.348759Z","title":"Open vocabulary 3d scene understanding via geometry guided self-distillation","venue":null,"work_id":"d016d1b5-b08b-4454-86e2-33681a24efed","year":2024},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.690588Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:4e85a49cb96ac4b1cef988a7bf08d5cb88689a15b9c3c7d56a302227073c3bcc","observation_id":"8002b442-f5d6-45e1-85e7-303d57d42dc9","resolution":{"observed_at":"2026-08-07T15:26:55.441232Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.32395","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:54.206830Z","title":"Dcnet: Large-scale point cloud semantic segmentation with discriminative and efficient feature aggregation","venue":null,"work_id":"1265b520-5f81-40f3-ab95-1f5ee75e4c96","year":2023},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.793320Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:1b6b7dd599ec42638c866e24cb6c4127a397dc0f45d6fc944f6f6a46f8487916","observation_id":"4e729eaf-974c-418c-be26-0e3956807160","resolution":{"observed_at":"2026-08-07T15:26:54.320962Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:55.143657Z","title":"Meddet: Generative adversarial distillation for efficient cervical disc herniation detection","venue":null,"work_id":"8b14a5ee-d3d0-4e9c-a114-b6ec1c69ee58","year":2024},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.907186Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:533d077697a7f2558c65190286f786743b9291d3623c5dfd18a6591813e9a98e","observation_id":"005fefa9-e579-490c-b369-ccb5f30d1878","resolution":{"observed_at":"2026-08-07T15:26:55.221908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14063","last_updated":"2025-02-21T19:15:39Z","snapshot_observed_at":"2026-08-07T18:03:53.079594Z","submitted_at":"2025-02-19T19:31:51Z","title":"PedDet: Adaptive Spectral Optimization for Multimodal Pedestrian Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14063","snapshot_observed_at":"2026-08-07T15:26:53.021602Z","title":"Peddet: Adaptive spectral optimization for multimodal pedestrian detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:53.021602Z"},"links":{"cited_paper":"/paper/2502.14063","citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:1a999487e36130c477661d6bdc0cc6e3555b9029d9ce17bbe09ba0698ce0cf37","observation_id":"7472c8d1-832d-4829-a5f8-87f1ea96428b","resolution":{"observed_at":"2026-08-07T15:26:53.021602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:54.940352Z","title":"Cur- ricular object manipulation in lidar-based object detection","venue":null,"work_id":"d198c8df-c026-4f0c-995e-d92fb039c9c2","year":2023},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:53.124448Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:510ec390469e6008451eceb34bfbee5f5b605f525d1a1b18db5519cc8b982810","observation_id":"7d7dc6b1-2127-4af9-a5f0-c2d91216e5c2","resolution":{"observed_at":"2026-08-07T15:26:55.004061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:50.871125Z","title":"URL http://dx.doi.org/10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.871125Z"},"links":{"citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:207c907f6c8a8724005c8649b410bcf37da74bb4a0c2188cf5dd894be5836f88","observation_id":"72ec07b9-d372-44db-9ba1-723c8261060e","resolution":{"observed_at":"2026-08-07T15:26:50.871125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T15:19:23.911555Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":15,"verified_exact":5,"verified_fuzzy":13},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 5 inbound Pith citation observations for arXiv:2505.15232."}