{"as_of":"2026-08-21T12:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b0ac176136ba0a7381fa2f41d1b5c5a418d96668dabdfce624fbdd1cf6a3895c","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:01:33.101578Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11412/citation-record","integrity":"/paper/2412.11412/integrity","json":"/paper/2412.11412/citation-record.json","paper":"/paper/2412.11412"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.124029Z","title":"ARK- itscenes - a diverse real-world dataset for 3d indoor scene understanding using mobile RGB-d data","venue":null,"work_id":"5aa01c33-b9c7-439e-b444-99cfaaa4e2ce","year":2021},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.819069Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:eb6694543a612502b70da5d25e504622bfce53d8361ca210d9cd14b0f2bd1348","observation_id":"88d7e4c3-a819-40c6-89bc-7e14d3ffb88a","resolution":{"observed_at":"2026-08-11T15:01:34.130075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-11T15:01:32.825902Z","title":"Zoedepth: Zero-shot trans- fer by combining relative and metric depth","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.825902Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:9d5eed9d45df54ab347ffd974b9f57abf7d00c7e33b531a7a2aa5122a1798601","observation_id":"5deb3153-9e0e-48cd-a832-a81b6b5bce56","resolution":{"observed_at":"2026-08-11T15:01:32.825902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.100938Z","title":"Omni3d: A large benchmark and model for 3d object detection in the wild","venue":null,"work_id":"d8887c82-46f2-4f42-ba66-da099adf18bb","year":2023},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.832395Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:066cdee5186976a499c4cb7669c934b120dd3d4a104bc8fddc311c0f1790c7fe","observation_id":"45870842-9e13-4590-b8ba-13c3663a0c1d","resolution":{"observed_at":"2026-08-11T15:01:34.107460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.081009Z","title":"Coda: Col- laborative novel box discovery and cross-modal alignment for open-vocabulary 3d object detection","venue":null,"work_id":"3076e54a-7b60-404e-9252-d712e8ccb6fd","year":2023},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.837973Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:79e01558d3f6007787fb7dbb706cfc4b4a53f59abfe041ac32da93c91f931561","observation_id":"5441bd91-2ee2-4822-9941-6f2a2edf5ac8","resolution":{"observed_at":"2026-08-11T15:01:34.087970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:32.843953Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.843953Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:827cf11d7a855bd49453dd2bd5ebd3e045037034241fda4212cd858cc994d6c3","observation_id":"1e58a82f-6466-4a47-ad05-da3854ba49e2","resolution":{"observed_at":"2026-08-11T15:01:32.843953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.045558Z","title":"Exploring classification equilibrium in long-tailed object detection","venue":null,"work_id":"c537ac32-f210-491e-a8cb-4e12119c7381","year":null},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.850680Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:d690ad7a1199a08da3b67a3c5274a18cdd56d3e2cd8c8ec9cc97ca44f4f26733","observation_id":"f0eac324-f7a8-4a70-8c99-c8d8b793f9b4","resolution":{"observed_at":"2026-08-11T15:01:34.052947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.028420Z","title":"Dqs3d: Densely-matched quantization- aware semi-supervised 3d detection","venue":null,"work_id":"b5c512ff-7605-49b7-b538-91cf8b04676a","year":2023},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.856107Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:d3475c0f50bb9f6e8bf2e8768539c111132d26e0cf220701c3ffa47df2e31ee4","observation_id":"aeb6ac87-6f10-461a-b8e0-22c7034c164b","resolution":{"observed_at":"2026-08-11T15:01:34.033969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.010302Z","title":"Fast r-cnn","venue":null,"work_id":"4048321e-55fc-474a-a8ce-ee3d34ba6ed5","year":2015},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.862565Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:89c3d18bd74e0711e4c75548999eca023a6e2f32487a9597e2df94eebf876285","observation_id":"990c192f-eb67-4516-807f-431d14fa9c31","resolution":{"observed_at":"2026-08-11T15:01:34.015333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.994086Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation","venue":null,"work_id":"2f2f591d-551b-48b6-98e7-e4cb6eea16c1","year":2014},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.868468Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:e5d09783cb04a6504ea744e5cfe550b99fadecf5e947b42e8240529d7da89449","observation_id":"c5d034e0-83f5-4a34-bd6b-d9030947d806","resolution":{"observed_at":"2026-08-11T15:01:33.998956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.974722Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":"8d9664fb-d6e9-4283-a556-eb73d3c74fa5","year":2022},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.873751Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:c0a657b993c9230ba64a18c9a59feac817312ac69093a328d1514ae4d8ab5687","observation_id":"710d132a-d2d7-49fb-a757-7b7180520ace","resolution":{"observed_at":"2026-08-11T15:01:33.980561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.957107Z","title":"LVIS: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"f588653e-8807-4add-9bb3-742ede9cb6e8","year":2019},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.879582Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:d3487c804bf1930977399bab1ffe16345aeda54c250c44af79460332e5658401","observation_id":"99a5487d-c825-4040-9ecd-e184b426a038","resolution":{"observed_at":"2026-08-11T15:01:33.962656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.938817Z","title":"Mask r-cnn","venue":null,"work_id":"2e0cfed1-0da1-483b-8936-96bc8c6d3279","year":2017},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.885508Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:9f3cd9181757037132685a78d6f8b41c9ffbb466cb42424c329addcbdf263368","observation_id":"59b1d90f-f408-4140-b337-526a3e9fe003","resolution":{"observed_at":"2026-08-11T15:01:33.944279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.921152Z","title":"Cooperative holistic scene understanding: Unifying 3d object, layout and camera pose estimation","venue":null,"work_id":"4f220d4b-3bd1-4cf7-b204-520482d68303","year":2018},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.891321Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:391549fdd2b162728b7f60926ea030229b37eae890362eee9602a57b43c8c304","observation_id":"dd0d3eb3-9740-45a9-90e9-c545304fbf58","resolution":{"observed_at":"2026-08-11T15:01:33.926961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.903401Z","title":"3d-relnet: Joint object and relational network for 3d prediction","venue":null,"work_id":"f4ebef18-1054-4e83-9520-a8d1dd21d65b","year":2019},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.897240Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:646c626e5d4dd4e51a3ea7194a057a31cf047959d38a93bb40ff1808b87cc34a","observation_id":"166f0d29-6c2e-441e-a923-87f8aa162fd8","resolution":{"observed_at":"2026-08-11T15:01:33.909519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.885178Z","title":"Cornernet: Detecting objects as paired keypoints","venue":null,"work_id":"f75f03e7-00e2-41c2-97ed-68874ff22465","year":2018},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.904736Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:5990a95564a3d46482ca9f50e5c41951fef12c6e269bbe90dd03476321988d07","observation_id":"654a91fe-b3c2-4320-810f-cba6662aa775","resolution":{"observed_at":"2026-08-11T15:01:33.891078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.868598Z","title":"Overcoming classifier im- balance for long-tail object detection with balanced group softmax","venue":null,"work_id":"b74e72de-e340-47b3-8293-031d3fa893dc","year":2020},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.910845Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:94cdf5d854790252ff0c30dee2edad491885a3ed1d6ecfc8125154c95ec05f2b","observation_id":"b1519e68-ff5f-4d98-a294-c8e93c924c1c","resolution":{"observed_at":"2026-08-11T15:01:33.873986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18573","last_updated":"2024-09-23T14:55:21Z","snapshot_observed_at":"2026-08-19T00:08:09.557612Z","submitted_at":"2024-02-28T18:59:31Z","title":"Towards Unified 3D Object Detection via Algorithm and Data Unification","version":5},"cited_work":{"arxiv_id":"2402.18573","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.18573","snapshot_observed_at":"2026-08-11T15:01:33.240804Z","title":"Towards Unified 3D Object Detection via Algorithm and Data Unification","venue":"cs.CV","work_id":"d59ec7c2-8ac1-49f7-aea7-bb95a4848db7","year":2024},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.917088Z"},"links":{"cited_paper":"/paper/2402.18573","citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:08095b498b3bc112af021e843372a461e81f563672c11cfc2abf8cbfa8e63e53","observation_id":"53370ef3-ee1f-4b19-8a72-1da4c33ad235","resolution":{"observed_at":"2026-08-11T15:01:33.248430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.850655Z","title":"Ssd: Single shot multibox detector","venue":null,"work_id":"92140d0d-4b73-46fa-a61d-11764fce48f2","year":2016},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.926872Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:5be5fcd021e2e9d65f7658466a7584e1a1ea91154f6389cb2e1056d95b774b71","observation_id":"97e0f6ff-fb58-40ea-ab56-4712a01e5ce1","resolution":{"observed_at":"2026-08-11T15:01:33.856016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.833906Z","title":"Open-vocabulary point-cloud object detection without 3d an- notation","venue":null,"work_id":"06cd4e5b-af53-4cb0-a771-6ed8329cf864","year":2023},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.931772Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:1c27292a8ca8f17545ebb35ac5cb9ff0513dc0449f066522c6acc979a87eee2d","observation_id":"36342aa1-3951-4467-8802-58fbcdd5f140","resolution":{"observed_at":"2026-08-11T15:01:33.838797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.815515Z","title":"Open-vocabulary point-cloud object detection without 3d an- notation","venue":null,"work_id":"9ef1d06c-1cd6-46e5-8534-bc8b02eb130c","year":2023},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.936810Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:b8eefd8297ff8d314b26452c878f2d57e76a6e2a5cfe89e1e900602c85a0ab9c","observation_id":"25943ee2-4262-4070-9764-530e0ac5ee3c","resolution":{"observed_at":"2026-08-11T15:01:33.821828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.798312Z","title":"Total3dunderstanding: Joint lay- out, object pose and mesh reconstruction for indoor scenes from a single image","venue":null,"work_id":"04258cf9-ef1d-4682-b42c-9ac9f5555ce1","year":2020},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.941913Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:463440a4ee2af9c91629f9fe53792a40f1ae48be3f6a65292d9f1e5a9f733bba","observation_id":"491d8e27-e166-4fa6-8764-fc4de63ac762","resolution":{"observed_at":"2026-08-11T15:01:33.804084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.775109Z","title":"On model calibration for long-tailed object detection and instance segmentation","venue":null,"work_id":"2e509a12-3d83-4826-b516-c265c58f6ce7","year":2021},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.946996Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:328fb43577f9fc7e88fdf7d5a15af5d14ed22e48e65b03ac50becd3602a6c216","observation_id":"5e8ce9cd-2d90-46ca-b45f-0e1d706b16d8","resolution":{"observed_at":"2026-08-11T15:01:33.785036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.756708Z","title":"High quality entity segmentation","venue":null,"work_id":"adca1567-398d-4e03-9cd4-4ecfe0e886b6","year":2023},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.952133Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:1c5d3b20fd22ad300267801d5300f615458cabfa201704e017bbf6b06ce3a18b","observation_id":"6188f051-6e9c-4e9c-8eb0-636d3780fc1c","resolution":{"observed_at":"2026-08-11T15:01:33.762241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-11T15:01:32.956830Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.956830Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:9883c8d5f5118718f08e1464a5dbb4cf6afe90be2ac27b8005a61d09a9b3dc28","observation_id":"440c4190-259e-4f95-bcff-a94ccf8a616a","resolution":{"observed_at":"2026-08-11T15:01:32.956830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.737273Z","title":"Improved visual-semantic alignment for zero-shot object detection","venue":null,"work_id":"47322466-6123-462c-9c1b-58cf5a3b7feb","year":2020},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.962414Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:64d0746bbe8b6d1d2a8f8aa4ac5f6cea906a6d05591a32092f6225376fcb2a3c","observation_id":"486a7f24-64bb-4348-8eee-799f93b9bbab","resolution":{"observed_at":"2026-08-11T15:01:33.744752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02640","last_updated":"2016-05-09T22:22:11Z","snapshot_observed_at":"2026-08-14T22:45:19.997074Z","submitted_at":"2015-06-08T19:52:52Z","title":"You Only Look Once: Unified, Real-Time Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02640","snapshot_observed_at":"2026-08-11T15:01:32.967400Z","title":"You only look once: unified, real-time object detec- tion (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.967400Z"},"links":{"cited_paper":"/paper/1506.02640","citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:378009d98deaa6cb77d88335a24a03d45d3d736f00517d84140d68c14cd4434b","observation_id":"424b6811-85c8-4ad4-a860-5c4da54398ad","resolution":{"observed_at":"2026-08-11T15:01:32.967400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.718999Z","title":"Yolo9000: Better, faster, stronger","venue":null,"work_id":"d8b3422e-20de-4ba8-8395-9c8d2e0b48ce","year":2017},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.972620Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:16bd41c0fa90c8bce35ba920742b401cfe04def347abf1bfa24e46339e19933f","observation_id":"dc4f12af-3a8d-479a-a7a8-266e3a327367","resolution":{"observed_at":"2026-08-11T15:01:33.724336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.699319Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"739564e7-12b2-41fa-bc79-406a13512c44","year":2015},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.977879Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:969e02eef95d805c82b420ab4c2e315732d13b058d4c2d32859a6ff5313eb27a","observation_id":"68565193-9ad0-4579-b4b8-11e148445e53","resolution":{"observed_at":"2026-08-11T15:01:33.705623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.680617Z","title":"Susskind","venue":null,"work_id":"cd0d4e82-ed15-45e0-b6b2-ecdb51008c50","year":null},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.983136Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:e7ea7e86fd52dc10e82bc21cc4a474e24824b17b52f963efb77ccafca047f306","observation_id":"65d8cf1b-13cd-4010-8595-fdfdc80b6c0c","resolution":{"observed_at":"2026-08-11T15:01:33.686990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.661573Z","title":"Language- grounded indoor 3d semantic segmentation in the wild","venue":null,"work_id":"892829be-7497-4456-86ac-2ef2a00a8110","year":2022},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.989741Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:81e22870d982299a621ac922a5522174fdbacd1ff0f1960fc2f374457db064f0","observation_id":"237754b2-08d2-4433-8b2c-fc09950fcb95","resolution":{"observed_at":"2026-08-11T15:01:33.667928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.642543Z","title":"Imvoxelnet: Image to voxels projection for monocular and multi-view general-purpose 3d object detection","venue":null,"work_id":"f806153f-8b96-4375-a96b-4bb48f7ae0f4","year":null},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:32.997903Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:aba324890b8781fd53a394a3285036ab823137d48b22f89bf948ee86b95209ff","observation_id":"9a20f1d5-44cb-400c-96d4-f15d7f3359de","resolution":{"observed_at":"2026-08-11T15:01:33.648685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.622954Z","title":"Imvoxelnet: Image to voxels projection for monocular and multi-view general-purpose 3d object detection","venue":null,"work_id":"a6736232-8d4c-4c82-b8dd-88f4bb7e29b8","year":2022},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.005910Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:1bb245991612cf61c8c8b3925bfacaea182da79df837c61c103830ced7142b9a","observation_id":"e88424da-79a8-4aaf-80db-bd918550f311","resolution":{"observed_at":"2026-08-11T15:01:33.629442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.602293Z","title":"Object detection with trans- formers: A review, 2023","venue":null,"work_id":"ddb9fb4a-6f36-460a-8600-bedf8721eace","year":2023},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.012374Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:390099d2e5e263c428432ebc6c63d95ee9e76305320a7fcc9aa0ba46f3821896","observation_id":"09201718-0f36-4011-a98a-dc2f9dccb921","resolution":{"observed_at":"2026-08-11T15:01:33.608207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.580830Z","title":null,"venue":null,"work_id":"68c691ad-f71f-467d-8e10-5f594173b49c","year":2018},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.018628Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:a0fcec34e0b9dc77d762146e344a291c8dd6aa929d0e80eea9c8185e027bce41","observation_id":"9eac7d22-94d9-46bb-af41-dce3d90e9998","resolution":{"observed_at":"2026-08-11T15:01:33.587612Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.560713Z","title":"Lichtenberg, and Jianxiong Xiao","venue":null,"work_id":"ea9008ed-686b-4a4f-ba72-e8bdde2f5e3f","year":2015},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.024300Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:8a163df8fce6c789e76eac553aaa9151ad86d8965ced655459c064f06033266b","observation_id":"8c365951-a0a7-46b0-af0b-821fb756bf85","resolution":{"observed_at":"2026-08-11T15:01:33.566083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.542374Z","title":"Equalization loss v2: A new gradient balance ap- proach for long-tailed object detection","venue":null,"work_id":"6e6836bf-02b1-4c22-92e2-9929354f4c3b","year":2021},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.030727Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:60f65cc3967bdfad6da89a5e37ac7580b4dbc7551a6c65583a3ecfef22539c19","observation_id":"95431c26-5f2f-42de-927c-354b01eabecf","resolution":{"observed_at":"2026-08-11T15:01:33.547484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.522050Z","title":"Equalization loss for long-tailed object recognition","venue":null,"work_id":"25cb4561-049a-4c1e-bfa8-dbd6fcba638e","year":2020},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.036167Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:a26ecb99cf6dc34c7156f15bdcfd472e0e90693d0f58f3ee1cd9f7533d949acb","observation_id":"e303a519-1db5-482f-8a30-314b9f5829a1","resolution":{"observed_at":"2026-08-11T15:01:33.529520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.500803Z","title":"Im- geonet: Image-induced geometry-aware voxel representation for multi-view 3d object detection","venue":null,"work_id":"aedbd481-0121-432a-aba1-935f91ed655d","year":2023},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.042021Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:130d8e28700dd79dcff841a18b73135e315426c0667f3e13b74f7345c27e8f00","observation_id":"73c663c1-342d-4235-a9d8-3fb7f4a982ee","resolution":{"observed_at":"2026-08-11T15:01:33.507325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.480478Z","title":"Efros, and Jitendra Malik","venue":null,"work_id":"994a3cb6-512c-4de8-a6cf-7093384b2269","year":2018},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.047593Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:4c8ce35c02bd4ee411a79409f3e92b3a0e3eedea22c274b1f84eae9e6d13a996","observation_id":"444d46ca-d067-48d7-9b5b-4df0c17251fd","resolution":{"observed_at":"2026-08-11T15:01:33.485450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.455723Z","title":"Seesaw loss for long- tailed instance segmentation","venue":null,"work_id":"76f665c0-3223-42f8-8b31-439ea7ba5dc8","year":2021},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.053003Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:b5a70ddec62766886d8cf1c3a170b22dce2bc12060099c5e71f30b36b2b3789a","observation_id":"7fae7716-30e6-4cc2-9446-230a528ea6be","resolution":{"observed_at":"2026-08-11T15:01:33.461296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.437031Z","title":"Detecting 11k classes: Large scale object detection without fine-grained bounding boxes","venue":null,"work_id":"4811e6bd-5131-45df-8e09-4a5038f6af04","year":2019},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.060006Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:7885026a2bc93f96d725a14e7f1ed8a25945521bba85f43bc52c803a5a0af6c2","observation_id":"f5e5559b-19c4-400c-a8a5-70fcd0e49400","resolution":{"observed_at":"2026-08-11T15:01:33.442801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.413238Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":"13d771c1-7db3-4797-b63b-3f2323be8e7f","year":2021},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.065394Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:565b410152762ac17b21c31e3801ac8c39ecd63aa4be69860f1d8b1a4cbbc6a5","observation_id":"32bc1dbe-0e64-45bc-90fe-d0747c3c6652","resolution":{"observed_at":"2026-08-11T15:01:33.422681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.391950Z","title":"Distribution alignment: A unified framework for long-tail visual recognition","venue":null,"work_id":"842c8c70-cfc4-4571-acdb-f696b5ab8c9a","year":2021},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.072574Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:4320a87998aef65a286932a807388483b798a05f79c0a6ddd6aac7f56db1a8d8","observation_id":"8c77f4fb-a743-4bea-a29f-651a1107745d","resolution":{"observed_at":"2026-08-11T15:01:33.398101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.370436Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":"ce4383bc-34b2-4b29-afe0-d6a53b32b9e8","year":2022},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.078707Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:3ca41fbbe5f3e7f604fed5c21f64f19c50ca865ab49e12137f7a9dffb211c378","observation_id":"244f5ff2-1e3e-4507-a658-852a106662d4","resolution":{"observed_at":"2026-08-11T15:01:33.377779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.07850","last_updated":"2019-04-25T16:20:02Z","snapshot_observed_at":"2026-08-14T16:45:31.678245Z","submitted_at":"2019-04-16T17:54:26Z","title":"Objects as Points","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.07850","snapshot_observed_at":"2026-08-11T15:01:33.085113Z","title":"Ob- jects as points","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.085113Z"},"links":{"cited_paper":"/paper/1904.07850","citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:5f9fd2361e1a4ef3d204a718283dd68d72d165bbdba107dc6d498b5db7ac0e13","observation_id":"97d2a028-2783-4762-933f-9bf4dad93dd6","resolution":{"observed_at":"2026-08-11T15:01:33.085113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.348821Z","title":"On the continuity of rotation representations in neural networks","venue":null,"work_id":"46a04f8f-0f06-418b-8c0a-512305b3233f","year":2019},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.091840Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:6a74ab2984a5b4edfac7a18cca06d085ee5c18358c5776418739573bcf5e57b4","observation_id":"45c93069-dc93-4b80-a892-1c2003893245","resolution":{"observed_at":"2026-08-11T15:01:33.355539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.327316Z","title":"Tame a wild camera: in-the-wild monocular camera calibra- tion","venue":null,"work_id":"90e0d552-3c47-46b4-8cf6-434d667266f4","year":2024},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.097085Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:985977d150eea5b3bdcc947351a8c89bea5fe68630f94a1c6b871036805e1a83","observation_id":"3eca40a0-15ec-4b56-8658-495af94c19a5","resolution":{"observed_at":"2026-08-11T15:01:33.332911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.299109Z","title":"Deformable {detr}: Deformable transform- ers for end-to-end object detection","venue":null,"work_id":"1e32b872-9a02-480f-af1c-f4a9413895ce","year":2021},"citing_paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T15:01:33.101578Z"},"links":{"citing_paper":"/paper/2412.11412"},"observation_digest":"sha256:75b054b61ba7eb9446ad781f23aad2e00b55d462ae315d60ada9f9d440ca4106","observation_id":"5578a354-832c-4560-a367-3464fc881645","resolution":{"observed_at":"2026-08-11T15:01:33.307728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.11412","last_updated":"2024-12-16T03:28:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T08:59:58.410328Z","submitted_at":"2024-12-16T03:28:00Z","title":"V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":41},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2412.11412."}