{"as_of":"2026-08-19T08:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f1ea3542e34a316225a4c98b656ae14ab71fc8e3bf29fa3ba6522efdc4953825","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:42:54.362361Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09147/citation-record","integrity":"/paper/2608.09147/integrity","json":"/paper/2608.09147/citation-record.json","paper":"/paper/2608.09147"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-11T22:42:52.373661Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.373661Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:9c6e77ec5f2fd5b7b8645aefe0d2338ae5b65fa2e3b365a5b7d1ebd451e05dc2","observation_id":"78187b37-94e9-4dd8-b4af-ff1488dd0a7c","resolution":{"observed_at":"2026-08-11T22:42:52.373661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-11T22:42:52.454808Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.454808Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:9fdf83887bd7e64912c2c52e6831a205e2669701905c72546d75caa5504c225c","observation_id":"a7ac1406-829b-40fc-b1e9-169ad44954c1","resolution":{"observed_at":"2026-08-11T22:42:52.454808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.504746Z","title":"Omni3d: A large benchmark and model for 3D object detection in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.504746Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:5bd2689003b1caa8ce053c441793e9428ef247b097e9dc8972a1ef83626c0282","observation_id":"c3ad01e8-def6-4e6c-8e24-bc721f91da91","resolution":{"observed_at":"2026-08-11T22:42:52.504746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.554749Z","title":"M3D-RPN: Monocular 3D region proposal network for object detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.554749Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:cd1b583182b2fcda0c0f5428a50b2cc5d46158cd9d1052e29f040aafe36e5c02","observation_id":"90a70e41-f54d-47b9-98c3-3f3cd25b3930","resolution":{"observed_at":"2026-08-11T22:42:52.554749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.604817Z","title":"Kinematic 3d object detection in monocular video","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.604817Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:44bf31b9f11d9fe597ef703b2d3bf39a43ea831909fb177184da2b060bae5191","observation_id":"3ce193aa-cddf-4f74-8175-91e0ac7532a8","resolution":{"observed_at":"2026-08-11T22:42:52.604817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.654732Z","title":"nuscenes: A multimodal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.654732Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:349af5d0f0595a1da43d88463571c463acf360f59747736a4964422f41bd803e","observation_id":"3f1303ee-8007-4af9-bfb5-4c4363cff98c","resolution":{"observed_at":"2026-08-11T22:42:52.654732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.724730Z","title":"Vip-llava: Making large multimodal models understand arbitrary visual prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.724730Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:9621cf004e7940e25375e873d5ad6a44e9519fcfec02282e4739a71b90690962","observation_id":"24e6dcf1-8213-4c00-8286-fc3476ad42fc","resolution":{"observed_at":"2026-08-11T22:42:52.724730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.793808Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.793808Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:39f1440b0ce1e8d9ecaa901ff86ca5f43b54a3ab7b0d770987f0a6ecba038ab1","observation_id":"5e130e7f-2d26-456c-baa8-617872a5d2ca","resolution":{"observed_at":"2026-08-11T22:42:52.793808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.824736Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.824736Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:c5099868a56c6f2d2a94578ea6a3189d1b36811e87ab72018598c1f0a9190341","observation_id":"83832680-966a-4a5f-8c4e-db20adbe28da","resolution":{"observed_at":"2026-08-11T22:42:52.824736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.874733Z","title":"End-to-end autonomous driving: Challenges and frontiers.TPAMI, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.874733Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:e700b8be2a05cca7c7e3009879745f63a0a080349c8cf769928994a4eff8bfbb","observation_id":"e6c6e7a1-3ae5-4715-be06-b98e34dc481e","resolution":{"observed_at":"2026-08-11T22:42:52.874733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.944744Z","title":"Group detr: Fast detr training with group-wise one-to-many assignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.944744Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:03614f2d484b7e8e8a25863298aa0362cb929859d0500b938c4144857a301d22","observation_id":"8330c96b-fc03-4c7e-9145-d3301ba91440","resolution":{"observed_at":"2026-08-11T22:42:52.944744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.693459Z","title":"Monocular 3D object detection for autonomous driving","venue":null,"work_id":"53deaa95-ddf7-4e9e-a61e-c3f2e60f348b","year":2016},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.981681Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:6562ecb0f76becce6628baec9bb257b09b2eb0c134f572a1e6e44075c1c68332","observation_id":"e2417d19-70ef-4c87-bf52-e655c967885d","resolution":{"observed_at":"2026-08-11T22:42:57.700479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.666160Z","title":"Spatialrgpt: Grounded spatial reasoning in vision-language models","venue":null,"work_id":"7638e62e-932b-43d2-8295-cd6ac0d5c7e5","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.986671Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:73292a31dea52407bc33bd99652a32f50cd3a5f5e6af79b57a176535fd6be883","observation_id":"dd181c65-09b5-4bea-b858-2538d2300357","resolution":{"observed_at":"2026-08-11T22:42:57.674561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-11T22:42:53.000772Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction.arXiv preprint arXiv:2505.20279, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.000772Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:c25c840b0585b7da0361792427dd26aff584d3fdfd5cd1e98926bf20c5d8c8fd","observation_id":"0c82e4ce-98f5-4ea0-a26e-f96ecbe88d26","resolution":{"observed_at":"2026-08-11T22:42:53.000772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.643468Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite","venue":null,"work_id":"f4f9de22-bcdf-4046-82af-bc97dbcd5a4c","year":2012},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.005052Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:6f38218d75a47454a45c7a522774e77722cbe6f75fbf0801466b74ccb48c112e","observation_id":"a4f199b9-b3b4-4dc8-a599-45da86db1309","resolution":{"observed_at":"2026-08-11T22:42:57.649205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.613800Z","title":"Omni-rgpt: Unifying image and video region-level understanding via token marks","venue":null,"work_id":"22d6f0c4-2201-417f-95e4-c4a0388540be","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.010574Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:b5ccd019f5e8d97e3e97c8203c155a16835bfe38e82879f6041c8344cd98ab79","observation_id":"2841caaf-7f15-4478-9468-6ef4ea17803c","resolution":{"observed_at":"2026-08-11T22:42:57.628430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.593252Z","title":"3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023","venue":null,"work_id":"170ac61c-dcd4-4db3-812a-aa40b1340495","year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.073375Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:9efd3c4e6fd0d5b55ed18fafed6261ad4c4d164db1476545657da838cad22fe9","observation_id":"522112df-aa3b-401d-8aee-8c89481b5409","resolution":{"observed_at":"2026-08-11T22:42:57.599219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:53.174829Z","title":"G 2vlm: Geometry grounded vision language model with unified 3d reconstruction and spatial reasoning.arXiv preprint arXiv:2511.21688, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.174829Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:0793c4b57462f0febf85d79d1b73d9f1c2862ea82c9fa14ff742fd382f438b57","observation_id":"3881e149-4a7e-4de0-a851-8ce5edee5fcc","resolution":{"observed_at":"2026-08-11T22:42:53.174829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.573344Z","title":"Monodtr: Monocular 3D object detection with depth-aware transformer","venue":null,"work_id":"7887bb73-37fb-4951-9d1b-7077b9626043","year":2022},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.262321Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:27de80baa93ea1e77908faf60844b30088819718def42d83ca8ea83f7a534db0","observation_id":"18419ca6-7380-4cf1-aff1-ad51f31b019a","resolution":{"observed_at":"2026-08-11T22:42:57.579065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23478","last_updated":"2025-07-31T11:59:06Z","snapshot_observed_at":"2026-08-14T04:49:13.419227Z","submitted_at":"2025-07-31T11:59:06Z","title":"3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23478","snapshot_observed_at":"2026-08-11T22:42:53.308959Z","title":"3d-r1: Enhancing reasoning in 3d vlms for unified scene understanding.arXiv preprint arXiv:2507.23478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.308959Z"},"links":{"cited_paper":"/paper/2507.23478","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:fb6cd4eb6dd99af0a1eab13eae9d6cc7580aa764768033adc2f1d62ab393af4f","observation_id":"08e3fa61-7058-4d04-8939-88d2ac4f9c22","resolution":{"observed_at":"2026-08-11T22:42:53.308959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-11T22:42:53.321616Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.321616Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:77982d75336551c7673ff6fa55ffa75451f07205ff566950751f4b9b25bd6bf9","observation_id":"9b3aeba7-04ee-4f29-902a-354be8ffe679","resolution":{"observed_at":"2026-08-11T22:42:53.321616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.518162Z","title":"MonoMAE: Enhancing monocular 3D detection through depth-aware masked autoencoders","venue":null,"work_id":"8c599833-333b-4d3a-89c2-df25688ba47b","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.327359Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:d5347f86cea7323113adf087cf16378e72466835bd832bf777d5d0623e99e881","observation_id":"e7904973-73c8-45a1-89f2-b77e58085ba8","resolution":{"observed_at":"2026-08-11T22:42:57.526359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-11T22:42:53.333231Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.333231Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:010ed267ceb387dd404274e5bb536d22bab51166ba7c3698fc706d1cba90d218","observation_id":"6a05925d-86a8-43d2-a165-6ff18efb440a","resolution":{"observed_at":"2026-08-11T22:42:53.333231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.475017Z","title":"Deviant: Depth equivariant network for monocular 3D object detection","venue":null,"work_id":"aa8a5e85-df34-43e8-a7e0-26fd2907992f","year":2022},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.342029Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:8d278b8b02c1dc92d60cefd3e917b6c4a10d09756c497f1deccb0482fa61e12a","observation_id":"854d2589-ba1f-4f56-8e6f-747c5a5ef5cb","resolution":{"observed_at":"2026-08-11T22:42:57.481595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.366894Z","title":"GrooMeD-NMS: Grouped mathematically differen- tiable nms for monocular 3D object detection","venue":null,"work_id":"387ea8d9-b1be-4852-9da0-e0f9883b8cdd","year":2021},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.346486Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:c51aacabacb4f04a9abf7aef1bbead2c8a2d10c7b9ce389f45f02d6f01ff922d","observation_id":"2fb6ed6b-45af-4bfa-8ef9-154926dcb3a3","resolution":{"observed_at":"2026-08-11T22:42:57.384023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:53.356112Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.356112Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:deebb36bc578d903db7c526b09a3735e82e0322d608170f36a8ba8f391ac060c","observation_id":"e6c1ab68-4aab-4800-bec9-de66a139910f","resolution":{"observed_at":"2026-08-11T22:42:53.356112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:53.377319Z","title":"Spatial forcing: Implicit spatial representation alignment for vision-language-action model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.377319Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:a14a9323aeada8a9791d059c6ee520c57444808acea211487c37ec5909b852c8","observation_id":"18000c34-1f1c-4aa3-bfdd-8bcec243e38f","resolution":{"observed_at":"2026-08-11T22:42:53.377319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.322317Z","title":"Diversity matters: Fully exploiting depth clues for reliable monocular 3D object detection","venue":null,"work_id":"bb33fa3f-9f6a-4487-9b97-6eb6a6091e03","year":2022},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.384759Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:8b861644671ec1cf36091a5b405a0aac4ee956a0ed91adf9965ca36aed7919fe","observation_id":"cba93358-baad-4f5c-83e3-dfc086a59282","resolution":{"observed_at":"2026-08-11T22:42:57.330239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.273522Z","title":"Unimode: Unified monocular 3d object detection","venue":null,"work_id":"82ae9cf0-9f51-4ccf-9bd6-941c7d697c61","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.408946Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:7d22a5c008b97b87199cf090f02529e9f0707cb68ba7056c702ef3dca4f5ff13","observation_id":"119f86c7-41cd-4bff-8152-1b4cccf1686d","resolution":{"observed_at":"2026-08-11T22:42:57.280631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-17T12:09:40.331965Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-11T22:42:53.434907Z","title":"Draw-and-understand: Leveraging visual prompts to enable mllms to comprehend what you want.arXiv preprint arXiv:2403.20271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.434907Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:bf7fcde98a34257b5460359170c943d4f4ebc6c59751d773d9d57e44ef77378d","observation_id":"8fa1b647-66f7-4b60-a412-b5f0b4ff52c9","resolution":{"observed_at":"2026-08-11T22:42:53.434907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.235169Z","title":"Monotakd: Teaching assistant knowledge distillation for monocular 3d object detection","venue":null,"work_id":"d1aa8796-edb2-4f28-8b44-dce20d0946c9","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.458216Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:b427177ac3bd1852112d4c61ed8b690a6c8b4ca33169c64e855b70011282c353","observation_id":"9f483add-fae9-40b5-a7c2-0fd6e8f13984","resolution":{"observed_at":"2026-08-11T22:42:57.240456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.187309Z","title":"Edge assisted real-time object detection for mobile augmented reality","venue":null,"work_id":"9783dd33-56f2-41e3-9fe6-d0f2627707e0","year":2019},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.467345Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:667f5bdbce5df2476bd5771e1f441c2c778b4e43bc3df05eaa764cb102336857","observation_id":"eabbbc06-55f9-49f3-8c57-32305fff15f0","resolution":{"observed_at":"2026-08-11T22:42:57.200955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-11T22:42:53.483168Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.arXiv preprint arXiv:2303.05499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.483168Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:0ecb6102d7f4a171e661c50086f3056e30e6bff868d5ffc1210559c5c0cfdfd3","observation_id":"b0bc0143-b102-4693-8248-9b421bbfada8","resolution":{"observed_at":"2026-08-11T22:42:53.483168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.144764Z","title":"Monocular 3D object detection with bounding box denoising in 3D by perceiver","venue":null,"work_id":"a90f10f9-40e5-4c61-bf2a-5102f206c9f8","year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.495442Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:3b9da068d0797a36fb6d4e48c1c51446212624a39b9d132b751fad33cb33460f","observation_id":"2a606330-b530-4f66-8ae2-80de9a39a6b7","resolution":{"observed_at":"2026-08-11T22:42:57.151658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.070519Z","title":"SMOKE: Single-stage monocular 3D object detection via keypoint estimation","venue":null,"work_id":"062d240d-6c17-4cf6-9420-b994d60ff0df","year":2020},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.509612Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:bacf2c093043337a9d540ed3cd5c9ef6d90c8f6e45ebcbc40c1e12c549321ac7","observation_id":"7da3dcbf-0e6a-4bdc-9567-7f86343cfc96","resolution":{"observed_at":"2026-08-11T22:42:57.090921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.040480Z","title":"Geometry uncertainty projection network for monocular 3D object detection","venue":null,"work_id":"9ece853e-6811-44d6-9918-49b8559ff764","year":2021},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.545831Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:50d83a9c558834ba18e078b01ca5a8db9b6588865e0fb84b9b778a5f601be9f0","observation_id":"879ac075-af12-42e5-bac9-025c6a08f40f","resolution":{"observed_at":"2026-08-11T22:42:57.045583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.998502Z","title":"Delving into localization errors for monocular 3D object detection","venue":null,"work_id":"1f9f7c5a-fbcd-4b7b-a5bc-f83a57efad57","year":2021},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.561955Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:ea94dbf55ea6a689d34a1326518afecc8acfb1fa2df7c70494301668bb036b9e","observation_id":"aec03b03-f803-4a25-b210-5627b9eb3029","resolution":{"observed_at":"2026-08-11T22:42:57.008203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.964094Z","title":"Spatiallm: Training large language models for structured indoor modeling","venue":null,"work_id":"3bd21451-5a35-4bf3-917d-461719cf8ff6","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.577772Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:8ac2d1835688b7bacdd586773a410cfb8fffb9ae47d48f7b1ae742454e441b7a","observation_id":"ee06c864-b72f-4a19-9421-5aadf4f8dd37","resolution":{"observed_at":"2026-08-11T22:42:56.972882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.921993Z","title":"3D bounding box estimation using deep learning and geometry","venue":null,"work_id":"49f25326-3756-4091-b4d7-dda9c2d0d99f","year":2017},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.606345Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:46081ba44aadfe0695f8b8b6358254732783a26d7c400edf8b76f42dd9513452","observation_id":"de0e65f4-6035-4210-bfc4-513c3c0464cf","resolution":{"observed_at":"2026-08-11T22:42:56.930618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T22:42:53.654995Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.654995Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:49febf408a7c5e1876c173f85dacc6a7325e845488bbf9a903cc11fd0ef74069","observation_id":"d2edd1d2-f4b0-4ee1-a4aa-9b64798b99b1","resolution":{"observed_at":"2026-08-11T22:42:53.654995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.877266Z","title":"Learning occupancy for monocular 3D object detection","venue":null,"work_id":"87d53ef9-f731-45c7-8b47-7b48beb42e18","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.681356Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:3b606a00c3e0280ce1619553173a69788a89e54717c97b1b31569ea94e3d3d74","observation_id":"4efcfa78-7ee7-4a20-a2dc-9449d139d4b3","resolution":{"observed_at":"2026-08-11T22:42:56.883468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.842481Z","title":"UniDepthV2: Universal monocular metric depth estimation made simpler, 2025","venue":null,"work_id":"58b7bd4d-ea6b-46f2-8abc-70d762296fca","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.704564Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:0aa593c43ef1ac87f52904d7a49a6140321f1dbaddaa3b7c3caf2063b5066bbb","observation_id":"e5878834-c7d7-4dae-b050-5a6e29c0a0e9","resolution":{"observed_at":"2026-08-11T22:42:56.861742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19590","last_updated":"2025-03-12T14:48:22Z","snapshot_observed_at":"2026-08-16T13:05:56.078516Z","submitted_at":"2024-10-25T14:31:43Z","title":"MonoDGP: Monocular 3D Object Detection with Decoupled-Query and Geometry-Error Priors","version":2},"cited_work":{"arxiv_id":"2410.19590","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19590","snapshot_observed_at":"2026-08-11T22:42:54.768803Z","title":"MonoDGP: Monocular 3D Object Detection with Decoupled-Query and Geometry-Error Priors","venue":"cs.CV","work_id":"e038c34b-bed2-45e4-acdf-e4718286267e","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.714226Z"},"links":{"cited_paper":"/paper/2410.19590","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:92a3fc6e2f25723a0a2ddc07b83027af5f68cc969b08552596b1d636ae7d10fd","observation_id":"953e5b24-f537-4c0e-aaec-96d8beb345df","resolution":{"observed_at":"2026-08-11T22:42:54.776140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.796917Z","title":"Monoground: Detecting monocular 3D objects from the ground","venue":null,"work_id":"09f07486-498a-4e8c-9350-bb0c16c12acd","year":2022},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.727980Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:6ae1ea80c3f6f7ffa609942ea9ef9bc606908ee42a4052f5ea3eedd47a4983fc","observation_id":"1ea534cc-fa1d-4cfd-94df-c0252b11ad62","resolution":{"observed_at":"2026-08-11T22:42:56.804138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.738798Z","title":"Loc3r-vlm: Language- based localization and 3d reasoning with vision-language models, 2026","venue":null,"work_id":"f38e518e-6522-4ab2-8175-d6d8a527d38d","year":2026},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.745953Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:36f7dd220ad9f2e0afe2be51e106cc1b2c0db9e5a962dc4f84a1f39dc51f55c7","observation_id":"16df908f-e0ad-450b-939a-d13e814696af","resolution":{"observed_at":"2026-08-11T22:42:56.756753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-11T22:42:53.802940Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.802940Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:7c8f3151a433f1e478e6e5d7b87ead99bd286d8a52b6d751a7a52ee538bc6a71","observation_id":"bca78183-3112-4a8d-96c9-4d8e2608b023","resolution":{"observed_at":"2026-08-11T22:42:53.802940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.706981Z","title":"PointRCNN: 3D object proposal generation and detection from point cloud","venue":null,"work_id":"142f456f-36a6-47b8-9023-b404f63ccc38","year":2019},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.841145Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:b4ec3b5a044882c29da991a8f548b0ebe0ca517bb67b89cb78f74b7457215e79","observation_id":"7b3fb06e-6f17-4803-91ac-a99841a826c4","resolution":{"observed_at":"2026-08-11T22:42:56.712804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.680900Z","title":"Geometry- based distance decomposition for monocular 3D object detection","venue":null,"work_id":"274f3a1f-7981-48ff-8df9-3a8261a5e840","year":2021},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.871820Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:4a18fdcab1086e1b1bbce331e08d8614f5c9db649cc023d58f3463da0a497ac7","observation_id":"3cd6c1ee-10c7-48bc-846a-b76ec98288cb","resolution":{"observed_at":"2026-08-11T22:42:56.689327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.659983Z","title":"Geometry- based distance decomposition for monocular 3D object detection","venue":null,"work_id":"21f0ce94-1f7e-4023-ab96-274cc703d175","year":2021},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.909511Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:94e9c766257a2f6008df034bd7fe49e7471fc6cbf2d722c460c7dfe06107878d","observation_id":"2d0e8530-136e-49d9-bc0b-c832c3f409d0","resolution":{"observed_at":"2026-08-11T22:42:56.664185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.581714Z","title":"What does clip know about a red circle? visual prompt engineering for vlms","venue":null,"work_id":"4371556c-fba6-4463-9d1d-ccdff8828f95","year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.919487Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:aca0bd40fff7257cfdaafc63023eafa0dc50a580191d2e4d4136590927428dc7","observation_id":"3736ae73-b70a-4964-976f-10b93280fe06","resolution":{"observed_at":"2026-08-11T22:42:56.625339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-16T07:24:08.156932Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-11T22:42:53.929902Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.929902Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:169d290057f31f97bcc18f0c525cc247369653f97dbcac04def92fcf6b605d85","observation_id":"5d14ff63-74d3-463f-8b45-db1aa07dab8e","resolution":{"observed_at":"2026-08-11T22:42:53.929902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.526678Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms, 2024","venue":null,"work_id":"b58b3ec9-1ca0-4b1e-abf4-ec777114c690","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.936623Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:7c057ae17ef4f22e81a7c4182366103314683b899e675d311c50870ca3b3826c","observation_id":"a94ea378-f03e-426e-a421-ac98d58523bf","resolution":{"observed_at":"2026-08-11T22:42:56.533136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.500547Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":"7921e40e-3b23-44eb-b405-a69eef9f90db","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.942526Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:fa1c1e4fe1557644f43dd2bb76dba6abcb903ed9e1a3f22b84ae09157478c10c","observation_id":"fdf1289f-5f3e-4688-a90a-bdd4fcf1a7a2","resolution":{"observed_at":"2026-08-11T22:42:56.510886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T22:42:53.951768Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.951768Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:280fb597eb4761ed3c0e176a402714c8ed07df4b8fdc2579928ff77e5cd81332","observation_id":"9ca04145-97e4-400f-a4e4-0db12d266f7e","resolution":{"observed_at":"2026-08-11T22:42:53.951768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.398112Z","title":"Moge-2: Accurate monocular geometry with metric scale and sharp details","venue":null,"work_id":"0dff7c13-57ca-44e5-accd-cc64b57895b5","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.974741Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:5caf0c835bcd1591c11e7fcaabb120059b12b8de5283ec31be8af2b06b9fd116","observation_id":"464d571d-5e91-490f-9035-36f154fe330c","resolution":{"observed_at":"2026-08-11T22:42:56.424408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.333857Z","title":"Embodiedscan: A holistic multi-modal 3d perception suite towards embodied ai","venue":null,"work_id":"fd978d9f-1ce0-49be-8374-cf6fbe97b718","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.004744Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:e12667a8271a544b5acb7a48ab16f080dbebf0e094b93a39380bb84562bb62ec","observation_id":"264621be-d8a0-4199-98c3-3d909f425a0a","resolution":{"observed_at":"2026-08-11T22:42:56.341262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.262445Z","title":"Probabilistic and geometric depth: Detecting objects in perspective","venue":null,"work_id":"bcfe1592-dfb0-4640-895f-10e2bb6478cf","year":2022},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.064754Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:9648e000c545c18327b27863722595ab37e987ab2b6286d6303b9f97f83725b6","observation_id":"cdecedf8-bf46-43f3-92fe-1aefe629245a","resolution":{"observed_at":"2026-08-11T22:42:56.294761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:54.081262Z","title":"N3d-vlm: Native 3d grounding enables accurate spatial reasoning in vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.081262Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:f1f8227c4dd5718c960e3f34335a768335e028989e57ee9f3498338bf4405a21","observation_id":"e19fcf69-9e6f-48f5-851e-8e80b33591d3","resolution":{"observed_at":"2026-08-11T22:42:54.081262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.189791Z","title":"Ov-uni3detr: Towards unified open-vocabulary 3d object detection via cycle-modality propagation","venue":null,"work_id":"9df83b67-954b-4cf2-9bfa-b5fcbb099c9d","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.091079Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:e8be93e3f3fae41e755e4853a55d941cce4da5fa08c1dc78e81fe07de1062dae","observation_id":"46524032-23a2-4784-bae8-7f75f1d48cda","resolution":{"observed_at":"2026-08-11T22:42:56.224751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.145791Z","title":"Monopgc: Monocular 3D object detection with pixel geometry contexts","venue":null,"work_id":"9d3f6363-8e9f-4e63-bf4b-65df1de8de1f","year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.103917Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:a2b44d022a8db3c233835c67eaee0eb0842039e2e352900ef6a977a248577256","observation_id":"280fb01e-b9ca-4d1e-8300-ce9f1f413955","resolution":{"observed_at":"2026-08-11T22:42:56.164805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.104751Z","title":"FD3D: Exploiting foreground depth map for feature-supervised monocular 3D object detection","venue":null,"work_id":"672ff012-317e-408e-9185-a735bb0f0062","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.109578Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:21b9c85cd011d3164be3f63e3c1f1c6395f3c0adaa439e5713423d9235c92fe8","observation_id":"5480dcd5-e064-4aa8-9866-feecab4c74cf","resolution":{"observed_at":"2026-08-11T22:42:56.128861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.027203Z","title":"Pointllm: Empower- ing large language models to understand point clouds","venue":null,"work_id":"f88606f2-a3be-4a77-a577-659fd00cbb9b","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.114238Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:274fe495192c7770ea12e5caae829ca9766470cf3e60311cfd86cddfb9815a47","observation_id":"8f9e0e7d-8bea-491f-939f-0d4de752dd4a","resolution":{"observed_at":"2026-08-11T22:42:56.036818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.997164Z","title":"MonoCD: Monocular 3D object detection with complementary depths","venue":null,"work_id":"abff904b-af99-4188-b9ed-7efc1c70f486","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.127214Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:597f2b63cce608acfea7eaac23c870f30b3d4e941990df8981c217350baf7117","observation_id":"c64dd527-500d-4641-88e4-5c8dc94b5f5f","resolution":{"observed_at":"2026-08-11T22:42:56.008213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T22:42:54.139970Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.139970Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:aa957513feadd2e1bfeb0ed8d9412de16fe44c742b7340a923c67867754d4533","observation_id":"86720c4b-872d-48b3-8306-8fab8ba7e1a6","resolution":{"observed_at":"2026-08-11T22:42:54.139970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-11T22:42:54.156474Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v.arXiv preprint arXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.156474Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:f227c73b144f051380dc51c69068916cb94d61ae24d4f362dd0674ac236f8b24","observation_id":"666854ce-4354-4e33-9547-1adc3248a3a9","resolution":{"observed_at":"2026-08-11T22:42:54.156474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-08-16T14:31:04.236202Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-11T22:42:54.163754Z","title":"Lisa++: An improved baseline for reasoning segmentation with large language model.arXiv preprint arXiv:2312.17240,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.163754Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:52cdd205bddb7fd14060f5e48c2d14e8a89d0d63804c93094011e27835e9c0a9","observation_id":"a210ecc5-89bc-4640-b532-515336f80c78","resolution":{"observed_at":"2026-08-11T22:42:54.163754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.934810Z","title":"3d-mood: Lifting 2d to 3d for monocular open-set object detection","venue":null,"work_id":"c276847e-b446-41d9-b8a7-45a09090e4e9","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.177913Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:7cc93c85da44e1824d71faf0efe8b17f56ef1fc27f8142110835e1c87477726b","observation_id":"b6e47b97-ee27-49f9-906d-13d45745190f","resolution":{"observed_at":"2026-08-11T22:42:55.945609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.857585Z","title":"Open vocabulary monocular 3d object detection","venue":null,"work_id":"41f623d5-c275-46ba-9f25-b4e81c2ceba9","year":2026},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.186433Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:8031a9650e71c3a07558e576593530775e958697aeb4f893a4c655759277e623","observation_id":"caaacff0-c253-4a51-aff0-1cb35087c041","resolution":{"observed_at":"2026-08-11T22:42:55.884809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.781594Z","title":"Dwyer, and Zezhou Cheng","venue":null,"work_id":"d3dc9cc9-fead-410e-bfe0-72d463aad48c","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.191594Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:a876b43b685de71bdaa03d3cd67e9f755c0c635798858575306d890d60e06c3d","observation_id":"a4526452-68b2-42d3-989d-a256912ba07c","resolution":{"observed_at":"2026-08-11T22:42:55.786661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.761230Z","title":"Center-based 3D object detection and tracking","venue":null,"work_id":"f9aa6936-b6e6-49ff-a1be-ea6db6c6bec2","year":2021},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.197268Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:e4a9f7a6d253d19bc45f0741cfcaaec7b33acddc2f94ea239820008942df6d0f","observation_id":"bae92556-470c-47af-b0b5-9125361f0e94","resolution":{"observed_at":"2026-08-11T22:42:55.767320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.738617Z","title":"Videorefer suite: Advancing spatial-temporal object understanding with video llm","venue":null,"work_id":"32e50ea0-8b45-4226-acb1-7d01a66a6b7c","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.217735Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:d2617ea6aa0b23128fbff9f58d6dc69d9c8c8232802515f3f1d8d8537ce3feff","observation_id":"f71b29e5-d9df-4b87-922b-94e788bf33e9","resolution":{"observed_at":"2026-08-11T22:42:55.745716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:54.233876Z","title":"Detect anything 3d in the wild.arXiv preprint arXiv:2504.07958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.233876Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:ed6623bb5f6cfe878ab98fbdcae253e6ce0d7a211b3e00e0559c6e64e89a0f50","observation_id":"265460b4-e427-4e2b-bb7b-22a006fc1663","resolution":{"observed_at":"2026-08-11T22:42:54.233876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.706361Z","title":"Monodetr: Depth-guided transformer for monocular 3D object detection","venue":null,"work_id":"cebfcd95-1d01-4588-8df0-b798e99bddb4","year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.240517Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:c8e3ec168e1ab683ed676e30c91bcd3e7efba9ed1c740084a1e08819753222b1","observation_id":"68317237-466c-47b3-ba67-da854cbe601c","resolution":{"observed_at":"2026-08-11T22:42:55.713522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.680898Z","title":"Objects are different: Flexible monocular 3D object detection","venue":null,"work_id":"c5803866-73df-43bf-ab54-f01a77e6c4bf","year":2021},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.246579Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:5b46d7ba84f680684c6d3b40f7308b8c408256bcc1858ae95032187320715d55","observation_id":"067c0e06-798b-4c3b-aa8c-2bb5dde42f51","resolution":{"observed_at":"2026-08-11T22:42:55.687279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.650118Z","title":"Unleashing the power of chain-of-prediction for monocular 3d object detection","venue":null,"work_id":"4aa86e36-fd96-46d3-ba62-b739eab307a8","year":2026},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.252044Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:0f30beb0de1d024a365cdfac431200f04f7877313e33f6367ec0c87fa2818114","observation_id":"25ffde4e-e80a-4ab3-a81a-fdbdc20ed98a","resolution":{"observed_at":"2026-08-11T22:42:55.656889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.617067Z","title":"Detrs beat yolos on real-time object detection","venue":null,"work_id":"48d5c932-f1a2-4d20-b64e-3ab60f2247ef","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.256824Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:f90af533521b3cd12c1bb72fff478a850a968da8195228393be39175de7da3fd","observation_id":"209120c8-ddd5-4d61-af5d-9a23c15c4629","resolution":{"observed_at":"2026-08-11T22:42:55.623346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-13T15:09:51.205767Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-11T22:42:54.268139Z","title":"3d-vla: 3d vision-language-action generative world model.arXiv preprint arXiv:2403.09631, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.268139Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:100ec6c338a39c9eb4b74ae9dc5d732bdc464ad54cd2bea93ee47316c0d2ffe6","observation_id":"09ba0257-7335-4fdc-a8f0-51d918e6005e","resolution":{"observed_at":"2026-08-11T22:42:54.268139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.586957Z","title":"Monoatt: Online monocular 3D object detection with adaptive token transformer","venue":null,"work_id":"320519dc-c1cc-4783-b6fc-0acd3ea6e212","year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.273611Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:765256aa7a7df4395be31a3533a905055b3693ccffd79ad5d19d11670d8fe203","observation_id":"48466a47-025c-463c-abaa-6a85fd4ab12c","resolution":{"observed_at":"2026-08-11T22:42:55.593413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.555097Z","title":"Single image 3d object detection and pose estimation for grasping","venue":null,"work_id":"fbcc070b-cdca-4ba9-9166-e7563942ff89","year":2014},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.279104Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:a043e601a05bd4304f3ba62d9dd69fd82fc8e9717987d356b2162df2295e4234","observation_id":"78c634d8-8a69-4f21-9457-e6c66febb797","resolution":{"observed_at":"2026-08-11T22:42:55.560087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.520742Z","title":"move closer to camera","venue":null,"work_id":"269ca5e3-64c7-4419-8d25-5852c22c95c4","year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.283530Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:993f53186cf44a0d25066216bccd3df4a990a47455757b0a1608b004f30b157d","observation_id":"a4b1f79c-a60d-42a6-9eb1-19685acb8aa7","resolution":{"observed_at":"2026-08-11T22:42:55.535717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.449215Z","title":"16 Table 8: Oracle study under the Omni3D evaluation protocol","venue":null,"work_id":"76ac7a59-e6b6-404b-8a10-2c66a24cd779","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.290234Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:0af54813b18e51b6132fae1a857c3efd83dba112eb0f939ce7d7b37a12b16ed4","observation_id":"fe137f5a-5526-4908-8936-156107be54eb","resolution":{"observed_at":"2026-08-11T22:42:55.474764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.418013Z","title":null,"venue":null,"work_id":"5fc559d1-677f-4d59-8390-666086a3caa8","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.298620Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:819ae37808871cbacb45dc466e34a70b77d7da096b3684af59a0f62bced6819f","observation_id":"9ce2ca16-51c1-4e81-beb9-a133e672eac4","resolution":{"observed_at":"2026-08-11T22:42:55.424527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.397249Z","title":null,"venue":null,"work_id":"f2876184-be73-435c-9b89-f4a2c7f2f031","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.306001Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:7588f9e673373c3d82c25131b3c4ce7f67d0c62e6a7fb74ea123cb0e036fe6f4","observation_id":"cecaa751-2c39-4b7a-8475-e19b7c5e7c95","resolution":{"observed_at":"2026-08-11T22:42:55.402688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.349470Z","title":"We use Tmax = 2 in all experiments","venue":null,"work_id":"05c1d4b6-dfa2-4515-b366-ee13599c9a70","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.311679Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:14e6584f240194ba53e2c292fa07f4c24d3503354e2842cf243e0292c786fa7a","observation_id":"f375d25c-8e8e-419b-9642-eeb43dda1b2e","resolution":{"observed_at":"2026-08-11T22:42:55.354741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.325230Z","title":"Indoor Scenes","venue":null,"work_id":"2e3f7ae0-63ee-4a6b-a144-0fffbf7cca08","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.317038Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:6db4a0caa305a4ca6fad1aee29ec65213da913e84009efdb8bd737b003a49b2f","observation_id":"792b567a-df36-4b27-ba30-44d6946a4c14","resolution":{"observed_at":"2026-08-11T22:42:55.329673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.294457Z","title":null,"venue":null,"work_id":"ea6a2e70-5997-4fc2-a66e-6e48e6887545","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.325974Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:c984016e01667911bdf950b08c47b34daf63e1b41212de2d9c99866aaea70ba6","observation_id":"bd82f07e-8e42-4f5f-9ca6-0f0d5ec7da7a","resolution":{"observed_at":"2026-08-11T22:42:55.311937Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.268915Z","title":null,"venue":null,"work_id":"d4193d5f-f54e-454c-b4e9-b8a5721ddf43","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.332332Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:6c546781d1ca7423a3469c5e8e5bc10ac9e194cddc02551e4a873e80a3f44603","observation_id":"6d395df3-d3f2-4dce-88e0-920eabc80a69","resolution":{"observed_at":"2026-08-11T22:42:55.273178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.248265Z","title":"a black car viewed from behind on a street","venue":null,"work_id":"2bd328c9-0de3-4272-b1f4-0dc1169c81e1","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.338960Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:c71714148c8400d89dd794e7a60fcc2f45a58d5ba2c93859c61cf6ffff3170dc","observation_id":"2b7222f0-37fa-4f99-b2a5-68ba5b59e96d","resolution":{"observed_at":"2026-08-11T22:42:55.253604Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.210227Z","title":null,"venue":null,"work_id":"8e340b1a-a1d3-4da7-9426-22d9fc5ce23f","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.362361Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:30a601aa4cfc18097ee8c76e298d552297e55cdb9c5e8af73c5a8af775f22e10","observation_id":"232eaabc-dc06-47de-89f1-54293262a824","resolution":{"observed_at":"2026-08-11T22:42:55.220328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.414751Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.414751Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:f13150ef8263d1a0a53720269f57b5fe11e5b4ce794019bb62982bbe5432025e","observation_id":"09cdadc8-5e8d-4111-bacf-209a8e6eda34","resolution":{"observed_at":"2026-08-11T22:42:52.414751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T02:50:04.185092Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":1,"verified_fuzzy":52},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2608.09147."}