{"as_of":"2026-08-20T22:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f5dc5211b91cda7728e14dc8a1570410b1b15dc14b0df0bc64fa01fa7abc1b15","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T07:16:36.490043Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28442/citation-record","integrity":"/paper/2607.28442/integrity","json":"/paper/2607.28442/citation-record.json","paper":"/paper/2607.28442"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.414135Z","title":"3D-LLM: Injecting the 3D World into Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.414135Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:cbcee5ce1bf1be0ce0dbcf732441f23c83fa5d91b8fab66774586944b8f51a8e","observation_id":"fdc5db96-c1a8-45f1-a0b1-3f8df6e9c6fe","resolution":{"observed_at":"2026-07-31T07:16:36.414135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.417640Z","title":"PointLLM: Empowering Large Language Models to Understand Point Clouds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.417640Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:133f96acde1871c2d84c0b20d3cda9cee6b0955f1a5ef67abd163f302aa8cc65","observation_id":"88b0b9db-5622-4b0d-b4ed-7fcacb0f6319","resolution":{"observed_at":"2026-07-31T07:16:36.417640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.420724Z","title":"ShapeLLM: Universal 3D Object Understanding for Embodied Interaction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.420724Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:83c4da18f635097753fa4e34c147bf4ef68e47a709afc6b9f6f2317b6f59e524","observation_id":"d76ad42b-cb8d-4a04-9737-9d67cd18dee9","resolution":{"observed_at":"2026-07-31T07:16:36.420724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.423857Z","title":"GPT-4V(ision) System Card,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.423857Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:38cba63a7b624fd6534590f0afc7e520cec3d48e6906712a56c4439dce974e5b","observation_id":"0b92832a-cea1-49e8-b611-9ce276a2513a","resolution":{"observed_at":"2026-07-31T07:16:36.423857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.426702Z","title":"ScanQA: 3D Question Answering for Spatial Scene Understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.426702Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:7ad7542c6ebf022ab7ce5e845b5e57ef22b2262e5701ab8afa7740602fd0bb5f","observation_id":"a34b8c7f-814d-438c-bc80-9b34296a8e53","resolution":{"observed_at":"2026-07-31T07:16:36.426702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.429923Z","title":"SQA3D: Situated Question Answering in 3D Scenes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.429923Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:0b3267205966c9acf99239ee2a5da653bad436740171d2059981b9e5c6970571","observation_id":"8dc45514-3dd8-407d-b4c5-880828bc34ac","resolution":{"observed_at":"2026-07-31T07:16:36.429923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-18T13:34:10.935081Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-07-31T07:16:36.432881Z","title":"Grounded 3D-LLM with Referent Tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.432881Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:ced1ebe9c51ca576b4c180a88b6ce71e86c26b3252ec8b31209d8b31792de46e","observation_id":"95c20697-b62d-45ae-b9b0-ff02f06b0e36","resolution":{"observed_at":"2026-07-31T07:16:36.432881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.435995Z","title":"Scene-LLM: Extending Language Model for 3D Visual Reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.435995Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:0589ea9d551bad6bdee8e8417f4159c0cba124495e6084b0c0ddfc168c8551c2","observation_id":"bc13bb8c-8937-452c-a868-977507b00562","resolution":{"observed_at":"2026-07-31T07:16:36.435995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-15T04:16:11.827389Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-07-31T07:16:36.438659Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.438659Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:f7b69458f8c523b808a9cc04f3481649db998a8fc25c637b1bb39978b51cda30","observation_id":"4f72c9d9-a190-48ce-8cee-9d7193ae3242","resolution":{"observed_at":"2026-07-31T07:16:36.438659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.441509Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.441509Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:abc2864cb573604b9d782afd51ff18337db2721403ccf7a6ff77e2ca75c5a251","observation_id":"3a766ae1-7e20-475f-848b-2cc52af3df51","resolution":{"observed_at":"2026-07-31T07:16:36.441509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-08-10T23:52:35.908557Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.27507","snapshot_observed_at":"2026-07-31T07:16:36.444118Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.444118Z"},"links":{"cited_paper":"/paper/2603.27507","citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:45cb76e9f063271c8860c28098db10d444d5633793c313a7e99be4bfbb9e3ec1","observation_id":"0cf9400b-0a9b-4d0e-b5c3-a7af00965c2e","resolution":{"observed_at":"2026-07-31T07:16:36.444118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.446927Z","title":"LLM-Grounder: Open-V ocabulary 3D Visual Grounding With Large Language Model as an Agent,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.446927Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:3545bb87df49cc99793521f29fedd10f483ddfb8e4eb077716b0f339ac09323c","observation_id":"38b309dd-18c5-4881-b9d1-cafb326d3d02","resolution":{"observed_at":"2026-07-31T07:16:36.446927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.449670Z","title":"[Online]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.449670Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:e4a554f630fdd3118f84ebb25bc31f40e21aeb450c5949f181abd5f1757dba9f","observation_id":"babff4ad-e4d6-4c9c-92f3-8f44be787153","resolution":{"observed_at":"2026-07-31T07:16:36.449670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.452327Z","title":"Learning Transferable Visual Models From Natural Lan- guage Supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.452327Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:1c9d7db7300f205ccff1285f4d01b6c1a53748e36c562725f8f1d1cf057541f4","observation_id":"ade514d7-ae26-4872-95a7-ceaa89fe6acf","resolution":{"observed_at":"2026-07-31T07:16:36.452327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.454768Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Under- standing and Generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.454768Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:c7190624af8b8229efc60db3751292e53bfafccf73abb78ebdca841b9e2b2cd5","observation_id":"3c2cd300-f63f-4f31-baee-cc1c39dd4e21","resolution":{"observed_at":"2026-07-31T07:16:36.454768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.457117Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.457117Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:14ae8ebac03ea6913228a3a23f37e5167d5256bda5f120b6299fa3cece9ccc84","observation_id":"c53d5e7b-a486-4cc3-ae00-1a801027ffb8","resolution":{"observed_at":"2026-07-31T07:16:36.457117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.459557Z","title":"Visual Instruction Tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.459557Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:0d7f7f068a0e71d2f29d2a57984b3f8e5f083594f07437d1ed91cb7e41de3bc8","observation_id":"255e5c43-0bd4-4ed1-bbfa-a136fa7619f7","resolution":{"observed_at":"2026-07-31T07:16:36.459557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.461931Z","title":"LL3DA: Visual Interactive Instruction Tuning for Omni-3D Understanding Reasoning and Planning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.461931Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:fb51005c84cd81a7e51954e5f9dfad7e12c63193e4630ee2ca190f4649731bd7","observation_id":"5e535469-3726-49c3-8103-fca79e63c0a5","resolution":{"observed_at":"2026-07-31T07:16:36.461931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.464739Z","title":"DSPNet: Dual-vision Scene Perception for Robust 3D Question Answering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.464739Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:4ba234576f86b24b00f3365e0bb59bbef7cc2c97bfe87171db78cbb7f4eafe3c","observation_id":"221a8b00-5876-485e-9aa3-6c0838fe03ee","resolution":{"observed_at":"2026-07-31T07:16:36.464739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.468255Z","title":"Advancing 3D Scene Understanding with MV-ScanQA Multi-View Reasoning Evaluation and TripAlign Pre-training Dataset,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.468255Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:92d89270eb8483d970d8e5afb828a8820fcf46f9b52d276e6c003059d5be8561","observation_id":"dec6cf22-360c-472c-8e41-c8578243300b","resolution":{"observed_at":"2026-07-31T07:16:36.468255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.470592Z","title":"ScanNet: Richly-Annotated 3D Reconstructions of In- door Scenes,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.470592Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:27d337d84443c810c32a4d4140f8ec139773f3ba77b076d3233fd9b23bda9742","observation_id":"dfb91dd8-5000-4cbe-a24a-7a5b517c4775","resolution":{"observed_at":"2026-07-31T07:16:36.470592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.473184Z","title":"Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.473184Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:0778764a974fc8870f408d0e33c5be635454038aab440e2e454af00dcfd6a3b8","observation_id":"78d9931c-e1c2-4acc-96c0-48c7008eabc8","resolution":{"observed_at":"2026-07-31T07:16:36.473184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.475542Z","title":"ScanRefer: 3D Object Localization in RGB-D Scans Using Natural Language,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.475542Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:a1fae3f7b9ca09e4807f0596ebda602c1f1c9f2383dae91bdbf92c5d0b48c7b0","observation_id":"defe407c-635a-4942-8cae-3a1fb3e8875b","resolution":{"observed_at":"2026-07-31T07:16:36.475542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.478063Z","title":"Flamingo: A Visual Language Model for Few-Shot Learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.478063Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:5b380c59858bca526b27a064cfd2c87e83831e917489e47cac0911735753b641","observation_id":"0f25679b-e567-4310-ae6f-4b4280ba7ec6","resolution":{"observed_at":"2026-07-31T07:16:36.478063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.480349Z","title":"BLEU: A Method for Automatic Evaluation of Machine Translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.480349Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:69dd84c2840b27df6bfbcc499df88b3c583928672fcd4044f2d0f26ad729b195","observation_id":"d213aa31-bc98-4952-818c-e8e102eaa6aa","resolution":{"observed_at":"2026-07-31T07:16:36.480349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.482777Z","title":"METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.482777Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:575a035ace7e6fd93675d6e57fee5f1f14f26a5b40983510ef9353707e27e69d","observation_id":"9b4dcfa2-a3ea-42be-8db1-db7ff16d72e7","resolution":{"observed_at":"2026-07-31T07:16:36.482777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.485178Z","title":"ROUGE: A Package for Automatic Evaluation of Sum- maries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.485178Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:90160e5bd314207a1b3e8190093a23a3d6ac2bc8a52da455f59f9f5d554ca257","observation_id":"753d3161-6b7d-4990-9474-17283febe802","resolution":{"observed_at":"2026-07-31T07:16:36.485178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:16:36.487662Z","title":"CIDEr: Consensus-Based Image Description Evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.487662Z"},"links":{"citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:45ccab0ee834c3da7c6c6a78252c6490e4933725a9d754a481c2bcc595a3d52e","observation_id":"e4d8f0f2-2636-42e1-97d0-d2da1b6dabdf","resolution":{"observed_at":"2026-07-31T07:16:36.487662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-07-31T07:16:36.490043Z","title":"BERTScore: Evaluating Text Generation with BERT,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.490043Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:d28755ad0b2e638874d8d93db842d46fc66477b6e495f87418e7ac8d5cd49b1e","observation_id":"9a9363fe-f24f-4094-bf72-bc2ba591f98f","resolution":{"observed_at":"2026-07-31T07:16:36.490043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T11:50:56.376281Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2607.28442."}