{"as_of":"2026-08-22T15:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dbe1226679f9b93d258a8fa8b8e47d1802db9bd4e652f8711a904f9d6e8a497d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:13:36.201254Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T22:06:35.189248Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.02329","last_updated":"2023-06-04T11:08:53Z","snapshot_observed_at":"2026-08-16T15:26:48.033888Z","submitted_at":"2023-06-04T11:08:53Z","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02329","snapshot_observed_at":"2026-08-12T11:13:36.201254Z","title":"Multi-clip: Contrastive vision-language pre-training for question answering tasks in 3D scenes.arXiv preprint arXiv:2306.02329, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-21T01:46:31.862731Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.201254Z"},"links":{"cited_paper":"/paper/2306.02329","citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:48526de891e966ad3a40eb43106331630092145be6fc31bd9ab04ff028635669","observation_id":"6148387c-a619-43d0-b9ce-9d56e1a5d581","resolution":{"observed_at":"2026-08-12T11:13:36.201254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02329","last_updated":"2023-06-04T11:08:53Z","snapshot_observed_at":"2026-08-16T15:26:48.033888Z","submitted_at":"2023-06-04T11:08:53Z","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02329","snapshot_observed_at":"2026-08-12T05:52:38.993892Z","title":"Multi-clip: Contrastive vision-language pre-training for ques- tion answering tasks in 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-20T06:27:21.108873Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.993892Z"},"links":{"cited_paper":"/paper/2306.02329","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:3eec47d6c587991c779f38134ec127eff139a51e6b8e0f362ae7a0c23481815c","observation_id":"20f75eea-3e90-4471-8d06-ff8dfebe86f7","resolution":{"observed_at":"2026-08-12T05:52:38.993892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02329","last_updated":"2023-06-04T11:08:53Z","snapshot_observed_at":"2026-08-16T15:26:48.033888Z","submitted_at":"2023-06-04T11:08:53Z","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02329","snapshot_observed_at":"2026-08-11T04:45:36.628677Z","title":"Multi-clip: Contrastive vision-language pre-training for question answering tasks in 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.628677Z"},"links":{"cited_paper":"/paper/2306.02329","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:5ef7997780e55c2633fd3ed81831ee511ef8aa7eaa5e54301ce7e65925ae1892","observation_id":"31f07439-f6bb-463c-9afc-7355d1654b23","resolution":{"observed_at":"2026-08-11T04:45:36.628677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02329","last_updated":"2023-06-04T11:08:53Z","snapshot_observed_at":"2026-08-16T15:26:48.033888Z","submitted_at":"2023-06-04T11:08:53Z","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02329","snapshot_observed_at":"2026-08-09T19:24:17.408439Z","title":"Multi-clip: Contrastive vision- languagepre-trainingforquestionansweringtasksin3dscenes.arXiv preprint arXiv:2306.02329","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-15T20:59:44.756476Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.408439Z"},"links":{"cited_paper":"/paper/2306.02329","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:db73b7db545716bf9fee0276c3040c0cb0eadb849d1449bdd8676e2a2f862b2d","observation_id":"3594b23b-b802-4e45-826e-28eac4984134","resolution":{"observed_at":"2026-08-09T19:24:17.408439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02329","last_updated":"2023-06-04T11:08:53Z","snapshot_observed_at":"2026-08-16T15:26:48.033888Z","submitted_at":"2023-06-04T11:08:53Z","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02329","snapshot_observed_at":"2026-08-06T20:46:00.146442Z","title":"ArXivabs/2306.02329 (2023), https://api","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01800","last_updated":"2025-07-02T15:20:08Z","snapshot_observed_at":"2026-08-18T02:45:46.537411Z","submitted_at":"2025-07-02T15:20:08Z","title":"HCNQA: Enhancing 3D VQA with Hierarchical Concentration Narrowing Supervision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:00.146442Z"},"links":{"cited_paper":"/paper/2306.02329","citing_paper":"/paper/2507.01800"},"observation_digest":"sha256:85b371790793b8bac8e9ed0b6073350d42ba2e9a5db6edc2d9c10db8a1ab5454","observation_id":"4f15e90a-2134-49f6-bbf5-101a94ae089a","resolution":{"observed_at":"2026-08-06T20:46:00.146442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02329","last_updated":"2023-06-04T11:08:53Z","snapshot_observed_at":"2026-08-16T15:26:48.033888Z","submitted_at":"2023-06-04T11:08:53Z","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes","version":1},"cited_work":{"arxiv_id":"2306.02329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02329","snapshot_observed_at":"2026-07-09T22:06:35.189248Z","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes","venue":"cs.CV","work_id":"e5306dea-fd06-4829-afff-392f5789b124","year":2023},"citing_paper":{"arxiv_id":"2607.07001","last_updated":"2026-07-08T04:51:24Z","snapshot_observed_at":"2026-08-04T06:04:34.551511Z","submitted_at":"2026-07-08T04:51:24Z","title":"Ego-Human Motion Prediction with 3D-Aware LLM","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T22:04:11.433376Z"},"links":{"cited_paper":"/paper/2306.02329","citing_paper":"/paper/2607.07001"},"observation_digest":"sha256:e1c8a0e96c449d2cc67f156b04833a1a1385e20eefb3e907a01de1c8a1906dff","observation_id":"12cf7870-71df-45ce-94cb-43c543c842dc","resolution":{"observed_at":"2026-07-09T22:06:35.192883Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2306.02329/citation-record","integrity":"/paper/2306.02329/integrity","json":"/paper/2306.02329/citation-record.json","paper":"/paper/2306.02329"},"outbound":[],"paper":{"arxiv_id":"2306.02329","last_updated":"2023-06-04T11:08:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T15:26:48.033888Z","submitted_at":"2023-06-04T11:08:53Z","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2306.02329."}