{"as_of":"2026-08-04T15:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e1150ba8d502065175fa2137e2278d7fbd766b1e6d59ecae0fb17a5a57b67a4","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T21:31:00.764078Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T07:16:36.444118Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.27507","snapshot_observed_at":"2026-07-31T07:16:36.444118Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28442","last_updated":"2026-07-30T16:14:30Z","snapshot_observed_at":"2026-08-03T00:12:07.008223Z","submitted_at":"2026-07-30T16:14:30Z","title":"ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T07:16:36.444118Z"},"links":{"cited_paper":"/paper/2603.27507","citing_paper":"/paper/2607.28442"},"observation_digest":"sha256:aa8e4e8d0bb509bd9d9c7d902102c9c1b5632221613666cd9fdbd31aac8dbc65","observation_id":"0cf9400b-0a9b-4d0e-b5c3-a7af00965c2e","resolution":{"observed_at":"2026-07-31T07:16:36.444118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2603.27507/citation-record","integrity":"/paper/2603.27507/integrity","json":"/paper/2603.27507/citation-record.json","paper":"/paper/2603.27507"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":"7e8c940b-1067-4190-9183-93c30ea1aa82","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:e6caa0fe7c328058c703a42d15e0c51fcfafd3b6091d30a2e3eb19c52e3e89e6","observation_id":"16aa3dc8-112a-4a2d-a7fa-25e2553c55ab","resolution":{"observed_at":"2026-05-14T23:38:18.413375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:3214af85500a5c04709beecf9f90966c6fccd08e4619db55b5b06c7127b427a2","observation_id":"6aadeb4d-7842-407c-950b-957abc2fe343","resolution":{"observed_at":"2026-05-14T21:32:59.412498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:b00ae689124dbb704cbb994b375e68aaabee8130c0a15a0324fa0cc77fcee556","observation_id":"0fee2bf1-61eb-4e95-93e1-847603cf5e41","resolution":{"observed_at":"2026-05-14T21:32:59.474291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-07-10T12:07:03.432645Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:f3c6be7815e9b1448ff4a818082bed978f17c17da90ac44f7609c3d75413488d","observation_id":"7a18ae23-810a-4cc8-9b7f-fd473b22b536","resolution":{"observed_at":"2026-05-14T21:32:59.440255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":"2304.14178","doi":"10.48550/arxiv.2304.14178","metadata_source":"pith","pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","venue":"cs.CL","work_id":"74a7deb6-48be-4132-9d35-882cc5870ebd","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:56e734a94fdfc199625b99b7fc587f5200b09f6dab72ed2585d62b42ba2d72d9","observation_id":"603e4b0d-d928-43ff-96ac-d27b9c253815","resolution":{"observed_at":"2026-05-14T21:32:59.463336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2305.03726","doi":"10.48550/arxiv.2305.03726","metadata_source":"pith","pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","venue":"cs.CV","work_id":"33cb3a7a-6091-48db-a246-802bbb055f43","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:b202c175bf11a911378a54daabe7965c399b7f787f8be63294e6a39aab54951d","observation_id":"6ae8429c-9bda-42ff-aaee-d4356946c85d","resolution":{"observed_at":"2026-05-15T02:43:48.053680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":"2305.06355","doi":"10.48550/arxiv.2305.06355","metadata_source":"pith","pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VideoChat: Chat-Centric Video Understanding","venue":"cs.CV","work_id":"07461eec-156c-4054-a28e-b84bc53bf6e1","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:dd769d907864212b0c2e644cb54a84bd50c5a72cf75fbe211f50a178e62da3ea","observation_id":"11d5b250-1ed7-4655-9210-aecb585e6306","resolution":{"observed_at":"2026-05-14T21:32:59.466784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2304.08485","doi":"10.48550/arxiv.2304.08485","metadata_source":"pith","pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-07-10T11:17:03.636249Z","title":"Visual Instruction Tuning","venue":"cs.CV","work_id":"68be622d-a6dc-4a13-82de-e3054a3dc509","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:f12dbbe7171e4b0fea7ad139813e9538873e788c91d54286de53847b617abf8d","observation_id":"84620b2b-d6f2-4a23-99b7-08c196405e01","resolution":{"observed_at":"2026-05-14T21:32:59.437554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08581","last_updated":"2023-07-17T15:51:47Z","snapshot_observed_at":"2026-07-06T15:54:54.826581Z","submitted_at":"2023-07-17T15:51:47Z","title":"BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs","version":1},"cited_work":{"arxiv_id":"2307.08581","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.08581","snapshot_observed_at":"2026-07-08T02:44:27.714778Z","title":"org/CorpusID:264935635","venue":"cs.CV","work_id":"0851eb05-8a56-433a-951b-1ecd66983917","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2307.08581","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:b155392061a59a603a73e738dd18c00d513ef6c233fdcaec18a9b65740d029b9","observation_id":"56aa4678-3825-4853-b98c-4ce24168722d","resolution":{"observed_at":"2026-05-14T21:32:59.446971Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:c50b915462c1b3ef8ce49e3592658e244aeee05f5a03d744e9ab6884a0ec76b4","observation_id":"1062295b-d3f2-4bc0-ab56-8a9b9227c363","resolution":{"observed_at":"2026-05-14T21:32:59.360234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2310.03744","doi":"10.48550/arxiv.2310.03744","metadata_source":"pith","pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Improved Baselines with Visual Instruction Tuning","venue":"cs.CV","work_id":"5baeaa33-5986-44a3-85a4-fcabd6fc1e8d","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:e16c6b65650c1b2a0e749242acc2aca4248b2fa6d8da4466c971f0d68186ab10","observation_id":"f517c01a-f9c3-44e2-be25-65b4ac68f3db","resolution":{"observed_at":"2026-05-14T21:32:59.423703Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-07-06T16:01:22.379561Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:112848543fd74b490192973a2d18256373590ea9b3619e2374703cd060be46c8","observation_id":"708a6f30-9b32-4808-ba10-c61796725e5d","resolution":{"observed_at":"2026-05-14T21:32:59.377974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":"2310.07704","doi":"10.48550/arxiv.2310.07704","metadata_source":"pith","pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","venue":"cs.CV","work_id":"0db2bf55-f649-4428-bcc9-688724b38e57","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:a970f72cbbb6ba5c929e6ff31a42ad63a3dfb84375699e8ca6f073a0deaeb05f","observation_id":"e78b1977-d0e1-4623-80a2-a7a49a5740f0","resolution":{"observed_at":"2026-05-15T11:29:05.422888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"f8575480-d4f0-4eba-afca-1082142b67aa","year":2020},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:584f43b0df43586281cfe457d066aaa81a85f77ff755bb6ffdacbff8915ed9fb","observation_id":"6f3e2468-dfa2-49f4-ab46-e0270013755c","resolution":{"observed_at":"2026-05-14T23:38:18.388670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi3drefer: Grounding text description to multiple 3d objects","venue":null,"work_id":"fab15203-a6cd-4ef9-bf9a-36d42d57501a","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:8d0c184b1d8409184501d8870b17b6402d440c2e6e0095e99254324d61856daa","observation_id":"58a9b2d0-0451-46aa-958f-05af1ee84c92","resolution":{"observed_at":"2026-05-14T23:38:18.384644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real- world scenes","venue":null,"work_id":"d4cf26a4-2066-45fe-b403-41b96775dc8f","year":2020},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:adf8f897a182eed96b21791d781d82c856f98c9821d3f9052d64cef5f1bb1b9b","observation_id":"5dbac903-47f7-42b9-9393-5331806da6ed","resolution":{"observed_at":"2026-05-14T23:38:18.352199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scan2cap: Context- aware dense captioning in rgb-d scans","venue":null,"work_id":"f1688d4f-84be-40ef-85de-f25feb6a5641","year":2021},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:b45e8e1c3008ec520df45eb5536e26df1649871e3cc403ee27a8a3270dab1e45","observation_id":"b807cb88-8b5c-4fd8-92fd-b6ef966219a4","resolution":{"observed_at":"2026-05-14T23:38:18.430111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"f008d97f-b4c3-48d0-95b6-45623e0d8f03","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:0b8b6fc3a4df4e5b97f64ffd49c6000b03b08ea837ea110747a973797de0eab1","observation_id":"ec5de08d-4130-4acc-bbfb-c499d5a8cb20","resolution":{"observed_at":"2026-05-14T23:38:18.325082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-07-06T14:05:02.813765Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:f4ea5d56f9ed4ce5db0e5a1afc42b2e305705b04df63db9ed29c9f476dfb2025","observation_id":"6692311b-c692-414b-9e12-bbd1b51aa19b","resolution":{"observed_at":"2026-05-14T21:32:59.431171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18651","last_updated":"2023-11-30T16:00:23Z","snapshot_observed_at":"2026-07-06T16:55:05.210009Z","submitted_at":"2023-11-30T16:00:23Z","title":"LL3DA: Visual Interactive Instruction Tuning for Omni-3D Understanding, Reasoning, and Planning","version":1},"cited_work":{"arxiv_id":"2311.18651","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.18651","snapshot_observed_at":"2026-07-08T02:44:27.720983Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding, reasoning, and planning","venue":"cs.CV","work_id":"f3fcbeed-6341-4f1d-8297-6ebb676b745b","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2311.18651","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:9e0272145cbfb691557893f48f7ed2b7d08563361ecb4fe190c145eb0dcfee6f","observation_id":"ff6de004-3de8-42cc-926a-e86596b02e19","resolution":{"observed_at":"2026-05-14T21:32:59.427774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-02T11:57:50.333488Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":"2311.12871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-07-08T02:44:27.664173Z","title":"An Embodied Generalist Agent in 3D World","venue":"cs.CV","work_id":"2c1392ae-d82d-4f8f-aef7-75a5ff0e5d2e","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:a1f39e680eecbc31ecf6e0e557afe63bab3506c0050c23052a789be15995fc7d","observation_id":"d7218bc5-1ec5-48ce-8ea3-691b7b68ae46","resolution":{"observed_at":"2026-05-17T14:22:18.773673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-02T00:22:05.597306Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":"2308.08769","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-07-08T01:44:26.228828Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes","venue":"cs.CV","work_id":"9f789861-b3ae-4074-9d4c-9a1f5736e37d","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:43f9687c181f2eb076c8bc8b1a3a8c14768f4417eefd48d0ebfa0eb1d1f061f0","observation_id":"109c2f19-c992-43a6-a4fc-f20609c1acac","resolution":{"observed_at":"2026-05-14T21:32:59.420455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12981","last_updated":"2023-07-24T17:59:02Z","snapshot_observed_at":"2026-08-03T03:13:48.042761Z","submitted_at":"2023-07-24T17:59:02Z","title":"3D-LLM: Injecting the 3D World into Large Language Models","version":1},"cited_work":{"arxiv_id":"2307.12981","doi":"10.48550/arxiv.2307.12981","metadata_source":"pith","pith_arxiv_id":"2307.12981","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"3d-llm: Inject- ing the 3d world into large language models","venue":"cs.CV","work_id":"f5b30bc7-d8e1-451f-b67a-43775baddd50","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2307.12981","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:f8d1752ee6f684436a5665416e3dcc34415dc23c0af13f7ab1d4b483b218b562","observation_id":"f8549aaf-f536-48b2-85a0-2b1c00ebc3ec","resolution":{"observed_at":"2026-05-14T21:32:59.373925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:51.375059+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:51.375059+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"409fd49f-f4ea-40da-a453-ebb9885705e5","year":2024},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:bd451741c7699ad638cffbcdc74a7120f9126c47ca99c494018dd5d1b22cd5cf","observation_id":"ca0ba364-1786-4756-aea1-a7c1e37193e8","resolution":{"observed_at":"2026-05-14T23:38:18.425578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mask3d: Mask transformer for 3d semantic instance segmentation","venue":null,"work_id":"40c26bea-9598-4249-9e43-5f6e5f649a1d","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:c5bde9f50e05d528664a3e1c173a88831dbd61ce41142674d70add644ba3d5ee","observation_id":"ca7453c6-b447-4d92-9b99-6c2e28ae05ae","resolution":{"observed_at":"2026-05-14T23:38:18.373125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06773","last_updated":"2023-10-10T16:49:21Z","snapshot_observed_at":"2026-08-01T22:25:28.518833Z","submitted_at":"2023-10-10T16:49:21Z","title":"Uni3D: Exploring Unified 3D Representation at Scale","version":1},"cited_work":{"arxiv_id":"2310.06773","doi":"10.48550/arxiv.2310.06773","metadata_source":"pith","pith_arxiv_id":"2310.06773","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Uni3d: Exploring unified 3d representation at scale","venue":"cs.CV","work_id":"90d21cdb-25b2-450c-8f61-7abddbbcf7e3","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2310.06773","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:fd3bb82c5bc0fa309848d02a9f21576e2e56a5adce9699b20084f898c97e6398","observation_id":"20484126-c8cd-431b-b1e4-db100ee229a6","resolution":{"observed_at":"2026-05-14T21:32:59.406470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:46:13.412147Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"0ba42a4a-709c-40fe-a4ba-db11a15fd522","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:0b9f797f0fce10d9f5e7005ab188afe8f439955178d459e76779fd8112cc5e8f","observation_id":"67bc82bf-57ec-431f-ae29-86e6cfb0e795","resolution":{"observed_at":"2026-05-14T23:38:18.393027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-07-06T19:51:05.604758Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":"2411.10440","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-07-04T16:59:58.575310Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","venue":"cs.CV","work_id":"a650e873-dbbf-4963-af68-3896dcd4975b","year":2024},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:79261b6e2d6ad8a487cc49ea64bec88ca00f9cc44fbef44448d7d8eedb4eae7d","observation_id":"86a452fc-3963-4cd9-b041-be127654e63b","resolution":{"observed_at":"2026-05-16T11:35:26.109012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2411.14432","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-07-03T20:18:57.819941Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models","venue":null,"work_id":"047ab104-4f99-4eb6-8313-af97248f3485","year":2025},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:f7d2df41db7660ae1bcec10451f9ca52d738075cba01f0c1607a8d586b84a0dc","observation_id":"845b5c78-7297-445e-8109-9ba35228f073","resolution":{"observed_at":"2026-05-14T21:32:59.478593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openai o1","venue":null,"work_id":"7bd2bf5f-8e9f-4819-af80-f148b748575d","year":2025},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:828efbc3650522ab64f056c85f6ef90663a2a45a17e6498c2b636c613b496042","observation_id":"5982d1e5-e30b-468e-9eca-f9a903a4799a","resolution":{"observed_at":"2026-05-14T23:38:18.473606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":"784f707d-c268-4bf3-b7ec-6f1c671979e3","year":2025},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:2b79e488235ce29c87ad18d0a83ba5b49d992f583476fe69236bb0e17a66449f","observation_id":"8e4c536d-6e8f-448e-b4af-ee974f3581d2","resolution":{"observed_at":"2026-05-14T23:38:18.348045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"45f05cd3-b3d9-45a6-bbe8-b4acf8feae35","year":2017},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:b81abb4d77ad2910191da649af083c7849860adc1249020721ad9a1f83e75aa1","observation_id":"c18351e8-3af1-4581-9f24-e252d6df0b67","resolution":{"observed_at":"2026-05-14T23:38:18.289031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:12:44.956404Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":"589847c3-3e3c-42b1-b07c-6fe5a769b6c1","year":2025},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:673d0e96c9c5110341daae0624dec0d19c1a38b0f7d579724d1ca29dbe194717","observation_id":"f4530d82-d8c6-42ca-bcd8-5db962f1e896","resolution":{"observed_at":"2026-05-14T23:38:18.343726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text-guided graph neural networks for referring 3d instance segmentation","venue":null,"work_id":"5df7dd72-93be-44df-9b69-0d3ef6ef930f","year":2021},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:1ef3f1e957147575e8c24dd7ac0699e260946cd14c53b523128f9d807c04dd83","observation_id":"c22aba20-c486-4ef2-8ed5-1514b3794cfe","resolution":{"observed_at":"2026-05-14T23:38:18.448513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-view transformer for 3d visual grounding","venue":null,"work_id":"38cf6032-692d-4f88-81ea-95e223a01e3b","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:da658aacba706f0daff9edf054b423ca06357568c415903958ea68e479f1f12c","observation_id":"644acb1b-7296-4740-a89a-e1362384f5b7","resolution":{"observed_at":"2026-05-14T23:38:18.434036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language conditioned spatial relation reasoning for 3d object grounding","venue":null,"work_id":"cdb8807a-5abd-4a09-9302-1101161b61e9","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:48ed3a643e8f02042742fc8aecb289d3198daf56b95f4d9e012ba43e02fa2056","observation_id":"7b67c4af-04b1-4dbd-a7cb-395d1d25dafe","resolution":{"observed_at":"2026-05-14T23:38:18.421533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13363","last_updated":"2023-07-25T09:33:25Z","snapshot_observed_at":"2026-08-03T14:35:47.250280Z","submitted_at":"2023-07-25T09:33:25Z","title":"3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding","version":1},"cited_work":{"arxiv_id":"2307.13363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.13363","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3drp-net: 3d relative position-aware network for 3d visual grounding","venue":null,"work_id":"8a6d2a73-a6fa-471e-a4a8-b09902f049a0","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2307.13363","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:04aa0b48e87c4fd16c2fd532aa3bd3e31a20173b39d7bef781edb5a6fc38f60f","observation_id":"c1583646-69a3-439e-bed7-f2e5cef40f0e","resolution":{"observed_at":"2026-05-14T21:32:59.457187Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3dvg-transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":"3662f1e1-98a7-4467-bd07-ae154d5c7524","year":2021},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:901df5a4298ce762ce5dac5e56a38988fe5a6c4d897a0eb4f1f281c5b02a99c4","observation_id":"d649e7b5-2d42-4444-a584-ca9082302440","resolution":{"observed_at":"2026-05-14T23:38:18.452520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distilling coarse-to-fine semantic matching knowledge for weakly super- vised 3d visual grounding","venue":null,"work_id":"aad6736d-4443-408d-b69a-f297ccd8e4c4","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:9d8e06e132f10b3725025c431ab5bd9b203a85c30b5bf11603bba2dcf1ac345f","observation_id":"6613a71e-cf1c-4dca-85fb-d45ccd811202","resolution":{"observed_at":"2026-05-14T23:38:18.481599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04561","last_updated":"2024-07-16T08:14:11Z","snapshot_observed_at":"2026-07-06T16:16:18.565073Z","submitted_at":"2023-09-08T19:27:01Z","title":"Four Ways to Improve Verbo-visual Fusion for Dense 3D Visual Grounding","version":3},"cited_work":{"arxiv_id":"2309.04561","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.04561","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Three ways to improve verbo-visual fusion for dense 3d visual grounding","venue":null,"work_id":"73cb6b5e-ee92-4e6b-85f1-9417d2bf14f6","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2309.04561","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:82e3b9396c5285f08569e7d11ea727615a878d90ab3d610eb1a8aa908b6f912a","observation_id":"182fbc81-06c2-4ee0-8c8c-dd153e32baff","resolution":{"observed_at":"2026-05-14T21:32:59.400054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-trans2cap: Cross-modal knowledge transfer using transformer for 3d dense captioning","venue":null,"work_id":"7d02e41b-2007-47f0-8056-a967a4bd5503","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:68559111a50e926abc3615039356ba59b64143cea65fcfaaee68caad3ae6deab","observation_id":"5fe9ebf6-8b2a-4974-8950-1f1f536636f7","resolution":{"observed_at":"2026-05-14T23:38:18.329454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"More: Multi-order relation mining for dense captioning in 3d scenes","venue":null,"work_id":"ab23e75d-6063-4bd7-8d81-d391133eef97","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:f6cb7e217cbc15171b48f99395f916e88bd848ec00792aa04f4a37043bf2c62c","observation_id":"7776047d-b9b6-419f-b3f8-426a38769b15","resolution":{"observed_at":"2026-05-14T23:38:18.456600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end 3d dense captioning with vote2cap-detr","venue":null,"work_id":"366e180e-bba7-47d3-adc8-76a672f91053","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:1741842a9471c1342c430f871eea1103e49f46652d1e7d16d7799b8dcffc1099","observation_id":"239814d5-b26a-45c2-a53a-496472ff87ab","resolution":{"observed_at":"2026-05-14T23:38:18.401559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V ote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning","venue":null,"work_id":"5b368641-24ae-49f6-bf0d-581eba460db4","year":2024},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:79c54284b710286f4d7a490d8b2c76d36d5dba7d82228b85f8368261a609dc65","observation_id":"35fb9b4b-74d8-416f-8b6a-aa077934eb19","resolution":{"observed_at":"2026-05-14T23:38:18.364680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-guided vision-language pre-training for question answering in 3d scenes","venue":null,"work_id":"ee8a8d08-a73a-432e-a9f2-2c2e4aab094f","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:c32d9675a60249f3de62520ac427ca1af4cd8c2664e699de5c646380127e0650","observation_id":"389ba71c-af69-4f43-a89e-bf5b28d5862c","resolution":{"observed_at":"2026-05-14T23:38:18.460679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3djcg: A unified framework for joint dense captioning and visual grounding on 3d point clouds","venue":null,"work_id":"b5906f1c-55d2-46b4-ab7b-b654c25c343d","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:3ee249e75971d980770911eec306e4a7f7c3a654e08bd5d9734ea7119d6f480c","observation_id":"3b1af93f-4963-41a6-a8c7-967be0e39941","resolution":{"observed_at":"2026-05-14T23:38:18.320017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D3net: A unified speaker-listener architecture for 3d dense captioning and visual grounding","venue":null,"work_id":"4362a435-a63e-4833-a0de-7e70b84a8892","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:c7ec432a8b5fde1c7f55d82726850df3f583afa360a65aed9ebec3db4cf1c9d4","observation_id":"44aad0be-7ca0-4686-a864-00d99a5befe1","resolution":{"observed_at":"2026-05-14T23:38:18.360377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d-vista: Pre- trained transformer for 3d vision and text alignment","venue":null,"work_id":"80293abe-5161-469c-b2cb-38693ce07e01","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:32f29eeaeafa30d8dc85b616427601f058f20a612da1afdc2629fd779699ca0f","observation_id":"f70a4011-4e10-4031-946e-dfcc52af0f34","resolution":{"observed_at":"2026-05-14T23:38:18.469417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Context-aware alignment and mutual masking for 3d-language pre-training","venue":null,"work_id":"58885f10-6254-4d47-a6e3-51ab50c61ff1","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:a6e07761e40f46e5f12573e14488d52104f7afe70e0c91991d8fd88ec9c3b27f","observation_id":"f18c41f6-ea42-4ad2-a03f-2e6a1aaa39fd","resolution":{"observed_at":"2026-05-14T23:38:18.405458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.23919/cje.2025.00.336","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on fine-grained multimodal large language models","venue":null,"work_id":"60ef88cc-622f-4e69-9b23-ed42b62a51d8","year":2026},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:7c8c0bc4f5d0f21b9c4c9cf47fc88801f7a5ebf425b2ea81d722b96b9246134d","observation_id":"27354c12-1c47-4ecf-87e5-bcbd9b6ad2e1","resolution":{"observed_at":"2026-05-14T21:32:58.940800Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03905","last_updated":"2023-09-11T20:25:16Z","snapshot_observed_at":"2026-07-06T16:15:50.904062Z","submitted_at":"2023-09-07T17:59:45Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2309.03905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.03905","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagebind-llm: Multi-modality instruction tun- ing","venue":null,"work_id":"1cdf5dff-7482-43ff-b430-3a3911c5d927","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2309.03905","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:1b7cd7cb8a6b4edd33a46cfd2ea202459c6c4c478fce202a7ab7109d687e1bc1","observation_id":"ba682909-3eb1-441a-8ff6-940dd1e335e9","resolution":{"observed_at":"2026-05-14T21:32:59.382205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:a81027fa8b6bc4b92c3175f4f9282f6d3cf6d992e125cba8759e970f24800b38","observation_id":"2a95df81-557a-4628-91a3-784c68deacc3","resolution":{"observed_at":"2026-05-14T21:32:59.409437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16911","last_updated":"2024-09-06T22:45:43Z","snapshot_observed_at":"2026-07-06T16:12:55.132006Z","submitted_at":"2023-08-31T17:59:46Z","title":"PointLLM: Empowering Large Language Models to Understand Point Clouds","version":3},"cited_work":{"arxiv_id":"2308.16911","doi":"10.48550/arxiv.2308.16911","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.16911","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"2024.doi:10.48550/arXiv.2308.16911","venue":null,"work_id":"ce992739-1a55-4f67-9b72-a7847c57a23a","year":2024},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2308.16911","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:737b861256d47f7555e4bca9543bb136e3ecf34df2a4c62d55ffc01d7ed355de","observation_id":"fb7f232f-1d86-428d-a350-aee2585f70f7","resolution":{"observed_at":"2026-05-14T21:32:59.393660Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-01T15:00:49.359678Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":"2405.10370","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-07-08T02:44:27.704633Z","title":"Grounded 3d-llm with referent tokens","venue":"cs.CV","work_id":"689e0390-ddcd-4622-aba7-18a4c136d58e","year":2024},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:5e644a0a8a90fc7529dc6c732e9e5ff06ad8eabf169a8bc0ca3e8caadc81e113","observation_id":"e5f1089f-3bcc-48ec-a7cd-0fb2861ab47e","resolution":{"observed_at":"2026-05-14T21:32:59.390113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-01T22:27:48.245449Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":"2403.11401","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-07-09T22:06:35.185955Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":"cs.CV","work_id":"9a869478-2848-4347-9eb4-d2e778992d25","year":2024},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:d9228c9ded4fc4a6bab251629edef2ed224d94b5a78c0ceda559a84801847860","observation_id":"56f6f3e7-a376-44f7-8870-4ee557420637","resolution":{"observed_at":"2026-05-14T21:32:59.454076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.23919/cje.2025.00.215","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T15:19:55.918282Z","title":"Towards reliable multimodal intelligence via uncertainty-aware inference","venue":null,"work_id":"452130ac-07db-4f23-9586-5e0c439e17a2","year":2026},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:4779467e05849232de32484d01f9735dd32f51465e9a2c8bcec555a4c57a5abe","observation_id":"5d1b91f0-8416-40d0-a92f-658e7cb217bb","resolution":{"observed_at":"2026-05-14T21:32:58.937969Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.23919/cje.2025.00","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Formation-guided multimodal representation learning for group action quality assessment","venue":null,"work_id":"78e7e557-7a16-4378-ba12-e39da7491363","year":2026},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:98f3fbaa837e828930c061b33239ea7b5e9d4b352d8af240e132c44fefe5603a","observation_id":"5b59aea3-f7a6-4afc-a370-7ffbe29cc824","resolution":{"observed_at":"2026-05-14T21:32:58.934628Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Point-bert: Pre-training 3d point cloud transformers with masked point modeling","venue":null,"work_id":"6a2bf079-6919-40fa-b530-12381b57e945","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:8ed4c52fd47b40125f735b6c93aa31426ccd58dc02e4e0aa84aa00faba86ba72","observation_id":"677ceca4-5977-436a-a1b4-4f77eabf31dd","resolution":{"observed_at":"2026-05-14T23:38:18.409289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked autoen- coders for point cloud self-supervised learning","venue":null,"work_id":"3d02fd46-2bd9-4f00-a42c-9eb41f6fe06b","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:4c55d64d5eb822b12dbca19c85c07271aac71b031b3a4fb183bda00f42c681f3","observation_id":"bff9e9b1-9ea3-4aed-a536-4f4be48a5d14","resolution":{"observed_at":"2026-05-14T23:38:18.356288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Point-m2ae: multi-scale masked autoencoders for hierarchical point cloud pre-training","venue":null,"work_id":"11b67979-ecdf-411b-8862-b995c93d41a2","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:5bcf8f519e6b5922e14eda6a80b9911b7906924de30c5140e388e818e5732777","observation_id":"9763cc4d-e3d2-4c5b-a665-d9fc7edbcf29","resolution":{"observed_at":"2026-05-14T23:38:18.477561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ulip: Learning a unified representation of language, images, and point clouds for 3d understanding","venue":null,"work_id":"0e4b3404-b520-4208-8957-3ad5dc377ef7","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:be7a67846ae98a28a7b229b24b390ace7416e79546899e2ca7df8334fbf400cd","observation_id":"0d8e6480-efec-4036-a62e-b3ccd57c8991","resolution":{"observed_at":"2026-05-14T23:38:18.438269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10764","last_updated":"2023-06-16T23:31:40Z","snapshot_observed_at":"2026-08-04T10:59:33.837634Z","submitted_at":"2023-05-18T07:07:19Z","title":"OpenShape: Scaling Up 3D Shape Representation Towards Open-World Understanding","version":2},"cited_work":{"arxiv_id":"2305.10764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10764","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openshape: Scaling up 3d shape representation towards open-world understanding","venue":null,"work_id":"7fd62044-a974-4fb4-9e0c-1f1212e47927","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2305.10764","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:880b21f33ad2e243f71cde1ad4720aed67d8e001e561d15ec1d03be6c2b0d46c","observation_id":"c9c1b719-29d0-4b9b-bbf8-7262063ba30e","resolution":{"observed_at":"2026-05-14T21:32:59.369561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:02:57.805167Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"1eb3f634-f943-4366-8ebf-9103f721f4fd","year":2021},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:a1648bb56bf318c54b1b4c2c11be26d3fec119e2f85a83cc3b3d00515a9fb5fe","observation_id":"31a4d617-3c6a-4192-8ec7-b5355f6e3aee","resolution":{"observed_at":"2026-05-14T23:38:18.417738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"df57760a-2841-4666-9d1f-a8de26e01d7a","year":2024},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:05667fd6ba11b32f8c2c2475e98722874c2cd16feca6c8ea199f2e734e469fe2","observation_id":"9c1a45b5-07d4-4ece-9dc7-dddcea3e4cfc","resolution":{"observed_at":"2026-05-14T23:38:18.397407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounded language-image pre-training","venue":null,"work_id":"a1e23ea4-f25b-4279-a7f9-43e4886231d8","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:fda781d68260dce9a0d9e8ff632556c27252fecd594fc0c244f06c7e0a568d0a","observation_id":"fef9480e-27ea-4279-bd78-437b308e4736","resolution":{"observed_at":"2026-05-14T23:38:18.381011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:217e64bc31bb71a3dd5e6c0bce9c0fb4e683134e2363af07c78b795b7b224d11","observation_id":"0b1777ac-44ed-46da-87e6-15c09d6787e5","resolution":{"observed_at":"2026-05-14T21:32:59.416888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":"dc8b5a30-2766-4a17-9d45-93e76cc82b3b","year":2015},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:099341021a9aa2bdaab697b819c4f452c3429fdb1351931cf85cb5d93c137da8","observation_id":"f6eebdc6-848c-4e0d-baa4-be7f4bfadea9","resolution":{"observed_at":"2026-05-14T23:38:18.369123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T05:10:42.921945Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"6ef6c7e1-d7af-4ed2-a958-86a2285b5ebc","year":2002},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:154c45836a429d1a9c40e7db83a1f216e7edeee6e917cb8d6d2ac984f58ce192","observation_id":"5b27c794-257f-498e-8a0d-9968aceba22d","resolution":{"observed_at":"2026-05-14T23:38:18.339405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:cd6210f18262b3e3aa878c59110922f203bc98f0b6ac43a8779ff3751a1e08c4","observation_id":"0b99d65a-7151-424f-b512-32f7ca26b936","resolution":{"observed_at":"2026-05-14T21:32:59.470401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:b296eed17f984ee9a4fba60a5a9efd077e873cb3fd68b70a117f1a3caa894f65","observation_id":"601c0069-d347-4286-8446-25c651a7387e","resolution":{"observed_at":"2026-05-14T21:32:59.364986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rio: 3d object instance re-localization in changing indoor environments","venue":null,"work_id":"7de5d85b-29aa-406f-89a4-4089c0fce13d","year":2019},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:8171f79e02c143963513c5803c7e2724127f8ae27226f8db109194ce7391f0c5","observation_id":"cba2dd93-57a0-4401-bb22-4ab1420a4258","resolution":{"observed_at":"2026-05-14T23:38:18.442627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:01:36.965348Z","title":"Nuscenes-qa: A multi-modal visual question answering benchmark for autonomous driving scenario","venue":null,"work_id":"8c437735-dfd6-4467-9e06-f9358dada985","year":2024},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:ec1ee73c828d4063d9b8b20de26c044fed4a24574128dd231b18640701338870","observation_id":"ebde41d2-be6f-4bec-9919-75cee9bb9b16","resolution":{"observed_at":"2026-05-14T23:38:18.333876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lidar-llm: Exploring the potential of large language models for 3d lidar understanding","venue":null,"work_id":"d21cfda6-f0fe-4a09-a9a4-78c4e64dc8ca","year":2025},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:548522ff0ca43bc74e90a18b5d364389873ea696f988688d38b830a356b6d404","observation_id":"50275376-df9f-4088-903e-8e9ed5ccf014","resolution":{"observed_at":"2026-05-14T23:38:18.464639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03272","last_updated":"2024-09-05T06:30:01Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:30:01Z","title":"OccLLaMA: An Occupancy-Language-Action Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2409.03272","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03272","snapshot_observed_at":"2026-07-02T12:46:57.193503Z","title":"Occllama: An occupancy-language-action generative world model for au- tonomous driving","venue":null,"work_id":"5fc5e45b-2831-45a2-bd1c-b8697eee8c10","year":2024},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2409.03272","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:0e4ebd4ee1c0a97f989308bedc11c36bccfb799d1786f8de851202a52098f0db","observation_id":"3579223c-cd8d-4521-be4a-69f92a597ae6","resolution":{"observed_at":"2026-05-14T21:32:59.482555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lscenellm: Enhancing large 3d scene understanding using adaptive visual preferences","venue":null,"work_id":"d1137376-5af4-442c-9973-4156229f1632","year":2025},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:85329c37cdc21c2cbd79859d101353fed4f678e734127848ef9318512322adf0","observation_id":"fb05a9f4-3725-4a25-9033-f69062f51098","resolution":{"observed_at":"2026-05-14T23:38:18.313425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23463","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:36:59.848781Z","title":"Opendrivevla: Towards end-to-end au- tonomous driving with large vision language action model","venue":null,"work_id":"67021d38-441c-4135-9cf6-081c176c598c","year":2025},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:1918f42d48e2311ab4134c9959cd066738c3d91eaaddf2aa5ef60f84d2b127d0","observation_id":"a7b28b3f-c286-42bf-baa0-0a9d7ef22b0a","resolution":{"observed_at":"2026-05-14T21:32:59.386757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":"2304.15010","doi":"10.48550/arxiv.2304.15010","metadata_source":"pith","pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","venue":"cs.CV","work_id":"0fe2cfd8-d442-4ceb-b1a9-a465704f39b2","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:23694670ced4d6d7f73220f1b0a1f79bb2f269fadf0d8029af2e8352ed0f983c","observation_id":"8f745aad-cdc2-4d94-bca7-845173a14791","resolution":{"observed_at":"2026-05-15T08:41:05.025329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tracking anything with decoupled video segmentation","venue":null,"work_id":"52fad3d4-558e-4ae8-a10b-668fb637fb41","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:1cde0953156d2c808bfee665ae38d50da92ae09a29798b763497089273785d15","observation_id":"8c9b2c79-9979-482d-99bf-a2bbfe1ccac1","resolution":{"observed_at":"2026-05-14T23:38:18.377281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":35,"verified_fuzzy":41},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 1 inbound Pith citation observation for arXiv:2603.27507."}